logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

张量并行、数据并行、流水线并行 对比

本文对比了深度学习大模型训练的三种主要并行策略:张量并行、数据并行和流水线并行。张量并行通过层内切分解决单层显存不足问题,数据并行通过样本分配提高吞吐量,流水线并行通过层间切分处理超大模型。三种方法在并行粒度、适用场景和通信开销上各有特点,现代大模型训练通常组合使用这些策略。例如175B参数模型可同时采用张量并行(层拆分)、流水线并行(阶段划分)和数据并行(梯度同步),实现在64张显卡上的高效训练

#人工智能
PyTorch 最小模型转 ONNX 完整样例

本文介绍了ONNX(开放神经网络交换格式)的基本概念和使用方法。ONNX是一种开源通用的深度学习模型标准格式,可实现不同训练框架间的模型迁移和高效部署。文章详细演示了如何将PyTorch模型导出为ONNX格式,包括环境配置、极简模型定义、导出代码、格式验证、模型简化以及使用ONNX Runtime进行推理测试等完整流程。关键参数说明和扩展示例进一步帮助开发者理解ONNX的实际应用。ONNX通过标准

文章图片
#pytorch#人工智能#python
一文看明白PyTorch 模型设计训练保存加载预测

本文介绍了一个基于PyTorch的三层全连接神经网络实现。模型结构包含128→96→64→32的线性层,每层后接ReLU激活和20%的Dropout。代码演示了完整的训练流程(使用随机数据),包括模型定义、数据加载、训练循环(20个epoch),以及模型保存与加载预测。关键点包括:训练后保存权重为.pth文件、加载时需重建模型结构、预测时切换eval()模式禁用Dropout、使用no_grad(

文章图片
#pytorch#深度学习#机器学习
PyTorch 动态量化(Dynamic Quantization)

PyTorch的动态量化(Dynamic Quantization)是一种后训练量化方法,它仅量化模型权重为int8,而激活值在前向传播时动态转换为int8进行计算。这种方法无需重新训练,适用于CPU推理场景,能显著减小模型大小(3-4倍)并提升推理速度(2-4倍)。特别适合全连接层、LSTM和Transformer结构,但对卷积层效果有限。PyTorch通过quantize_dynamic函数实

文章图片
#pytorch#人工智能#python
基于海光 DCU+qwen3.6 实现ugc社区内容风控的实践

摘要: 本文提出了一套基于海光DCU和Qwen3.6的UGC社区内容风控系统架构,覆盖文本、图片、视频、行为等多模态风险检测。系统采用五层架构设计(接入层→预处理层→推理层→策略引擎→处置层),利用DCU加速Qwen3.6的大模型推理,实现高吞吐(动态批处理优化3-10倍)和低延迟(P99<300ms)。Qwen3.6的核心价值在于语义理解能力,可识别隐晦违规内容(如谐音、黑话)和多模态组合风险,

文章图片
#人工智能
使用docker 部署自己的chatgpt

ChatGPT 可以作为虚拟助手,帮助用户执行各种任务,如设置提醒、发送电子邮件、查找信息、预订餐厅等。:ChatGPT 可以用于提供即时的客户服务和支持,回答常见问题、解决问题和提供指导。它可以与作家、编辑和内容创作者合作,提供灵感、建议和修改意见。它可以理解用户的查询,并提供相关的答案、解释和建议。这些只是 ChatGPT 的一些应用场景示例,它的用途非常广泛,可以适应许多不同的领域和任务。:

文章图片
#docker#容器
Elasticsearch 高级查询must 多个条件同时满足

摘要:要实现SQL中WHERE user_id IN (...) AND project_id='xxx'的查询逻辑,在Elasticsearch中应使用bool.must组合查询,而非should。对于ID类字段的精确匹配,推荐使用term(单个值)和terms(多值)查询,且字段类型需为keyword而非text。若字段为text类型,需通过.keyword子字段实现精确匹配。该方案适用于需要

文章图片
#elasticsearch#服务器#linux
MinIO Webhook机制访问日志记录

MinIO的Webhook功能实现了对象存储的事件通知机制,当发生文件上传、删除等操作时,会自动向配置的HTTP接口发送POST请求。该功能支持多种事件类型(如对象创建、删除、访问等),主要用于实现文件自动处理、数据同步、监控告警等场景。通过JSON格式的事件数据,外部系统可以实时响应存储操作,构建事件驱动架构。配置方式包括控制台UI和日志配置,并可通过部署接收服务(如示例中的Flask应用)来处

文章图片
一文搞清楚RoPE、mRoPE、交错 mRoPE、MRoPE

本文梳理了Transformer位置编码从RoPE到MRoPE的技术演进路径。RoPE通过旋转嵌入解决文本相对位置问题,成为主流LLM的基础。为适应多模态需求,mRoPE扩展至时空多维位置编码,交错mRoPE优化了维度融合,最终MRoPE实现了文本、图像、视频位置的统一表示。这一发展路线反映了从纯文本到多模态大模型的位置编码需求变化,Qwen-VL系列模型是典型应用案例。核心趋势是从单一文本位置向

文章图片
#人工智能#transformer
一文搞明白 hipBLAS:ROCm 里的 BLAS 加速核心

hipBLAS是AMD ROCm生态中的高性能BLAS加速库,类似于NVIDIA的cuBLAS。它提供从向量到矩阵运算的各级BLAS功能,核心目标是利用GPU并行能力加速线性代数计算。作为ROCm软件栈的关键组件,hipBLAS位于HIP运行库之上,为PyTorch等框架提供底层支持。文章详解了hipBLAS的核心功能(如关键GEMM矩阵乘法)、在AI/LLM中的核心作用(Transformer约

文章图片
#人工智能
    共 103 条
  • 1
  • 2
  • 3
  • 11
  • 请选择