logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

深度学习模型量化与混合精度训练全指南:从学术原理到工业级工程落地

本文系统阐述了深度学习模型量化与混合精度训练的核心技术与工程实践。主要内容包括:1)量化分类体系(PTQ/QAT)及选型标准;2)伪量化节点原理与实现;3)FP16/BF16混合精度对比与AMP实现;4)工业级落地全流程规范与避坑指南。文章提供了可直接复用的工程模板,涵盖混合精度训练、QAT微调、PTQ量化、模型导出等完整流程,并指出FP8量化、硬件感知优化等未来趋势。该指南兼具学术严谨性与工程实

文章图片
#深度学习#人工智能
多模态大模型入门:从 BLIP 到 Qwen-VL

多模态大模型发展历程:从视觉理解到通用智能 2022-2023年间,多模态大模型经历了五个关键发展阶段。BLIP-1首次统一视觉语言的理解与生成能力;Flamingo开创冻结主干+桥接模块的轻量化范式;BLIP-2提出高效对齐方案降低训练门槛;LLaVA通过指令调优实现人机对话;Qwen-VL最终拓展为支持高分辨率、双语交互的全场景通用模型。这些突破推动多模态技术从单一任务处理发展到具备细粒度感知

文章图片
#人工智能#语言模型#计算机视觉 +1
FFmpeg 视频生成推理 Pipeline:Python 版常用函数封装(可直接集成)

本文介绍了一套基于Python和FFmpeg的视频生成自动化工具,专为AI视频推理场景设计。主要内容包括: 核心功能封装: 图片预处理:批量转换格式、统一分辨率 音频预处理:格式转换、比特率调整 视频合成:支持图片序列+音频或单图+音频两种模式 视频优化:批量压缩、调整分辨率 视频拼接:合并多个片段 技术特点: 零第三方依赖,仅使用Python内置模块 完善的异常处理和日志记录 跨平台兼容(Win

文章图片
#音视频#python#深度学习 +2
分布式的训练和推理中通信、nvlink和nvcc是什么?

《大模型时代的通信瓶颈与NVLink革命》 本文深入剖析了大模型训练中的通信瓶颈问题及其解决方案。传统PCIe总线存在星型拓扑缺陷、带宽不足和无缓存一致性三大问题,导致多卡训练效率低下。NVIDIA的NVLink技术通过构建GPU直连网络,配合NVCC编译器的深度优化,实现了1.8TB/s的超高带宽和硬件级缓存一致性。文章揭示了大模型发展史本质上是通信技术演进史:从单机单卡到万卡集群,每次通信突破

文章图片
#服务器#网络#linux +3
Agent 生态全解:厘清 Agent、MCP、Skill、RAG、LangChain 与 OpenClaw

Skill 是为 Agent 场景封装的、具备单一完整功能的、可被 LLM 标准化调用的原子执行模块。它的核心价值,是弥补 LLM 的原生能力缺陷 ——LLM 无法直接发送消息、控制浏览器、操作设备、调用业务接口,这些能力都需要通过封装好的 Skill 来实现。单一职责原则:一个 Skill 仅完成一类明确的操作,比如 “发送飞书消息”“浏览器页面截图”“获取设备地理位置”,避免功能耦合导致的调用

文章图片
#microsoft#人工智能#github +1
多模态大模型入门:从 BLIP 到 Qwen-VL

多模态大模型发展历程:从视觉理解到通用智能 2022-2023年间,多模态大模型经历了五个关键发展阶段。BLIP-1首次统一视觉语言的理解与生成能力;Flamingo开创冻结主干+桥接模块的轻量化范式;BLIP-2提出高效对齐方案降低训练门槛;LLaVA通过指令调优实现人机对话;Qwen-VL最终拓展为支持高分辨率、双语交互的全场景通用模型。这些突破推动多模态技术从单一任务处理发展到具备细粒度感知

文章图片
#人工智能#语言模型#计算机视觉 +1
torch.compile 与 Triton 的加速本质:从原理到实际效果

PyTorch生态中两大核心加速技术——torch.compile和Triton,通过系统性优化实现了2-10倍的性能提升。torch.compile作为全局优化器,通过计算图捕获、算子融合等技术消除90%的GPU空转等待;Triton则专注于内核级优化,自动管理内存层次结构并最大化TensorCore利用率。两者协同工作时,torch.compile自动处理90%的普通算子,剩余10%的关键算子

文章图片
#人工智能#AIGC#计算机视觉 +1
DeepSeek-R1 思维链 (CoT) 解析:模型真的会思考吗?

摘要: DeepSeek-R1通过纯强化学习(RL)驱动,突破传统思维链(CoT)依赖人工标注的瓶颈,实现内生性推理能力进化。其核心创新在于: 训练范式:跳过监督微调(SFT),仅基于规则化奖励(答案正确性+格式规范)驱动模型自主探索,形成包含反思、回溯、多路径择优的闭环推理链。 算法优化:采用GRPO(Group Relative Policy Optimization)替代PPO,支持最长65

文章图片
#人工智能#深度学习#自然语言处理 +1
代码的角度分析Causal Forcing

清华大学团队提出的CausalForcing框架通过三阶段渐进式蒸馏实现了高质量实时自回归视频生成。该框架首先训练因果结构扩散模型,采用Teacher Forcing策略避免训练误差累积;然后通过ODE或一致性蒸馏将多步扩散压缩为少步模型;最后使用双向扩散模型作为教师,通过分布匹配蒸馏提升生成质量。核心创新包括:块级因果注意力机制、KVCache流式推理、以及条件分布校准技术。实验表明,该方法在单

文章图片
#AIGC#人工智能#计算机视觉
从代码的角度解读DMD2

本文摘要: DMD2是一种改进的扩散模型蒸馏方法,通过分布匹配将多步扩散模型压缩为单步生成器。针对原始DMD的三个局限:依赖昂贵ODE数据、受限于教师路径、训练不稳定,DMD2提出了三大创新:1)消除回归损失+双时间尺度更新,避免ODE数据需求;2)集成GAN损失,直接在真实数据上学习;3)多步采样模拟解决训练-推理不匹配。代码实现采用双UNet架构(冻结教师+可训练判别器)和GAN分类器,通过交

文章图片
#深度学习#人工智能#机器学习 +1
    共 33 条
  • 1
  • 2
  • 3
  • 4
  • 请选择