
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在大语言模型的后训练阶段,如何高效利用教师模型的知识来提升学生模型性能,是一个核心挑战。传统强化学习(RL)信号稀疏,监督微调(SFT)存在分布偏移问题。On-Policy Distillation(OPD)结合两者优势:让学生从自身分布采样轨迹,同时由教师提供逐 token 的密集反馈,从而在避免分布偏移的同时大幅提升信号密度。本文从原理、变体到工程实现,系统解析 OPD 的设计思路与落地细节。
在大语言模型的后训练阶段,如何高效利用教师模型的知识来提升学生模型性能,是一个核心挑战。传统强化学习(RL)信号稀疏,监督微调(SFT)存在分布偏移问题。On-Policy Distillation(OPD)结合两者优势:让学生从自身分布采样轨迹,同时由教师提供逐 token 的密集反馈,从而在避免分布偏移的同时大幅提升信号密度。本文从原理、变体到工程实现,系统解析 OPD 的设计思路与落地细节。
昇腾平台当前已支持slime框架本文是 slime 源码走读系列的推理架构部分的下篇。上篇介绍了 slime 的推理整体架构——服务化推理、四级层级、三条通信路径、SGLangEngine 遥控器、sgl-router 等。如果还没读过、强烈建议先读上篇,本文会反复引用其中的设定。如果不想跳回去翻,简单复述一下走读配置和架构骨架。走读配置--actor-num-gpus-per-node 4 \
昇腾平台当前已支持slime框架本文是 slime 源码走读系列的推理架构部分的下篇。上篇介绍了 slime 的推理整体架构——服务化推理、四级层级、三条通信路径、SGLangEngine 遥控器、sgl-router 等。如果还没读过、强烈建议先读上篇,本文会反复引用其中的设定。如果不想跳回去翻,简单复述一下走读配置和架构骨架。走读配置--actor-num-gpus-per-node 4 \
昇腾平台当前已支持slime框架前不久搞了一段时间的 OpenClaw-RL,算是第一次在 slime 框架上完成了一次实战。此前只停留于源码走读,并不深入,趁着这个机会,刚好整理一下对 slime 框架推理部分的源码走读。本文走读所参照的启动配置来自--actor-num-gpus-per-node 4 \ # 训练占 4 GPU--rollout-num-gpus 4 \ # 推理占 4 GP
昇腾平台当前已支持slime框架前不久搞了一段时间的 OpenClaw-RL,算是第一次在 slime 框架上完成了一次实战。此前只停留于源码走读,并不深入,趁着这个机会,刚好整理一下对 slime 框架推理部分的源码走读。本文走读所参照的启动配置来自--actor-num-gpus-per-node 4 \ # 训练占 4 GPU--rollout-num-gpus 4 \ # 推理占 4 GP
本文按"算法演进 → 工程落地"的主线,系统梳理生成式推荐(Generative Recommendation, GR)这一方向的发展脉络。第一部分回顾传统级联推荐架构的系统性瓶颈;第二部分以 Meta GR(HSTU)和快手 OneRec 为代表,剖析两条主流的生成式推荐技术路线;第三部分聚焦工程落地,介绍 TorchRec 生态以及基于昇腾 NPU 打造的 RecSDK 框架,展示从算法到生产
本文按"算法演进 → 工程落地"的主线,系统梳理生成式推荐(Generative Recommendation, GR)这一方向的发展脉络。第一部分回顾传统级联推荐架构的系统性瓶颈;第二部分以 Meta GR(HSTU)和快手 OneRec 为代表,剖析两条主流的生成式推荐技术路线;第三部分聚焦工程落地,介绍 TorchRec 生态以及基于昇腾 NPU 打造的 RecSDK 框架,展示从算法到生产
MFU(Model Flop Utilization,模型浮点运算利用率)是衡量大模型训练 / 推理效率的核心指标,用于量化硬件(如 GPU)的浮点运算能力被模型实际利用的比例。其计算原理围绕 “理论最大算力” 与 “模型实际消耗算力” 的比值展开,直接反映了硬件资源的利用效率。在深度学习领域,评估模型的计算量通常涉及到多个指标,其中MACs(Multiply-Accumulate Operati
每张卡上的 module,api,kernel(O0)组成了一个Ranknode(O1),不同的 Ranknode 组成对应的T/D/PP域节点(O1.5),不同的并行域节点拼合形成完整(model)micro_step(O2),不同 micro step拼合形成 step(O3),多个step拼合形成区域段数据集表现,一般就loss趋势等。下面探讨精度问题定位过程中几个核心步骤。








