
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
从 Sigmoid 到 SiTU-GLU:大模型激活函数 30 年演进全景图
经典时代的核心局限是。
DeepSeek-R1 多阶段训练详解
阶段核心动作数据规模/类型优化目标关键技术Zero纯RL无SFT推理prompt(无标注CoT)验证RL自发涌现推理能力Dev1冷启动SFT+RL数千条人类风格CoT可读性+语言一致性Dev2继续推理RL复用推理prompt集强化数学/代码/STEM能力同Dev1 RL设置迭代Dev3拒绝采样+大规模SFT800K(600K推理+200K非推理)兼顾推理与通用/写作能力Rejection Samp
R1奖励模型训练
维度Helpful RMSafety RM数据规模数据来源DeepSeek-V3生成的两两对比response + Arena-Hard prompt格式模型生成response + 人工/规则标注safe/unsafe标注方式Pairwise比较(A vs B,5档判定后转为preference score)Point-wise二分类(safe/unsafe)消偏处理①位置偏差:4次交换A/B取
长上下文能力:FlashAttention vs. RingAttention
GPU 通过大量并发线程(组织在 thread block 中)执行计算(kernel)。流式多处理器 (SM) 是实际的执行单元(如 A100 有 108 个 SM),负责调度和执行分配给它的线程块 (thread block)。每个 SM 将线程块进一步划分为 warp(通常 32 线程/warp)。warp 是 GPU 的基本调度和执行单位:同 warp 内的线程高度同步,可直接协作(如执行

kaldi解码中, 排查静音对应到“啊“的异常问题
kaldi解码中问题排查和定位方法

到底了







