logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

DeepSeek-R1 多阶段训练详解

阶段核心动作数据规模/类型优化目标关键技术Zero纯RL无SFT推理prompt(无标注CoT)验证RL自发涌现推理能力Dev1冷启动SFT+RL数千条人类风格CoT可读性+语言一致性Dev2继续推理RL复用推理prompt集强化数学/代码/STEM能力同Dev1 RL设置迭代Dev3拒绝采样+大规模SFT800K(600K推理+200K非推理)兼顾推理与通用/写作能力Rejection Samp

R1奖励模型训练

维度Helpful RMSafety RM数据规模数据来源DeepSeek-V3生成的两两对比response + Arena-Hard prompt格式模型生成response + 人工/规则标注safe/unsafe标注方式Pairwise比较(A vs B,5档判定后转为preference score)Point-wise二分类(safe/unsafe)消偏处理①位置偏差:4次交换A/B取

#人工智能
长上下文能力:FlashAttention vs. RingAttention

GPU 通过大量并发线程(组织在 thread block 中)执行计算(kernel)。流式多处理器 (SM) 是实际的执行单元(如 A100 有 108 个 SM),负责调度和执行分配给它的线程块 (thread block)。每个 SM 将线程块进一步划分为 warp(通常 32 线程/warp)。warp 是 GPU 的基本调度和执行单位:同 warp 内的线程高度同步,可直接协作(如执行

文章图片
#nlp
到底了