
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
R1-Zero 证明了纯 RL 可以训出推理能力。但一个能推理的模型,离一个能交给用户正常使用的模型,中间还有好几道坎。第一道坎是语言。基座模型 DeepSeek-V3 是在中英文混合数据上预训练的,R1-Zero 做推理的时候经常中英文乱窜——前一句还是英文的数学推导,后一句变成了中文感叹。如果你用中文提问,它可能用英文推理;用英文提问,它又可能给你塞几句中文。对普通用户来说,这种体验很差。第二
上一篇文章提到,DeepSeek-R1-Zero 没有用传统的 PPO 算法,而是用了一种叫的算法。要理解 GRPO 为什么被选中,得先搞清楚 PPO 在训练大模型时到底有什么问题。
本文解析了DeepSeek团队开发的纯强化学习大模型DeepSeek-R1-Zero的创新技术。该模型突破性地跳过了传统的监督微调(SFT)阶段,直接从预训练基座模型出发,通过强化学习训练推理能力。其核心在于GRPO算法和规则奖励机制:通过组内答案比较取代价值模型,仅用最终答案正确性作为奖励信号。研究发现,在训练过程中模型自发形成了"反思"行为,并主动延长思考步骤,最终在数学、编程等任务上达到超越
论文还提了一个更早期的实验:Qwen2.5-Math-7B 做 RL 训练 10,000 步,得到的 Qwen2-Math-7B-Zero 在 AIME 2024 上是 22.3%,AIME 2025 上 18.1%。DeepSeek-R1 的工作证明了,纯强化学习可以激励大模型发展出复杂的推理行为——反思、验证、回溯——这些行为不是人类设计出来的,是模型在追求正确率的过程中自己发现的。技术的发展
本文系统评估了DeepSeek研发的推理模型R1在多个领域的性能表现,并与主流大模型(如GPT-4o、Claude-3.5-Sonnet等)进行对比。R1在数学竞赛(AIME 2024得分79.8%)、编程(LiveCodeBench 65.9%)和知识问答(MMLU 90.8%)等任务中显著优于非推理模型,部分领域甚至超越人类专家水平。研究采用独特的pass@k评估方法,并严格过滤训练数据避免污







