logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

DeepSeek-R1 技术解析(三):从 R1-Zero 到 R1,多阶段训练管线拆解

R1-Zero 证明了纯 RL 可以训出推理能力。但一个能推理的模型,离一个能交给用户正常使用的模型,中间还有好几道坎。第一道坎是语言。基座模型 DeepSeek-V3 是在中英文混合数据上预训练的,R1-Zero 做推理的时候经常中英文乱窜——前一句还是英文的数学推导,后一句变成了中文感叹。如果你用中文提问,它可能用英文推理;用英文提问,它又可能给你塞几句中文。对普通用户来说,这种体验很差。第二

#人工智能#神经网络#网络 +1
DeepSeek-R1 技术解析(二):GRPO 算法是怎么工作的,以及 R1-Zero 的自我进化

上一篇文章提到,DeepSeek-R1-Zero 没有用传统的 PPO 算法,而是用了一种叫的算法。要理解 GRPO 为什么被选中,得先搞清楚 PPO 在训练大模型时到底有什么问题。

#算法#人工智能#神经网络
DeepSeek-R1 技术解析

本文解析了DeepSeek团队开发的纯强化学习大模型DeepSeek-R1-Zero的创新技术。该模型突破性地跳过了传统的监督微调(SFT)阶段,直接从预训练基座模型出发,通过强化学习训练推理能力。其核心在于GRPO算法和规则奖励机制:通过组内答案比较取代价值模型,仅用最终答案正确性作为奖励信号。研究发现,在训练过程中模型自发形成了"反思"行为,并主动延长思考步骤,最终在数学、编程等任务上达到超越

#算法#人工智能#机器学习
DeepSeek-R1 技术解析(五):蒸馏让 1.5B 小模型也能推理——以及那些失败的尝试

论文还提了一个更早期的实验:Qwen2.5-Math-7B 做 RL 训练 10,000 步,得到的 Qwen2-Math-7B-Zero 在 AIME 2024 上是 22.3%,AIME 2025 上 18.1%。DeepSeek-R1 的工作证明了,纯强化学习可以激励大模型发展出复杂的推理行为——反思、验证、回溯——这些行为不是人类设计出来的,是模型在追求正确率的过程中自己发现的。技术的发展

#transformer#人工智能#神经网络 +2
DeepSeek-R1 技术解析(四):实验数据全景——R1 到底强在哪,弱在哪

本文系统评估了DeepSeek研发的推理模型R1在多个领域的性能表现,并与主流大模型(如GPT-4o、Claude-3.5-Sonnet等)进行对比。R1在数学竞赛(AIME 2024得分79.8%)、编程(LiveCodeBench 65.9%)和知识问答(MMLU 90.8%)等任务中显著优于非推理模型,部分领域甚至超越人类专家水平。研究采用独特的pass@k评估方法,并严格过滤训练数据避免污

#人工智能#机器学习#深度学习
到底了