logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

论文精读:拆解顶会论文 COLA:当大模型玩起角色扮演与对抗博弈,Agent 工作流的威力有多大?

本篇文章将用最通俗易懂的大白话,带你硬核拆解这篇让人拍案叫绝的论文。我们将看到,作者如何仅仅通过精妙的 Prompt(提示词)工程,就搭建出了一个由“领域专家”、“正反方辩手”和“最高法官”组成的 AI 专家辩论团(COLA 框架),并且在“零样本”考试中吊打了那些靠死记硬背训练出来的传统模型。

文章图片
#人工智能#深度学习#神经网络 +2
大模型强化学习:GRPO超级无敌深度剖析,看完即高手

GRPO 是一种通过组内归一化移除 Critic 网络的高效强化学习算法;它利用相对优势和在线探索,解决了 PPO 的显存瓶颈和 DPO 的探索不足问题,是目前训练大模型强推理能力(System 2)的最佳工程实践。

#算法#人工智能#神经网络 +3
PyTorch 深度强化学习实战:从零手写 PPO 算法训练你的月球着陆器智能体

很多同学在学习 PPO(Proximal Policy Optimization)时,往往止步于复杂的数学公式。理论看懂了,真要动手写代码时却无从下手。本文不谈晦涩的公式推导,而是聚焦于工程实现。我们将基于 PyTorch,从环境搭建、网络设计(Actor-Critic)、到核心的优势函数计算与 Clip 更新,一步步手写代码,最终训练出一个能完美降落的 LunarLander 智能体。如果你也想

#人工智能#pytorch#机器学习 +4
具身智能2.1刚体运动学:坐标系变换、旋转矩阵、四元数

四元数是复数(Complex Numbers)在四维空间的扩展。一个四元数由一个实部(Scalar,)和三个虚部(Vector,)组成:或者写成向量形式:在具身智能的工程实践中,为了描述旋转,我们只使用单位四元数 (Unit Quaternion)

#矩阵#人工智能#线性代数
开年王炸?马斯克都盛赞的 Kimi 架构级创新《Attention Residuals》深度解读

究竟是一篇什么样的中国 AI 论文,能让马斯克等一众硅谷大佬在深夜的 X(推特)上疯狂讨论?答案就是 Kimi 最新发布的架构级神作《Attention Residuals》。今天,我们将用最通俗的比喻带你拆解这篇“动了深度学习十年祖坟”的硬核研究,看看他们是如何破解大模型越深越笨的魔咒的。更让人震撼的是,这篇引发硅谷巨头热议、动了深度学习十年祖坟的底层架构论文,其第一作者竟然是一位 17 岁的深

文章图片
#人工智能#深度学习#计算机视觉 +4
大模型面试:从字节到集群的大模型微调底层推演指南

告别模糊的“算力配置表”,本教程带你从底层的字节(Byte)出发,精确推演大模型全参数微调的真实显存消耗。不打比方,不走捷径,直接用严谨的数学公式为你彻底算清每一兆(MB)显卡的去向。

文章图片
#深度学习#人工智能#自然语言处理 +2
从零入门领域大模型训练:SFT、Continue PreTrain、RAG、评测与训练排错全流程教程

这是一套面向初学者的领域大模型训练教程,围绕大模型从 Base Model 到 Chat Model、从通用模型到领域模型的完整训练流程展开。本教程不追求堆砌公式,而是从实际工程问题出发,帮助读者建立一套完整的大模型训练思维框架:知道什么时候该预训练,什么时候该微调,什么时候该检索增强,如何准备数据,如何设计评测,如何调参和排错。适合刚接触大模型训练、领域模型微调、LLM 应用落地和 AI 工程实

#人工智能#深度学习#机器学习 +2
还没弄懂 PPO?看这一篇就够了:OpenAI 默认算法详解

在深度强化学习(Deep RL)的浩瀚星空中,算法多如牛毛:DQN、DDPG、A3C、SAC......但如果你问任何一位资深的算法工程师:“如果我只想快速把一个新环境跑通,或者要做 RLHF(人类反馈强化学习)来训练大语言模型,我该选哪个算法?”答案几乎永远是同一个:PPO (Proximal Policy Optimization)。

#人工智能#机器学习#深度学习 +3
经典论文精读第一期:DeepSeek-R1-Zero ——RL奇迹

最后,再来一轮 RL。但这次不仅是为推理(Math/Code),还加入了对齐人类偏好(Helpfulness/Harmlessness)。只看最后的 Summary 有没有用。检查整个 CoT 和 Summary 也就是所谓的安全性检查。

#分布式#人工智能#神经网络 +4
论文精度第四期:OPENAI-Let‘s Verify Step by Step:拒绝幻觉,验证每一个思考的瞬间

大型语言模型(如GPT-4)已经能够通过“思维链”的方式进行多步推理。然而,它们仍然经常在推理过程中犯下不易察觉的逻辑错误(即“幻觉”)。一个最终答案正确,但推理过程错误的解决方案是不可靠的。

文章图片
#人工智能#神经网络#深度学习 +4
    共 115 条
  • 1
  • 2
  • 3
  • 12
  • 请选择