logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【清华代码熊】Agentic RL 开源项目推荐(2026.07版)

📌 本期带来2026年上半年的 Agentic RL 开源项目推荐(简历项目可以基于此实现)筛选了几个方向:🌟 奖励建模改进(Reward Modeling)🌟 上下文压缩与管理(Context Compression)🌟 算法改进(RL Optimization)🌟 探索与数据供给(RL Training Data)

文章图片
#人工智能#深度学习#自然语言处理 +1
【清华代码熊】字节面试官:SFT、RL 在Agentic训练中的作用

📌 本期解析字节、淘天的面试题:🌟 如何理解 SFT、RL 在Agentic训练中的作用?🌟 工具调用本身 vs 基于工具结果的后续生成,哪个对 SFT 依赖更大?

文章图片
#人工智能#深度学习#自然语言处理 +1
【清华代码熊】Multi-Step Agentic RL 算法总结(2026.3版)

📌 本期是【大模型 RL 算法总结】的续篇,相比之前的单步RL,本期主要回顾多步 Agentic 任务的 RL 算法:GiGPO、Tree-GRPO、ARPO、AEPO、RAPO。

文章图片
#自然语言处理#深度学习#人工智能
【清华代码熊】面试官: Agentic RL 过程奖励设计/优势计算

📌 今天解析阿里/字节/快手的面试题:Agentic RL 场景下如何设计过程奖励(Process Reward)?Token-Level 优势如何计算?

文章图片
#人工智能#深度学习#自然语言处理
【清华代码熊】Agentic RL 背景下 PPO 为什么优于 GRPO?

📌 今天拆解 GLM-5.2 在长程 Agentic 任务下替换 group-wise GRPO 为 critic-based PPO 的逻辑,结合我们前段时间解析过的🔥 Agentic-RL 算法总结 与 🔥 OPD 算法总结。

文章图片
#自然语言处理#人工智能#深度学习 +1
【清华代码熊】解析 Kimi K3 Multi-Token Prediction(MTP)

📌 本期解析 Kimi K3 的推理优化 Multi-Token Prediction(MTP)算法设计/实现策略。📌 Speculative Decoding(投机解码/推测解码)已经成为长程 Agent 模型降低 Decode 时延的关键,同期 DeepSeek V4 的 DSpark、GLM-5.2 的 IndexShare-MTP、阶跃的 JetSpec 都(准备)在各自的基座中集成推

文章图片
#深度学习#人工智能#机器学习 +2
【清华代码熊】Qwen3.5代码泄漏? 模型架构+源码一手解析

📌 本次开源的代码有 Qwen-3.5 和 Qwen-3.5-MOE 两类多模态大模型,本质上来说:🌟 Qwen-3.5 就是多模态版的Qwen3 Next,即把 ViT + PatchMerger 接上Qwen3 Next。自然地,模型也支持 Text-Only 的输出。🌟 Qwen-3.5-MOE 在 Qwen-3.5 基础上将 LLM Backbone 的 FFN 替换为 Qwen3

文章图片
#人工智能#自然语言处理#深度学习
【清华代码熊】图解GLM5模型架构|DSA稀疏注意力原理解析

📌 智谱AI发布的GLM5在架构上的最大创新就是使用了DeepSeek的稀疏注意力技术DSA(DeepSeek Sparse Attention),这个技术是在DeepSeek的MLA上进行的拓展。🎯 今天来保姆级拆解 GLM5的DSA源代码,从0手撕MLA/DSA,了解为什么这一技术能极大降低推理成本。(今年不少断侧模型也是加入MLA)

文章图片
#深度学习#人工智能#自然语言处理
【清华代码熊】GLM-5技术报告全解读|从DSA到RL Infra细节

📌 本期解析GLM-5技术报告,原论文超长,但是干货和insight超多,包含核心知识点:🌟 DeepSeek Sparse Attention (DSA)🌟 解决GRPO训推不一致(IcePop)🌟 DSA 的 RL Trick🌟 On-Policy Cross-Stage Distillation🌟 GLM5 的 RL Infra🌟 稀疏 Attention 消融实验结果

文章图片
#人工智能#自然语言处理#深度学习
    共 29 条
  • 1
  • 2
  • 3
  • 请选择