
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
【清华代码熊】Agent Harness 工程实践之(2):ToolUse设计

📌 本期带来2026年上半年的 Agentic RL 开源项目推荐(简历项目可以基于此实现)筛选了几个方向:🌟 奖励建模改进(Reward Modeling)🌟 上下文压缩与管理(Context Compression)🌟 算法改进(RL Optimization)🌟 探索与数据供给(RL Training Data)

📌 本期解析字节、淘天的面试题:🌟 如何理解 SFT、RL 在Agentic训练中的作用?🌟 工具调用本身 vs 基于工具结果的后续生成,哪个对 SFT 依赖更大?

📌 本期是【大模型 RL 算法总结】的续篇,相比之前的单步RL,本期主要回顾多步 Agentic 任务的 RL 算法:GiGPO、Tree-GRPO、ARPO、AEPO、RAPO。

📌 今天解析阿里/字节/快手的面试题:Agentic RL 场景下如何设计过程奖励(Process Reward)?Token-Level 优势如何计算?

📌 今天拆解 GLM-5.2 在长程 Agentic 任务下替换 group-wise GRPO 为 critic-based PPO 的逻辑,结合我们前段时间解析过的🔥 Agentic-RL 算法总结 与 🔥 OPD 算法总结。

📌 本期解析 Kimi K3 的推理优化 Multi-Token Prediction(MTP)算法设计/实现策略。📌 Speculative Decoding(投机解码/推测解码)已经成为长程 Agent 模型降低 Decode 时延的关键,同期 DeepSeek V4 的 DSpark、GLM-5.2 的 IndexShare-MTP、阶跃的 JetSpec 都(准备)在各自的基座中集成推

📌 本次开源的代码有 Qwen-3.5 和 Qwen-3.5-MOE 两类多模态大模型,本质上来说:🌟 Qwen-3.5 就是多模态版的Qwen3 Next,即把 ViT + PatchMerger 接上Qwen3 Next。自然地,模型也支持 Text-Only 的输出。🌟 Qwen-3.5-MOE 在 Qwen-3.5 基础上将 LLM Backbone 的 FFN 替换为 Qwen3

📌 智谱AI发布的GLM5在架构上的最大创新就是使用了DeepSeek的稀疏注意力技术DSA(DeepSeek Sparse Attention),这个技术是在DeepSeek的MLA上进行的拓展。🎯 今天来保姆级拆解 GLM5的DSA源代码,从0手撕MLA/DSA,了解为什么这一技术能极大降低推理成本。(今年不少断侧模型也是加入MLA)

📌 本期解析GLM-5技术报告,原论文超长,但是干货和insight超多,包含核心知识点:🌟 DeepSeek Sparse Attention (DSA)🌟 解决GRPO训推不一致(IcePop)🌟 DSA 的 RL Trick🌟 On-Policy Cross-Stage Distillation🌟 GLM5 的 RL Infra🌟 稀疏 Attention 消融实验结果








