
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Agent 记忆框架在记忆表示上花里胡哨(原始轨迹、反思规则、技能、建图)但在记忆读写时通常都是一套固定的管线。MemCon 认为即使记忆内容不变,访问策略也应随任务、库存和历史反馈调整,把“要不要查、查什么、查多少”变成在线学习的决策,在不新增 LLM 调用的前提下,提升任务成功率、降低 token 消耗,并且能直接应用到任意现有记忆框架上。

现有 RL 框架(verl、OpenRLHF 等)本质上还是面向具体的策略模型做优化,工作流编排被当作环境搭建的一部分,使得每个多智能体系统都需要手工编排,训练难度较大,不同系统也难以做公平比较。UnityMAS-O 实现了一套真正面向多智能体工作流的训练流程,支持自定义的角色设置、模型拓扑结构,在多种任务和实验设置下都拿到了显著提升

今日候选池 89 篇,硬过滤 + LLM 打分后通过评估 7 篇。

梁文峰署名!对深度学习基石残差网络的优化改进

今日候选池 91 篇,硬过滤 + LLM 打分后通过评估 16 篇,精选 Top-10,另列 6 篇速览

今日候选池 85 篇,硬过滤 + LLM 打分后通过评估 11 篇,精选 Top-10,另列 1 篇速览

今日候选池 89 篇,硬过滤 + LLM 打分后通过评估 13 篇,精选 Top-10,另列 3 篇速览

多智能体 LLM 往往靠自然语言通信,虽然直观,但会带来额外 token 生成、prefill 开销和 KV cache 内存负担。本文提出 TFlow(Thought Flow),将发送方的隐藏状态编译为接收方专属的瞬时低秩 LoRA 权重扰动,而不是写入上下文。该方法在推理时实现实例级适配,不永久改模也不扩展文本上下文。用 3 个 Qwen3-4B agent 实验显示,TFlow 相比单一接

现有 RL 框架(verl、OpenRLHF 等)本质上还是面向具体的策略模型做优化,工作流编排被当作环境搭建的一部分,使得每个多智能体系统都需要手工编排,训练难度较大,不同系统也难以做公平比较。UnityMAS-O 实现了一套真正面向多智能体工作流的训练流程,支持自定义的角色设置、模型拓扑结构,在多种任务和实验设置下都拿到了显著提升

RLVR 中失败轨迹被统一惩罚是巨大的信息浪费。CIPO 通过纠错重放,让模型在看到自己错误的条件下重新生成答案,天然区分不同失败模式并提供差异化学习信号,无需任何外部标注








