最新 AI 论文盘点(2026-03-19):6 篇新作看 Agent 记忆、训练提速、KV 压缩与机器人低延迟控制

今天这批论文如果放在一起看,主线其实非常清楚:

  • 一条线是 Agent / LLM memory,大家开始认真讨论“长期记忆到底该怎么存、怎么复用、怎么治理”

  • 一条线是 模型效率,不只是继续堆算力,而是从优化器、KV cache、注意力结构这些地方挤出真实收益

  • 还有一条线是 机器人落地,重点已经越来越偏向“少改模型、在推理阶段提速、在部署阶段加约束”

这篇我挑 6 篇今天更值得看的论文,尽量不重复摘要,而是回答四个问题:

  1. 它到底在解决什么问题

  2. 方法新意在哪里

  3. 为什么现在值得关注

  4. 它的边界和风险是什么


1)AgentFactory:把成功经验从“提示词”升级成“可执行子代理”

论文: AgentFactory: A Self-Evolving Framework Through Executable Subagent Accumulation and Reuse
链接: https://arxiv.org/abs/2603.18000

这篇的核心切入点很准:

现在很多 agent 的“自进化”其实只是把成功经验写成:

  • reflection

  • textual memory

  • 提示词模板

  • 任务总结

问题是,这些东西看起来像经验,但并不能稳定复用成下一次可执行的能力

AgentFactory 的思路更激进一些:

别只存文字经验,直接把成功方案存成可执行的 subagent 代码。

也就是说,一个任务做成之后,不只是留下一段“我下次应该这么做”的反思,而是沉淀成一个能真正被再次调用、还能继续被修正的 Python 子代理。

我觉得这篇论文最值得看的点,不是“代码复用”本身,而是它代表了一种能力沉淀范式的变化:

  • 过去的 agent memory,更像是“记住说法”

  • 这篇想做的,是“记住做法”

这对复杂任务尤其重要。因为很多任务真正难的部分,不是某个事实忘了,而是:

  • 工具调用顺序复杂

  • 环境依赖多

  • 中间状态容易错

  • 任务流程需要稳定重复

在这种情况下,文本反思经常不够用;而可执行子代理反而更接近“真正把能力封装下来”。

我为什么觉得它值得关注?

因为这方向会直接影响下一代 research agent / coding agent / workflow agent:

  • 能不能把一次性成功变成长期资产

  • 能不能减少每次从头规划的成本

  • 能不能形成逐步增长的能力库

它的边界也很明显

  • 子代理越积越多,后面会遇到检索、版本管理和冲突治理问题

  • “能执行”不代表“泛化得好”

  • 一旦环境变了,旧 subagent 可能很快过时

所以我会把它看成一篇从 memory 走向 capability accumulation 的论文,而不是普通的“agent 记忆增强”。


2)Facts as First Class Objects:长期记忆别老塞上下文,事实应该单独建模

论文: Facts as First Class Objects: Knowledge Objects for Persistent LLM Memory
链接: https://arxiv.org/abs/2603.17781

这篇其实打到了一个很现实的问题:

现在很多长期记忆系统,说到底还是在做一件事——把事实塞进 prompt

短期内这么做当然方便,但一上规模就会出现三个老毛病:

  • 容量上限

  • 压缩摘要带来的事实丢失

  • 多轮 compaction 之后目标逐渐漂移

这篇论文提出的替代方案叫 Knowledge Objects(KOs),你可以理解为:

把事实当成独立对象存起来,而不是继续混在自然语言上下文里。

作者给出的实验结果很扎眼:

  • in-context memory 在窗口内可以表现很好

  • 但一旦进入真实生产条件,容量、压缩和漂移问题会迅速暴露

  • KOs 在准确率、成本和多跳推理上都更稳

其中一个非常有意思的结论是:

compaction loss 很可能不是某个模型的问题,而是 prompt-memory 这种范式本身的问题。

这件事我很认同。

因为长期记忆系统一旦真的跑起来,问题往往不是“模型记不住一句话”,而是:

  • 哪些事实应该长期保留

  • 哪些约束不能被摘要吃掉

  • 哪些记忆需要 O(1) 检索,而不是靠 embedding 近似召回

为什么值得关注?

因为它把“memory”从一个模糊概念拆成了更接近系统工程的对象:

  • prompt memory 负责临时工作区

  • object memory 负责稳定事实层

  • 不同 retrieval 机制可以分工

这对个人助理、项目协作 agent、多轮任务代理都很关键。

它的边界是什么?

  • 事实对象化之后,知识表达的粒度设计会很难

  • 复杂依赖关系怎么建模,不是简单 tuple 就能解决

  • 事实冲突、版本更新、时效性仍然是硬问题

但无论如何,这篇已经把一个重要信号说得很清楚:

长期记忆不该继续只靠“更长 prompt”硬撑。


3)MUD:优化器创新还没结束,训练提速还有硬骨头可啃

论文: Beyond Muon: MUD (MomentUm Decorrelation) for Faster Transformer Training
链接: https://arxiv.org/abs/2603.17970

这篇属于那种不一定最花哨,但工程上非常值得盯的论文。

它在解决的问题是:

怎么在不明显牺牲收敛质量的前提下,把 Transformer 训练的 wall-clock 再压下去。

过去这段时间,像 Muon 这类正交化动量优化器已经让很多人意识到:

  • AdamW 不一定是终点

  • 优化器里还有不少结构性收益可以拿

但 Muon 一类方法也有现实问题:

  • 需要较重的矩阵运算

  • 开销很依赖硬件

  • 理论上好看,工程上不总是划算

MUD 的思路,就是用更便宜的 decorrelation / whitening surrogate 去替代更重的极分解近似。

直白点说:

它不是否定 Muon 的方向,而是在问:能不能用更便宜的办法,拿到接近甚至更好的 time-to-perplexity。

结果也挺硬:

  • 对 AdamW、Muon 都有 wall-clock 优势

  • 峰值 tokens/s 能有 1.3-2.6x 提升

  • 某些设定甚至接近 3x

为什么我觉得它值得看?

因为这类工作特别容易被低估。

现在大家注意力常常都在:

  • 更大模型

  • 更长上下文

  • 更强推理

但真正落到训练系统时,优化器改良往往意味着非常直接的收益:

  • 更低成本

  • 更短实验周期

  • 更快 ablation

  • 更现实的中型团队可用性

边界也得说清楚

  • 不同硬件上收益可能差很多

  • 训练提速不一定自动转化为所有任务都更优

  • 优化器换代的迁移成本不低,工业界 adoption 往往很慢

但如果你关心训练基础设施,这篇比很多“又大一点”的论文更值得看。


4)CARE:KV cache 不变的前提下,把注意力结构改得更强

论文: CARE: Covariance-Aware and Rank-Enhanced Decomposition for Enabling Multi-Head Latent Attention
链接: https://arxiv.org/abs/2603.17946

这篇的重点在 inference efficiency,而且切得很准。

现在大家对注意力结构优化,已经不只是关心“能不能压缩”,而是更关心:

能不能在不增加 KV cache 成本的前提下,把表达能力救回来。

这篇论文讨论的是把已有注意力模块转换成 MLA(multi-head latent attention)时,传统低秩近似为什么经常不够好。

作者指出几个关键问题:

  • 只拟合权重矩阵,不关心激活分布

  • 忽视 activation covariance

  • 各层统一分配 rank,太粗暴

CARE 的改进点就在这里:

  • activation-aware factorization

  • 非均匀 rank 分配

  • 在固定 KV 宽度下做更合理的映射

最重要的一点是,它不是单纯追求“数学近似更漂亮”,而是明确追求:

在 matched KV budget 下,保住 attention fidelity 和下游准确率。

为什么值得关注?

因为这一类工作会越来越重要。

接下来大模型部署的真正矛盾之一,就是:

  • 大家想要更长上下文、更强推理

  • 但推理显存、KV cache、延迟成本始终摆在那里

所以谁能在 KV budget 不变时把表现拉回来,谁就真的有部署价值。

局限在哪?

  • 这类方法通常对已有架构和权重分布比较敏感

  • 转换效果未必能跨模型统一复用

  • 后续还需要少量 fine-tune 才能完全恢复性能

但从方向上说,这篇很代表一种趋势:

推理优化不再只是“压缩”,而是更精细地利用结构和统计信息。


5)Specification-Aware Distribution Shaping:机器人基础模型开始补“形式化约束”这块短板

论文: Specification-Aware Distribution Shaping for Robotics Foundation Models
链接: https://arxiv.org/abs/2603.17969

机器人基础模型最近一个越来越明显的问题是:

它们会做事了,但不一定守规矩

尤其在真实部署里,机器人面对的往往不是一句自然语言命令就完了,还要满足很多时序和安全约束,比如:

  • 必须先去 A 再去 B

  • 在某段时间内不能进入危险区

  • 要持续满足安全边界

  • 任务完成顺序不能乱

这篇工作做的,就是在不改预训练机器人基础模型参数的前提下,给它的 action distribution 加一层 specification-aware shaping

而且不是软约束意义上的“尽量满足”,而是显式引入 STL(Signal Temporal Logic)约束。

这意味着什么?

意味着它尝试把“会执行自然语言任务”的能力,往“满足正式任务约束”的方向推一步。

这篇为什么我觉得重要?

因为它碰的是机器人 foundation model 一个迟早要补的缺口:

数据驱动模型擅长学行为,但不天然擅长满足形式化安全要求。

如果后面机器人真的进入更高风险、更复杂流程的场景,这类方法会非常关键。

它的边界也很现实

  • 依赖 forward dynamics 推理,复杂系统里计算开销可能不小

  • 形式化约束设计本身有门槛

  • 真实环境偏差大时,理论满足和实际满足之间可能有缝

但从系统观上看,这篇非常值得跟:

它说明机器人基础模型下一步不是只追更大,而是要学会在既有模型上叠加可验证约束层


6)ProbeFlow:VLA 低延迟控制,重点开始从骨干模型移到 action head

论文: ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models
链接: https://arxiv.org/abs/2603.17850

这篇是今天机器人方向里我最喜欢的一篇之一。

原因很简单:它抓住了一个非常实际、但过去经常被忽略的瓶颈。

现在很多 VLA 模型为了拿更强动作生成能力,会配 flow matching action head。问题是:

这个 action head 常常需要多步 ODE 求解,推理延迟很高。

过去很多优化工作都在加速 backbone,但真正拖后腿的地方,其实可能在 action decoding。

ProbeFlow 的思路非常讨巧:

  • 不重新训练模型

  • 不改 backbone

  • 直接在推理阶段根据轨迹几何复杂度,动态决定需要多少 integration steps

这使得它在 MetaWorld 上能把 action decoding 平均步数从 50 降到 2.6,解码加速 14.8x,端到端延迟降 2.8x,而且基本不伤成功率。

为什么它很值得看?

因为它代表了一种很重要的工程心态:

真正阻碍部署的,不一定是模型主干不够强,而可能是某个被忽略的推理子模块太慢。

对机器人来说,这个判断尤其关键。因为物理控制里:

  • 晚一点就是晚一点

  • 延迟上去了,稳定性就可能掉

  • 真实硬件不会因为你理论上更优就等你

它的边界是什么?

  • 这是 inference-time 提速,不是底层能力突破

  • 适用性和收益会依赖具体 action head 结构

  • 一旦任务轨迹复杂度估计失真,可能会出现不稳定行为

但即便如此,这类 training-free acceleration 在现实里非常有价值。

因为它特别适合:

  • 已有模型不能重训

  • 线上系统需要快速提速

  • 硬件预算有限


今天这 6 篇放一起,能看出什么趋势?

如果把它们放一起看,我觉得至少有 4 个信号非常明显。

1)Agent 的问题正在从“会不会做”转向“怎么长期积累能力”

AgentFactory 和 Facts as First Class Objects 都在说明一件事:

未来 agent 拼的不只是单次任务成功率,而是:

  • 能不能长期保留有效能力

  • 能不能稳定调用历史事实

  • 能不能避免 memory 漂移和能力碎片化

2)模型效率创新越来越偏“结构层”和“系统层”

MUD、CARE 这类工作都不是简单做蒸馏或量化,而是在更底层的位置挖潜:

  • 优化器结构

  • 激活统计

  • KV budget 分配

  • 注意力重参数化

这说明效率竞争进入更深水区了。

3)机器人基础模型正在补控制与约束,而不是只补数据规模

Specification-Aware Distribution Shaping 和 ProbeFlow 都很典型:

  • 一个解决“守不守规则”

  • 一个解决“来不来得及执行”

这比单纯再训大一点模型,更像真实部署会碰到的问题。

4)“少改模型,多改推理与外层系统”会越来越流行

今天很多值得看的工作都不强调重训一个新大模型,而是:

  • 改 memory 组织方式

  • 改执行单元复用方式

  • 改优化器

  • 改 MLA 转换流程

  • 改推理阶段 action shaping

这类方法短期可能没那么“震撼”,但往往更容易真正落地。


如果你时间有限,我建议优先看哪几篇?

第一梯队:最值得细看

  • AgentFactory:如果你关心 agent capability accumulation,这篇很值得跟

  • Facts as First Class Objects:如果你关心长期记忆系统,这篇很关键

  • ProbeFlow:如果你关心 VLA 和真实机器人部署,这篇非常实用

第二梯队:看系统趋势

  • MUD:训练效率党必看

  • CARE:长上下文和推理部署党必看

  • Specification-Aware Distribution Shaping:机器人安全与形式化约束方向值得跟


结语

今天这批论文给我的一个强烈感觉是:

AI 系统正在进入一个更讲“结构化工程能力”的阶段。

这里说的结构化,不只是模型结构,而是:

  • 记忆怎么组织

  • 能力怎么沉淀

  • 训练怎么提速

  • KV cache 怎么精打细算

  • 机器人动作怎么更快地产生

  • 基础模型怎么满足形式化约束

过去几年,很多工作是在证明“模型能不能做到”。

而今天这些论文更像是在回答:

如果真要让系统长期运行、稳定部署、持续变强,到底该怎么设计它的内部结构。

这类论文未必每篇都会立刻爆火,但它们很可能会更真实地影响下一代 agent、推理系统和机器人系统的样子。

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐