最新 AI 论文盘点(2026-03-19):6 篇新作看 Agent 记忆、训练提速、KV 压缩与机器人低延迟控制
最新 AI 论文盘点(2026-03-19):6 篇新作看 Agent 记忆、训练提速、KV 压缩与机器人低延迟控制
今天这批论文如果放在一起看,主线其实非常清楚:
-
一条线是 Agent / LLM memory,大家开始认真讨论“长期记忆到底该怎么存、怎么复用、怎么治理”
-
一条线是 模型效率,不只是继续堆算力,而是从优化器、KV cache、注意力结构这些地方挤出真实收益
-
还有一条线是 机器人落地,重点已经越来越偏向“少改模型、在推理阶段提速、在部署阶段加约束”
这篇我挑 6 篇今天更值得看的论文,尽量不重复摘要,而是回答四个问题:
-
它到底在解决什么问题
-
方法新意在哪里
-
为什么现在值得关注
-
它的边界和风险是什么
1)AgentFactory:把成功经验从“提示词”升级成“可执行子代理”
论文: AgentFactory: A Self-Evolving Framework Through Executable Subagent Accumulation and Reuse
链接: https://arxiv.org/abs/2603.18000
这篇的核心切入点很准:
现在很多 agent 的“自进化”其实只是把成功经验写成:
-
reflection
-
textual memory
-
提示词模板
-
任务总结
问题是,这些东西看起来像经验,但并不能稳定复用成下一次可执行的能力。
AgentFactory 的思路更激进一些:
别只存文字经验,直接把成功方案存成可执行的 subagent 代码。
也就是说,一个任务做成之后,不只是留下一段“我下次应该这么做”的反思,而是沉淀成一个能真正被再次调用、还能继续被修正的 Python 子代理。
我觉得这篇论文最值得看的点,不是“代码复用”本身,而是它代表了一种能力沉淀范式的变化:
-
过去的 agent memory,更像是“记住说法”
-
这篇想做的,是“记住做法”
这对复杂任务尤其重要。因为很多任务真正难的部分,不是某个事实忘了,而是:
-
工具调用顺序复杂
-
环境依赖多
-
中间状态容易错
-
任务流程需要稳定重复
在这种情况下,文本反思经常不够用;而可执行子代理反而更接近“真正把能力封装下来”。
我为什么觉得它值得关注?
因为这方向会直接影响下一代 research agent / coding agent / workflow agent:
-
能不能把一次性成功变成长期资产
-
能不能减少每次从头规划的成本
-
能不能形成逐步增长的能力库
它的边界也很明显
-
子代理越积越多,后面会遇到检索、版本管理和冲突治理问题
-
“能执行”不代表“泛化得好”
-
一旦环境变了,旧 subagent 可能很快过时
所以我会把它看成一篇从 memory 走向 capability accumulation 的论文,而不是普通的“agent 记忆增强”。
2)Facts as First Class Objects:长期记忆别老塞上下文,事实应该单独建模
论文: Facts as First Class Objects: Knowledge Objects for Persistent LLM Memory
链接: https://arxiv.org/abs/2603.17781
这篇其实打到了一个很现实的问题:
现在很多长期记忆系统,说到底还是在做一件事——把事实塞进 prompt。
短期内这么做当然方便,但一上规模就会出现三个老毛病:
-
容量上限
-
压缩摘要带来的事实丢失
-
多轮 compaction 之后目标逐渐漂移
这篇论文提出的替代方案叫 Knowledge Objects(KOs),你可以理解为:
把事实当成独立对象存起来,而不是继续混在自然语言上下文里。
作者给出的实验结果很扎眼:
-
in-context memory 在窗口内可以表现很好
-
但一旦进入真实生产条件,容量、压缩和漂移问题会迅速暴露
-
KOs 在准确率、成本和多跳推理上都更稳
其中一个非常有意思的结论是:
compaction loss 很可能不是某个模型的问题,而是 prompt-memory 这种范式本身的问题。
这件事我很认同。
因为长期记忆系统一旦真的跑起来,问题往往不是“模型记不住一句话”,而是:
-
哪些事实应该长期保留
-
哪些约束不能被摘要吃掉
-
哪些记忆需要 O(1) 检索,而不是靠 embedding 近似召回
为什么值得关注?
因为它把“memory”从一个模糊概念拆成了更接近系统工程的对象:
-
prompt memory 负责临时工作区
-
object memory 负责稳定事实层
-
不同 retrieval 机制可以分工
这对个人助理、项目协作 agent、多轮任务代理都很关键。
它的边界是什么?
-
事实对象化之后,知识表达的粒度设计会很难
-
复杂依赖关系怎么建模,不是简单 tuple 就能解决
-
事实冲突、版本更新、时效性仍然是硬问题
但无论如何,这篇已经把一个重要信号说得很清楚:
长期记忆不该继续只靠“更长 prompt”硬撑。
3)MUD:优化器创新还没结束,训练提速还有硬骨头可啃
论文: Beyond Muon: MUD (MomentUm Decorrelation) for Faster Transformer Training
链接: https://arxiv.org/abs/2603.17970
这篇属于那种不一定最花哨,但工程上非常值得盯的论文。
它在解决的问题是:
怎么在不明显牺牲收敛质量的前提下,把 Transformer 训练的 wall-clock 再压下去。
过去这段时间,像 Muon 这类正交化动量优化器已经让很多人意识到:
-
AdamW 不一定是终点
-
优化器里还有不少结构性收益可以拿
但 Muon 一类方法也有现实问题:
-
需要较重的矩阵运算
-
开销很依赖硬件
-
理论上好看,工程上不总是划算
MUD 的思路,就是用更便宜的 decorrelation / whitening surrogate 去替代更重的极分解近似。
直白点说:
它不是否定 Muon 的方向,而是在问:能不能用更便宜的办法,拿到接近甚至更好的 time-to-perplexity。
结果也挺硬:
-
对 AdamW、Muon 都有 wall-clock 优势
-
峰值 tokens/s 能有 1.3-2.6x 提升
-
某些设定甚至接近 3x
为什么我觉得它值得看?
因为这类工作特别容易被低估。
现在大家注意力常常都在:
-
更大模型
-
更长上下文
-
更强推理
但真正落到训练系统时,优化器改良往往意味着非常直接的收益:
-
更低成本
-
更短实验周期
-
更快 ablation
-
更现实的中型团队可用性
边界也得说清楚
-
不同硬件上收益可能差很多
-
训练提速不一定自动转化为所有任务都更优
-
优化器换代的迁移成本不低,工业界 adoption 往往很慢
但如果你关心训练基础设施,这篇比很多“又大一点”的论文更值得看。
4)CARE:KV cache 不变的前提下,把注意力结构改得更强
论文: CARE: Covariance-Aware and Rank-Enhanced Decomposition for Enabling Multi-Head Latent Attention
链接: https://arxiv.org/abs/2603.17946
这篇的重点在 inference efficiency,而且切得很准。
现在大家对注意力结构优化,已经不只是关心“能不能压缩”,而是更关心:
能不能在不增加 KV cache 成本的前提下,把表达能力救回来。
这篇论文讨论的是把已有注意力模块转换成 MLA(multi-head latent attention)时,传统低秩近似为什么经常不够好。
作者指出几个关键问题:
-
只拟合权重矩阵,不关心激活分布
-
忽视 activation covariance
-
各层统一分配 rank,太粗暴
CARE 的改进点就在这里:
-
activation-aware factorization
-
非均匀 rank 分配
-
在固定 KV 宽度下做更合理的映射
最重要的一点是,它不是单纯追求“数学近似更漂亮”,而是明确追求:
在 matched KV budget 下,保住 attention fidelity 和下游准确率。
为什么值得关注?
因为这一类工作会越来越重要。
接下来大模型部署的真正矛盾之一,就是:
-
大家想要更长上下文、更强推理
-
但推理显存、KV cache、延迟成本始终摆在那里
所以谁能在 KV budget 不变时把表现拉回来,谁就真的有部署价值。
局限在哪?
-
这类方法通常对已有架构和权重分布比较敏感
-
转换效果未必能跨模型统一复用
-
后续还需要少量 fine-tune 才能完全恢复性能
但从方向上说,这篇很代表一种趋势:
推理优化不再只是“压缩”,而是更精细地利用结构和统计信息。
5)Specification-Aware Distribution Shaping:机器人基础模型开始补“形式化约束”这块短板
论文: Specification-Aware Distribution Shaping for Robotics Foundation Models
链接: https://arxiv.org/abs/2603.17969
机器人基础模型最近一个越来越明显的问题是:
它们会做事了,但不一定守规矩。
尤其在真实部署里,机器人面对的往往不是一句自然语言命令就完了,还要满足很多时序和安全约束,比如:
-
必须先去 A 再去 B
-
在某段时间内不能进入危险区
-
要持续满足安全边界
-
任务完成顺序不能乱
这篇工作做的,就是在不改预训练机器人基础模型参数的前提下,给它的 action distribution 加一层 specification-aware shaping。
而且不是软约束意义上的“尽量满足”,而是显式引入 STL(Signal Temporal Logic)约束。
这意味着什么?
意味着它尝试把“会执行自然语言任务”的能力,往“满足正式任务约束”的方向推一步。
这篇为什么我觉得重要?
因为它碰的是机器人 foundation model 一个迟早要补的缺口:
数据驱动模型擅长学行为,但不天然擅长满足形式化安全要求。
如果后面机器人真的进入更高风险、更复杂流程的场景,这类方法会非常关键。
它的边界也很现实
-
依赖 forward dynamics 推理,复杂系统里计算开销可能不小
-
形式化约束设计本身有门槛
-
真实环境偏差大时,理论满足和实际满足之间可能有缝
但从系统观上看,这篇非常值得跟:
它说明机器人基础模型下一步不是只追更大,而是要学会在既有模型上叠加可验证约束层。
6)ProbeFlow:VLA 低延迟控制,重点开始从骨干模型移到 action head
论文: ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models
链接: https://arxiv.org/abs/2603.17850
这篇是今天机器人方向里我最喜欢的一篇之一。
原因很简单:它抓住了一个非常实际、但过去经常被忽略的瓶颈。
现在很多 VLA 模型为了拿更强动作生成能力,会配 flow matching action head。问题是:
这个 action head 常常需要多步 ODE 求解,推理延迟很高。
过去很多优化工作都在加速 backbone,但真正拖后腿的地方,其实可能在 action decoding。
ProbeFlow 的思路非常讨巧:
-
不重新训练模型
-
不改 backbone
-
直接在推理阶段根据轨迹几何复杂度,动态决定需要多少 integration steps
这使得它在 MetaWorld 上能把 action decoding 平均步数从 50 降到 2.6,解码加速 14.8x,端到端延迟降 2.8x,而且基本不伤成功率。
为什么它很值得看?
因为它代表了一种很重要的工程心态:
真正阻碍部署的,不一定是模型主干不够强,而可能是某个被忽略的推理子模块太慢。
对机器人来说,这个判断尤其关键。因为物理控制里:
-
晚一点就是晚一点
-
延迟上去了,稳定性就可能掉
-
真实硬件不会因为你理论上更优就等你
它的边界是什么?
-
这是 inference-time 提速,不是底层能力突破
-
适用性和收益会依赖具体 action head 结构
-
一旦任务轨迹复杂度估计失真,可能会出现不稳定行为
但即便如此,这类 training-free acceleration 在现实里非常有价值。
因为它特别适合:
-
已有模型不能重训
-
线上系统需要快速提速
-
硬件预算有限
今天这 6 篇放一起,能看出什么趋势?
如果把它们放一起看,我觉得至少有 4 个信号非常明显。
1)Agent 的问题正在从“会不会做”转向“怎么长期积累能力”
AgentFactory 和 Facts as First Class Objects 都在说明一件事:
未来 agent 拼的不只是单次任务成功率,而是:
-
能不能长期保留有效能力
-
能不能稳定调用历史事实
-
能不能避免 memory 漂移和能力碎片化
2)模型效率创新越来越偏“结构层”和“系统层”
MUD、CARE 这类工作都不是简单做蒸馏或量化,而是在更底层的位置挖潜:
-
优化器结构
-
激活统计
-
KV budget 分配
-
注意力重参数化
这说明效率竞争进入更深水区了。
3)机器人基础模型正在补控制与约束,而不是只补数据规模
Specification-Aware Distribution Shaping 和 ProbeFlow 都很典型:
-
一个解决“守不守规则”
-
一个解决“来不来得及执行”
这比单纯再训大一点模型,更像真实部署会碰到的问题。
4)“少改模型,多改推理与外层系统”会越来越流行
今天很多值得看的工作都不强调重训一个新大模型,而是:
-
改 memory 组织方式
-
改执行单元复用方式
-
改优化器
-
改 MLA 转换流程
-
改推理阶段 action shaping
这类方法短期可能没那么“震撼”,但往往更容易真正落地。
如果你时间有限,我建议优先看哪几篇?
第一梯队:最值得细看
-
AgentFactory:如果你关心 agent capability accumulation,这篇很值得跟
-
Facts as First Class Objects:如果你关心长期记忆系统,这篇很关键
-
ProbeFlow:如果你关心 VLA 和真实机器人部署,这篇非常实用
第二梯队:看系统趋势
-
MUD:训练效率党必看
-
CARE:长上下文和推理部署党必看
-
Specification-Aware Distribution Shaping:机器人安全与形式化约束方向值得跟
结语
今天这批论文给我的一个强烈感觉是:
AI 系统正在进入一个更讲“结构化工程能力”的阶段。
这里说的结构化,不只是模型结构,而是:
-
记忆怎么组织
-
能力怎么沉淀
-
训练怎么提速
-
KV cache 怎么精打细算
-
机器人动作怎么更快地产生
-
基础模型怎么满足形式化约束
过去几年,很多工作是在证明“模型能不能做到”。
而今天这些论文更像是在回答:
如果真要让系统长期运行、稳定部署、持续变强,到底该怎么设计它的内部结构。
这类论文未必每篇都会立刻爆火,但它们很可能会更真实地影响下一代 agent、推理系统和机器人系统的样子。
更多推荐



所有评论(0)