大语言模型记忆能力有限,为什么能像“什么都记得”一样聪明地完成复杂任务?
在大模型能力迅猛发展的当下,越来越多的产品开始声称“支持无限上下文”,甚至可以基于自然语言完成复杂的自动任务。这些产品的底层逻辑究竟是什么?他们是如何破解模型上下文长度的技术限制,实现“丝滑调用”的?
本期新致软件AI技术沙龙,我们围绕上下文工程(Context Engineering)展开深入讨论,结合业内实践、实际业务场景和最新研究,共同探讨下一代智能体系统的技术走向。
01 为什么这些智能体看起来这么聪明?
我们都用过AI助手,比如ChatGPT、deepseek或Kimi,对吧?你可能会想:
“我扔进去一堆资料,它怎么就能理解重点、知道该怎么回答了?”
它们并不是“真的记住了所有信息”,而是通过一种“上下文管理”的技术手段——就像一个秘书在老板问问题前,把各种文档提前整理、提炼、过滤好,让老板(模型)一下子就能看懂重点。
举个栗子:你要复习 2000 页的教材,但临考试前只剩 3 天,你要如何高效应试?老师可能会建议你这样做:
-
挑选:只看考试大纲里的重点章节(选择)
-
压缩:用思维导图记下核心知识点(压缩)
-
清洗:不要去看无关的拓展材料(清洗)
-
回查:遇到不会的题,再翻教材查细节(回查)
这也就是上下文工程在AI里的作用:上下文工程让大模型像学生一样,知道怎么高效应试。在有限的“记忆容量”里,通过挑选、压缩、清洗、回查,让模型“看似什么都能处理”。
02 什么是“上下文”?
“上下文”就像模型的大脑在“当前任务”中能看到的全部信息,即模型的“工作记忆

但问题来了:模型的记忆(token)是有限的!比如:
-
GPT-4.1一次最多处理 128K tokens(大约5-9万汉字)
-
Claude 4.1可以到 200K tokens,但还是“有限的”
所以,如果你硬把50份简历扔进去,它根本看不过来。那怎么办呢?
我们就要通过“上下文工程”来做取舍:
Step1 Instruction(指令):告诉模型“你现在要干嘛”
Step2 Relevant Knowledge(相关知识):挑出“只对当前任务有用的信息”
Step3 Tool Calling(工具调用):必要时不要靠模型生成,而是直接查工具(例如数据库、API)
03 上下文工程为什么难?
想象你在用AI助手筛选简历,它犯错的常见原因可能有:
| 问题类型 | 举例 | 类比 |
| 污染 |
有个简历写得天花乱坠但不符合岗位需求,模型却被误导了 |
像面试官被简历里的“名词堆砌”洗脑了 |
|
分散 |
模型同时看20份简历,它抓不住谁最重要 |
就像你一下子看20本书的摘要,信息太杂 |
|
混淆 |
有两个“张伟”,一个是程序员,一个是设计师,模型搞混了 |
同名不同人 |
|
冲突 |
上文说“要求本科”,下文却筛了个大专生 |
前后内容互相矛盾,模型迷惑了 |
所以需要五步工程策略:
Step1 写入(Write):把上下文都记录在库里
Step2 选择(Select):根据任务挑相关的片段
Step3 压缩(Compress):把长信息变短,只保留重点
Step4 隔离(Isolate):避免冲突信息一起出现
Step5 回查(Recall):模型答不上时再去查历史信息
这就是“上下文工程五部曲”,是现在业界最常用的一种设计范式。
04 用AI筛选100份简历,咋搞?
想象你是HR,让一个智能体帮你从100份简历中找出最适合的3个候选人。AI模型怎么做?
它一次最多只能“记住”10份,所以它的做法可能是这样的:
-
第一轮:10份10份看,筛掉不合格的(粗筛)
-
第二轮:把初筛选出的20份再细比,排个序
-
第三轮:把最优的3-5份“拼接”到一个大上下文里,做最终推荐
你觉得这个过程像什么?是不是像一个面试助理「分批阅读+迭代淘汰+打分推荐」的过程?
05 MemoryOS 是什么?

大部分AI模型是“短期记忆”,聊完一轮对话就忘了。来自北京邮电大学的研究项目 MemoryOS 提出一种三层记忆结构,用于解决智能体中的长期上下文学习问题。MemoryOS这个开源系统设计了“类人类记忆结构”,包括:
-
STM(短期记忆):当前任务的上下文
-
MTM(中期记忆):压缩后的历史关键点(比如某用户常提的问题)
-
LTM(长期记忆):结构化的人设、偏好、知识(如你喜欢用什么风格语言)
它的目标是:
-
让智能体知道你是谁
-
记得你之前做过什么任务
-
知道你喜欢什么样的回答风格
换句话说:MemoryOS 是一个让模型变成“有记忆的AI助理”的操作系统框架。
06 智能体将能自动理解“结构化数据
智能体不仅理解自然语言,还能看懂结构化的数据,比如表格、JSON、数据库,然后自动完成任务。假如你是保险从业者,你问智能体说:“帮我找出所有高风险客户过去半年的理赔记录。”智能体的操作:
Step1:自动看懂数据结构(字段名、关系)
Step2:自动组织任务步骤(筛选 → 合并 → 查询)
Step3:用最短上下文告诉模型做判断
Step4:给你一个结构化、靠谱的结果
这已经不是聊天机器人了,而是一个“懂业务、能理解数据、自动执行”的数字员工!
结语 AI的下一个突破,或许藏在“上下文”里
过去我们以为大模型的能力取决于参数量和训练数据,但越来越多的实践告诉我们:真正影响模型表现的,不是“它能干什么”,而是“它能看到什么”。上下文工程,就是为大模型构建“有效视野”的科学与艺术。它不仅关乎性能,更关乎产品体验、智能程度,甚至影响一个Agent是否值得信任。
未来,“Memory-as-a-Service”或许将成为每个大模型应用平台的标配组件。谁能更好地理解上下文、管理上下文、编排上下文,谁就能构建出真正“可持续、可控、可进化”的智能体系统。上下文就是大模型的“注意力资源”,如何用好它,将决定AI产品的上限。
最后让我们总结归纳一下本期内容关键点:
上下文工程(Context Engineering):用工程手段筛选、管理、重组模型能看到的信息
智能体(Agent):可以自动执行任务的大模型“代理人”
Token限制:模型一次最多能处理的信息量上限(像记忆条)
工具调用(Tool):模型不擅长的部分交给程序/接口完成
MemoryOS:给模型构建“长期记忆”的系统架构
更多推荐
所有评论(0)