颠覆认知还是不切实际?剑桥发文力推“纯视觉推理”,大模型真的可以“不读文字”就思考吗?
本文关键结论如下:
1、传统的 AI 推理严重依赖“视觉信息→文本→推理”的转换,在空间、几何等视觉密集型任务中存在“模态鸿沟”。这篇论文首次证明,AI 模型可以在完全脱离文本中介的情况下,仅通过图像序列进行“可视化思考”和任务规划,为机器人导航、室内设计等领域提供了全新的解决思路。
2、强化学习是解锁“纯视觉规划”的关键。 监督学习只能让模型模仿既有轨迹,而无法真正掌握规划的底层逻辑。该研究通过引入强化学习(GRPO),利用“探索-奖励”机制,引导模型学习视觉状态间的有效转换,这不仅显著提升了模型的泛化性和鲁棒性,更让其在分布外场景的表现远超基于语言的模型。
3、类认知中存在独立的语言和视觉通道,它们各有所长。论文的成功为构建“语言与图像交织的推理轨迹”奠定了基础。这预示着未来的 AI 模型将能根据任务需求,在不同模态间自由切换,实现更接近人类的“双语义通道”思考模式,弥补单一模态的不足。
4、从传统的 CNN 到 Transformer,AI 视觉范式的演变本质上是一场“去偏置化”的变革,旨在将所有视觉信息编译成一种通用序列。这使得 AI 具备了处理多种任务的潜力。然而,如何脱离语言来定义和验证抽象概念,仍是摆在面前的巨大挑战。在“让 AI 学会”(知其然)与“让人类理解 AI 如何学会”(知其所以然)之间,我们仍需持续探索语言与视觉模态的协作边界,才能最终解锁真正的通用人工智能。
近期,剑桥大学、伦敦大学联合谷歌发表了一篇论文
论文:Visual Planning: Let’s Think Only with Images链接:https://arxiv.org/abs/2505.11409
从标题就能看出,这是在探索仅利用视觉模态,是否可以提升大模型的推理规划能力,这也是这篇论文引出的最关键的一个问题:除了已被证明的文本模态知识探索,这一代大模型技术是否能激发视觉模态的知识探索?
一、提出背景
1.现有模型局限:大型语言模型(LLMs)及其多模态扩展(MLLMs)虽大幅提升推理能力,但即便输入包含视觉信息,推理过程仍主要依赖文本媒介 —— 需先将视觉内容转化为文本再进行推理,这在空间、几何等视觉密集型任务中会引入 “模态鸿沟”,阻碍对视觉特征和状态转换的捕捉。例如迷宫导航、机械系统状态预测等任务,语言描述难以精准传递复杂空间关系。
2.现有研究缺口:虽有研究尝试结合文本与图像作为推理步骤,但本质仍以文本为核心,视觉仅作为辅助工具(如生成草图辅助文本推理),真正脱离文本中介的纯视觉推理范式尚未被充分探索。
3.认知科学支撑:双重编码理论指出人类认知存在语言与非语言两个独立通道,为 “纯视觉推理” 提供了理论依据,暗示模型可借鉴人类 “可视化思考” 的方式实现规划。

不同推理范式的比较。 传统方法(顶部和中间行)会生成冗长且不准确的文本规划,而视觉规划范式(底部行)则直接预测下一个视觉状态,形成一条无需语言作为中介的纯图像轨迹。
二、核心解决问题
解决 “多模态推理过度依赖文本中介” 的核心痛点,具体包括:
1.验证模型能否在无文本参与的前提下,仅通过视觉表征(图像序列)实现规划推理;
2.消除 “视觉信息→文本→推理” 的模态转换环节,突破语言对视觉密集型任务(如空间导航)的限制;
3.构建一种比文本基推理更适配视觉场景的规划范式,提升任务性能与泛化能力。
三、高维认知观点
1.模态适配性认知:语言并非推理的 “万能媒介”,不同任务存在 “最优模态匹配”—— 视觉密集型任务中,图像能更直接、直观地编码空间关系与状态转换,比文本更适合作为推理载体。
2.AI 推理范式革新:挑战了 “文本为推理核心” 的传统认知,提出 “视觉可作为独立推理模态” 的新范式,呼应人类认知中 “可视化思考” 的重要性,推动 AI 推理从 “语言中心化” 向 “多模态自主化” 演进。
3.强化学习的跨模态价值:强化学习在语言推理中展现的泛化优势可迁移至视觉域,通过 “探索 - 奖励” 机制引导模型学习视觉状态间的有效转换,而非单纯模仿最优轨迹。
四、具体解决方案
4.1 核心范式:视觉规划(Visual Planning)
定义为 “给定初始视觉状态 v0 ,生成中间视觉状态序列 T=(v1,…,vn)的过程”,每个中间状态 vi 通过自回归方式生成(依赖初始状态与历史状态),直接编码规划步骤,无需文本中介。
4.2 技术框架:基于强化学习的视觉规划(VPRL)
采用两阶段强化学习框架,以大型视觉模型(LVM,仅训练于图像 / 视频,无文本数据)为骨干,借助 GRPO 算法优化:
- 阶段 1:策略初始化(监督微调)
用环境中随机游走的轨迹训练模型,生成 (v≤i,vi+1)图像对,通过最小化视觉规划损失函数 L{VPFT},使模型掌握 “生成视觉连贯的下一状态” 能力,同时保留探索性(避免过拟合特定轨迹)。此阶段仅优化输出格式,不教授规划逻辑。 - 阶段 2:强化学习优化
基于阶段 1 的初始化模型,通过 GRPO 算法生成 G 个候选下一状态,利用 “状态 - 动作解析函数” 将视觉状态转换映射为离散动作,并通过 “进度奖励函数” 评分:对向目标推进的最优动作奖励 1,非最优动作奖励 0,无效动作(如穿墙)惩罚 - 5。通过最大化目标函数 L{VPFT}更新策略,实现目标导向的视觉规划。

VPRL 框架概览:该图以一个视觉导航任务为例,展示了如何应用自回归大型视觉模型来进行图像生成。我们使用 GRPO 算法来训练视觉策略模型,并采用了一种“进程奖励 (progress reward)”机制——该机制会鼓励有进展的动作、惩罚无效动作,从而实现与目标对齐 (goal-aligned) 的视觉规划。
4.3 对比基线设计
设置 3 类基线以验证方案有效性:
- 文本基监督微调(SFT):将规划转化为 “生成动作文本序列” 任务;
- 视觉基监督微调(VPFT):用最优轨迹替代随机轨迹进行微调,无强化学习阶段;
- 现有多模态模型(Gemini 2.0 Flash、Qwen 2.5-VL 等):评估推理仅(Direct)与思维链(CoT)模式的性能。
五、实验结果
实验在 FROZENLAKE(冰湖导航)、MAZE(迷宫导航)、MINIBEHAVIOR(打印机拾取 - 放置)3 个视觉导航任务上开展,核心结果如下:

闭源及开源模型在 FROZENLAKE、MAZE 和 MINIBEHAVIOR 三个任务上的性能表现。VPRL 在所有任务中始终表现最佳(以粗体标出)。† 符号表示经过后训练(post-trained)的模型。A 符号代表文本,照片符号代表图像。最后一列 AVG. 报告了模型在这三个任务上的平均性能。

各任务的图示说明,其中展示了由LVM(大型视觉模型)生成的视觉规划轨迹,并涵盖了不同类型的动作(最优、次优和无效)。

FROZENLAKE 环境中一个测试案例的可视化,该图比较了不同的视觉规划变体(VPFT 和 VPRL)与基于语言的推理变体。
六、视觉规划显著优于文本推理:
VPRL 在 3 个任务上的平均精确匹配率(EM)达 80.6%、平均进步率(PR)达 84.9%,远超所有文本基方法 —— 比语言基 SFT 平均 EM 高 46.3%,比进阶闭源模型 Gemini 2.5 Pro 平均 EM 高 36.9%。例如 FROZENLAKE 任务中,VPRL 的 EM(91.6%)是 Gemini 2.5 Pro(72.0%)的 1.27 倍。
1.强化学习带来关键提升:
两阶段框架中,阶段 1 仅实现随机性能(FROZENLAKE 的 EM 仅 11.1%),阶段 2 强化学习后性能提升超 80%;相比纯监督微调的 VPFT,VPRL 在所有任务上的 EM 平均提升 24.5%。
2.泛化性和稳健性更强:
随任务难度增加(如 FROZENLAKE 网格从 3×3 增至 6×6),Gemini 2.5 Pro 的 EM 从 98.0% 骤降至 38.8%,而 VPRL 仅从 97.6% 降至 82.4%;在分布外场景(如训练于小网格、测试于 7×7 大网格),VPRL 的 EM(20.4%)是 VPFT(9.6%)的 2.1 倍。

在不同难度等级的 FROZENLAKE 环境中评估模型性能:随着网格规模的扩大导致环境复杂性增加,基于语言的推理方法其性能出现了急剧下降;相比之下,视觉规划方法的性能下降则更为平缓,从而展现出更强的鲁棒性。
3.有效减少无效动作:
VPRL 的 “无效失败率”(因无效动作导致的失败占比)在 3 个任务中均比 VPFT 低 24% 以上 —— 例如 MINIBEHAVIOR 中,VPFT 的无效失败率达 78.3%,而 VPRL 仅 29.6%。
七、启示
1.模态适配性优先:AI 推理范式设计应 “因任务择模态”,视觉密集型任务中,放弃 “文本中介” 的纯视觉规划能更充分发挥数据价值,为机器人导航、室内布局设计等领域提供新思路。
2.强化学习的跨模态潜力:强化学习不仅适用于语言推理,在视觉生成式规划中能通过 “探索 - 奖励” 机制捕捉潜在规则,比监督微调更能抵抗过拟合、提升泛化性。
3.多模态推理新方向:为 “语言 + 视觉” 融合推理提供基础 —— 未来可构建 “文本与图像交织的推理轨迹”,实现更接近人类的 “双语义通道” 思考模式。
八、局限性
1.模型与任务范围受限:仅采用 3B 参数的 LVM 模型,未验证更大规模或原生多模态模型的适配性;任务集中于网格导航,未扩展至更复杂的真实场景(如户外导航、工业检测)。
2.计算与解析瓶颈:图像生成比文本输出存在更高的计算开销;状态 - 动作解析依赖规则式方法(像素比对),泛化到非网格场景的能力较弱,需结合分割、轮廓检测等计算机视觉技术优化。
3.初始化依赖人工设计:阶段 1 的随机轨迹生成与阶段 2 的奖励系数需人工设定,缺乏自适应调整机制。
九、One More Thing:视觉模态能否驱动 AI 大模型脱离语言实现能力飞跃?
下面先简单列举一些认知科学的观点,用来证明:视觉模态和语言模态彼此存在的必要性、独立性和依存性。但简单来说:人类可以通过独立的视觉模态学习世界/物理知识,但如果脱离语言,这些知识就很难被正确表达,也就成为了一些必须通过实践获取的“隐形知识”。
从这个角度来看,不管是数据驱动还是环境驱动,我们终归要定义好“目标”,我们究竟是希望“AI 学会“,还是希望”我们知道 AI 是否学会“,我自己的理解是:如果是前者-”知其然“,从认知科学的角度,独立的视觉模态一定可以解锁 AI 的一大波能力;如果是后者-”知其所以然“,我们从一开始就很难脱离语言模态,独立开展视觉的技术探索。
- 认知科学的双重编码理论早已证实,人类认知存在语言与非语言(视觉)两个独立处理通道,且二者在大脑中有着明确的功能分区与协作机制。神经科学研究显示,人脑近半数皮层区域专门用于视觉信号处理,处理图像的速度是文字的 6 万倍,传输至大脑的信息中 90% 为视觉信息,这种生理结构决定了视觉是人类感知世界的核心通道。
- 而纯粹的 LLM 本质上只有一个“语言系统”。它对“苹果”的理解,是建立在海量文本中“苹果”一词与其他词(如“红色”、“水果”、“牛顿”)的统计关系之上。它从未“见过”苹果,无法形成一个非语言的、感性的“意象”表征。这种知识是不完备且脆弱的。当被问及“一个正常的苹果能立在针尖上吗?”这类需要视觉空间常识的问题时,它可能会因训练数据中缺乏直接描述而犯错。
- 而具身认知 (Embodied Cognition)理论强调,认知过程并非独立于身体之外的抽象计算,而是深深植根于身体与物理世界的感官运动交互之中。我们的“常识”(例如,知道杯子会摔碎、绳子只能拉不能推)并非来自书本,而是来自与世界互动的经验。我们的思维离不开我们的身体和感官。
- 由詹姆斯·吉布森(James J. Gibson)提出,该理论认为环境中的物体直接向观察者“提供”了行动的可能性。我们看到一个杯子,就直接感知到它“可被拿起”的属性;看到一扇门,就感知到它“可被推开”。行动的决策在很大程度上是基于直接的视觉感知,而非复杂的语言推理。
- 视觉记忆的独特优势为独立认知提供了支撑。认知心理学研究表明,视觉记忆比言语记忆更稳固持久,且能支持旋转、折叠、扫描等多种心理操作,其表征方式与言语记忆存在根本差异。这种特性在 AI 中已得到呼应:SAM 模型通过海量视觉数据训练,无需语言中介即可实现跨领域物体分割,展现出视觉模态独立处理具象信息的强大能力,本质是对人类视觉心象操作机制的模拟。
- 同时概念隐喻理论指出,人类对抽象概念的理解需通过 “具体域→抽象域” 的隐喻映射实现,而语言是这种映射的核心载体。视觉虽能呈现具象现象(如 “物体坠落”),却无法直接提炼 “因果关系”“重力定律” 等抽象属性 —— 这恰是 AI 纯视觉模型的关键瓶颈。例如,视觉大模型可精准识别火焰图像,却需依赖语言构建的 “火焰→危险→规避” 语义链才能形成决策,印证语言对视觉认知的升华作用。
而回到技术架构是否可以解锁的角度,可以从上一代 CNN/RNN 图像范式→Transformer 大模型范式的角度来切入理解:
- 旧范式 (CNN 时代):我们将图像视为一个具有强空间归纳偏置的像素网格。CNN 的卷积核、池化层等设计,都是基于“像素是局部相关的”、“特征具有平移不变性”等先验知识。这个“偏置”让 CNN 在特定任务上效率极高,但也成为了它的“思想钢印”,限制了其通用性。每个任务(检测、分割、深度估计)都需要精心设计的网络主干和任务头(Head),它们是“术业有专攻”的专家。
- 新范式 (Transformer 时代):视觉 Transformer (ViT) 的核心思想是“去偏置化”。它极其大胆地将图像分解为一系列扁平化的图块(Patches),并宣称:“我不知道这些图块之间有什么关系,但我拥有一个极其强大的工具——自注意力机制(Self-Attention),可以在海量数据中自己学会这些关系。”
这一步的本质是将所有视觉信息(无论其原始形态如何)都抽象和“编译”成一种通用的、无偏置的序列化语言。图像、视频(图像序列)、3D 点云、多视角图像、医学影像…… 任何视觉数据都可以被”Token 化“成这种通用序列。
那我们再思考一下,”Token 化“究竟适合哪些任务呢?本质上 Transformer 是个自回归的 Seq2Seq 模型,也就是非常适合序列生成任务,所以上述论文提到的导航、拿起-放下等视觉任务,是不是很符合这套 step by step 的逻辑,但其它任务呢?坦白说,我认为理论上都可以被抽象为 step-by-step 的时序任务,但如何抽象是正确的,不损失的,尽可能少遗漏知识的,这就需要后续的技术探索了。
如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套 AI 大模型突围资料包:
- ✅ 从零到一的 AI 学习路径图
- ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
- ✅ 百度/阿里专家闭门录播课
- ✅ 大模型当下最新行业报告
- ✅ 真实大厂面试真题
- ✅ 2025 最新岗位需求图谱
所有资料 ⚡️ ,朋友们如果有需要 《AI大模型入门+进阶学习资源包》,下方扫码获取~

① 全套AI大模型应用开发视频教程
(包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点)

② 大模型系统化学习路线
作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!

③ 大模型学习书籍&文档
学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。

④ AI大模型最新行业报告
2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

⑤ 大模型项目实战&配套源码
学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。

⑥ 大模型大厂面试真题
面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

以上资料如何领取?

为什么大家都在学大模型?
最近科技巨头英特尔宣布裁员2万人,传统岗位不断缩减,但AI相关技术岗疯狂扩招,有3-5年经验,大厂薪资就能给到50K*20薪!

不出1年,“有AI项目经验”将成为投递简历的门槛。
风口之下,与其像“温水煮青蛙”一样坐等被行业淘汰,不如先人一步,掌握AI大模型原理+应用技术+项目实操经验,“顺风”翻盘!


这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


以上全套大模型资料如何领取?

更多推荐
所有评论(0)