一、大模型的天花板:纯文本的局限

大模型在处理文本方面展现了惊人的能力。它们可以回答问题、撰写文章、生成代码、进行推理。然而,大模型本质上是文本模型,它们的认知边界被训练数据所限定。模型只能知道训练数据中存在的信息,无法获取实时数据,无法执行实际操作,无法感知物理世界。

当用户问现在天气怎么样时,模型无法给出答案,因为它不知道现在的时间,也不知道当前的天气状况。当用户要求帮我发一封邮件时,模型可以生成邮件内容,但无法真正发送。这种局限通常被称为可读不可写的能力限制。

大模型的天花板不是模型规模,而是与世界交互的能力。一个模型可以拥有完美的语言能力,但如果不能获取实时信息、不能执行操作,它的价值就受到严重限制。这正是 MCP 发挥作用的地方。

MCP 作为大模型的原生认知扩展,让模型能够超越训练数据的边界,获取实时信息,调用外部能力,执行实际操作。本章将探讨 MCP 如何扩展模型的世界认知能力,从被动的工具调用到主动的能力发现,以及 MCP 作为模型与物理世界桥梁的角色。

二、从被动调用到主动发现

在传统的工具调用模式中,模型是被动的。开发者预先定义一组可用的工具,将工具的描述放入提示词中。模型根据用户请求,从这些工具中选择一个并生成调用指令。模型不能发现新的工具,不能探索工具的能力边界,不能组合工具创造新的功能。

这种被动模式的局限性很明显。工具集是静态的,模型只能使用预先注册的工具。模型不了解工具的实时状态,如是否可用、当前负载。模型不能根据任务动态调整工具选择策略。模型不能主动建议使用工具来帮助用户。

MCP 开启了主动能力发现的可能。通过 MCP 协议,模型可以查询可用的 Skill 列表,获取每个 Skill 的描述和能力边界。模型可以根据任务的进展动态发现新的 Skill。模型可以主动询问用户是否允许调用某个 Skill。模型可以组合多个 Skill 完成复杂任务。

这种主动能力发现让模型从一个文本生成器变成了一个任务执行者。模型不再只是告诉用户我可以帮你做什么,而是主动采取行动帮助用户解决问题。

三、MCP 作为情境感知层

大模型的一个核心弱点是缺乏情境感知。模型不知道当前时间,不知道用户位置,不知道用户的身份和权限,不知道对话的上下文历史(除了提示词中包含的内容)。MCP  Context 机制可以弥补这一缺陷。

用户身份的传递

通过 MCP ContextAgent 可以将用户身份信息传递给 SkillSkill 可以根据用户身份提供个性化服务,例如根据用户的偏好推荐商品,根据用户的权限决定可执行的操作。用户身份信息的传递需要遵守隐私法规,Peta 支持对敏感身份信息进行脱敏处理。

会话状态的保持

在多轮对话中,Agent 需要保持会话状态,记住用户之前提供的信息,记住已经执行过的操作。MCP Context 可以作为会话状态的载体。Agent 在每个 Skill 调用中传递 ContextSkill 将执行结果写入 Context,后续的 Skill 可以读取这些信息。这种机制让模型能够记住对话历史,而不需要将完整历史每次都放入提示词。

环境信息的注入

MCP Context 还可以携带环境信息,如当前时间、用户位置、设备类型、网络状态。Skill 可以根据环境信息调整行为。例如,一个物流查询 Skill 可以根据用户位置计算预计送达时间。一个天气查询 Skill 可以根据用户位置提供本地天气。环境信息的注入让模型能够感知物理世界。

四、Skill 调用作为事实校验

大模型的幻觉问题一直是应用中的难题。模型可能生成看似合理但实际错误的信息。在没有外部校验的情况下,用户很难区分模型的真实知识和幻觉。

MCP Skill 调用可以作为事实校验的来源。当模型不确定某个信息时,可以调用相应的 Skill 获取权威数据。例如,当用户问某支股票的价格时,模型可以调用股票查询 Skill 获取实时价格,而不是依赖训练数据中的过时信息。当用户问某个历史事件的时间时,模型可以调用知识库 Skill 查询权威记录。

多个 Skill 的交叉校验可以进一步提高准确性。模型可以调用两个不同的数据源 Skill,比较它们的结果,如果结果一致则采纳,如果不一致则请求用户确认或选择置信度更高的来源。这种交叉校验机制可以大幅降低幻觉的风险。

五、MCP 作为模型与物理世界的桥梁

模型存在于数字世界,而用户的需求往往涉及物理世界。MCP 提供了连接数字与物理的桥梁。

物理设备控制

通过 MCP Skill,模型可以控制物理设备。智能家居 Skill 可以控制灯光、温度、安防系统。工业设备 Skill 可以读取传感器数据、调整生产参数。机器人 Skill 可以控制机械臂的运动。MCP 的审批机制可以确保高风险物理操作得到适当的授权。

实时数据获取

物理世界的状态是实时变化的。通过 MCP Skill,模型可以获取实时数据。交通 Skill 可以获取路况信息。物流Skill 可以追踪包裹位置。金融 Skill 可以获取实时行情。这些实时数据让模型能够提供准确、及时的答案。

操作执行

模型不仅要知道信息,还要能够执行操作。通过 MCP Skill,模型可以发送邮件、创建日历事件、下单购买、启动工作流。MCP 的审计日志记录了所有操作,满足合规要求。人工审批机制为高风险操作提供了安全网。

六、Peta 在模型认知扩展中的角色

Peta 作为 MCP 控制平面的具体实现,在大模型的认知扩展中扮演着关键角色。

Skill 的发现与调用

Peta 提供了 Skill 注册表,模型可以查询可用的 SkillPeta 网关负责将模型的 Action 请求路由到正确的 SkillPeta 的策略引擎控制模型可以调用哪些 Skill

上下文管理

Peta 网关自动维护 Context 的生命周期。模型不需要管理会话状态,只需要在每次调用时提供 context_idPeta 负责存储和检索 Context 数据。

可观测性

Peta 的审计日志记录了所有 Skill 调用。模型开发者可以分析这些日志,了解模型如何与 Skill 交互,发现问题和优化机会。

七、未来展望:从工具调用到世界模型

当前,MCP 主要帮助模型调用外部工具。未来,MCP 可能成为构建世界模型的基础。世界模型是 AI 对物理世界的内在表征,包括物理规律、因果关系、时间变化。通过 MCP Skill,模型可以不断与物理世界交互,积累经验,逐步构建自己的世界模型。

模型可以通过传感器 Skill 感知环境,通过执行器 Skill 改变环境,通过反馈学习因果关系。模型可以预测某个操作的结果,选择最优的操作序列。模型可以适应环境的变化,持续更新世界模型。

MCP 提供了标准化的接口,让各种传感器和执行器可以被模型统一调用。这为构建通用的世界模型奠定了基础。

八、小结

本章的核心结论可以总结为以下几点。

第一,大模型的天花板不是模型规模,而是与世界交互的能力。MCP 作为模型的原生认知扩展,让模型能够突破训练数据的边界。

第二,从被动工具调用到主动能力发现,让模型从一个文本生成器转变为一个任务执行者。

第三,MCP Context 作为情境感知层,传递用户身份、会话状态、环境信息,弥补模型对物理世界的感知盲区。

第四,Skill 调用可以作为事实校验的来源,多个 Skill 的交叉校验可以大幅降低模型幻觉的风险。

第五,MCP 是连接数字世界与物理世界的桥梁,支持物理设备控制、实时数据获取、操作执行。

第六,Peta 在模型认知扩展中提供 Skill 发现、上下文管理、可观测性等关键能力。

第七,未来,MCP 可能成为构建世界模型的基础,让模型通过持续与环境交互积累经验。

在下一章,我们将讨论模型原生支持 MCP 的技术路径——微调、函数调用与协议内置。

更多推荐