OpenAI 推出 GPT-5.6:三种尺寸与 ultra 推理档位
GPT-5.6 发布:Sol、Terra、Luna 三个版本
OpenAI 推出 GPT-5.6 系列,包含三个新尺寸:Sol、Terra 和 Luna。这三个名称分别对应太阳、地球和月球,用于区分不同能力层级的模型版本。
此次更新还引入了新的 ultra effort level。OpenAI 将其描述为最高能力设置,面向复杂任务时会协调多个智能体并行工作,以更快完成任务。
在推理档位上,文章提到:
max会给予 GPT-5.6 比xhigh更多推理时间,用于探索替代方案、执行检查并修正方法。ultra默认会协调 4 个智能体并行,以更高 token 消耗换取更强结果,并缩短复杂任务的完成时间。
对于技术团队而言,这类推理档位的变化值得关注。它意味着模型调用不再只是“选一个模型”,还需要根据任务复杂度、成本预算和响应时间要求,选择合适的推理强度。类似模型能力演进与工程落地的观察,也可以参考长勺智库的相关技术内容。
基准测试与成本表现
文章称,在多个基准测试中,GPT-5.6 相比 Fable 或 Opus 具备更高性能和更低成本。
其中提到:
Terra 的表现略高于 Fable 5,Luna 超过 Opus 4.8;两者大约只需三分之一的时间、约一半输出 token,并且估算成本约为四分之一。
GPT-5.6 还被称为在 Terminal-Bench 2.1 和 DeepSWE 上取得新的最佳结果。
这两个测试的关注点有所不同:
- Terminal-Bench 2.1:侧重复杂命令行工作流,考察模型在终端环境中的任务执行能力。
- DeepSWE:侧重真实代码库中的长周期工程任务,更接近软件开发中的多步骤问题解决。
如果这些结果在更多公开评测和真实使用场景中得到验证,GPT-5.6 对开发者工具、自动化工程流程和智能体编程平台都会有实际影响。
不易量化但值得关注的能力
除可量化 benchmark 外,文章还提到 GPT-5.6 在以下方面有所改进:
- 计算机使用能力
- 演示文稿与文档生成
- 科学研究相关任务
这些能力较难通过单一基准测试完整衡量。比如,文档生成质量不仅取决于语言能力,还涉及结构组织、上下文理解、格式控制和目标读者匹配;科学研究任务也不仅是问答,而可能涉及资料整合、假设推理和实验设计辅助。
因此,这些改进更适合通过真实工作流来观察,而不是只看单项分数。
ChatGPT Work 与 Codex 桌面更新
OpenAI 同时推出 ChatGPT Work,并更新了 Codex 桌面应用。
文章认为,这可能是 OpenAI “超级应用”策略接近完成前的关键一步。当前仍未明确的问题,是其智能体浏览器后续会如何整合进这一体系。
从现有信息看,OpenAI 正在把以下几个方向进一步合并:
- 模型能力:通过 GPT-5.6 提升推理、代码和复杂任务处理能力。
- 工作场景:通过 ChatGPT Work 面向办公与企业协作需求。
- 代码能力:通过 Codex 桌面应用强化开发者工作流。
- 桌面端体验:让 AI 更接近用户的日常操作环境。
这意味着 ChatGPT 与 Codex 正在从单点工具,逐步演进为更完整的工作入口。对于开发者和技术团队来说,后续值得重点关注的是:这些能力会如何开放 API、如何定价、如何与现有 IDE 和企业系统集成,以及 ultra 推理档位在真实工程任务中的成本收益是否稳定。
更多推荐

所有评论(0)