我这次最先感受到的,不是“更聪明了”,而是“终于没那么容易散架了”。

如果只问一句“GPT-5.4值不值得用”,我的答案会很克制:对重度用户,尤其是写代码、做研究、整理复杂材料的人,值得;对只是日常聊天、问几个常识问题的人,升级感知没你想的那么夸张。OpenAI 这次自己给它的定位也很直接:这是一个面向专业工作的主线推理模型,上线到了 ChatGPT、API 和 Codex。ChatGPT 里对应的是 GPT-5.4 Thinking,另外还有一个更猛但更贵的 GPT-5.4 Pro。我觉得这代模型真正的变化,不在“会不会聊天”,而在“能不能持续把一件复杂的事做完”。

很多人对大模型的理解还停留在问答器阶段:你问,它答;答得像不像人,文风顺不顺,算不算进步。这个角度没错,但已经有点旧了。现在更实际的考法是:给它一个不那么短、不那么规整、还带外部工具的任务,它能不能稳住。GPT-5.4 这次明显就是朝这个方向做的。官方说它把最近在推理、编程和 agent 工作流上的能力收在了一个模型里,不再是“这个模型擅长代码,那个模型擅长推理,再换一个做工具调用”的割裂状态。

说人话,就是它更像一个“能连续干活的模型”,而不是一个“偶尔灵光一现的回答器”。

我用下来,体感最明显的是三件事。

一件是长任务没那么容易中途变形。

以前你让模型做复杂任务,经常会遇到一种表面看不出来、但实际很伤体验的问题:它第一段理解对了,第二段也还行,到了第三段开始忘约束,第四段开始自作主张。GPT-5.4 这次在 ChatGPT 里加了一个很实用的变化,就是 Thinking 模式可以先给出一个前置计划,你能在它真正展开前纠偏。这个东西听起来很小,实际很好用,因为很多翻车不是模型不会做,而是它一开始把活理解歪了。现在能在中途掰回来,少很多无效来回。这个改动是官方明确写了的,不是野生吹法。

一件是工具感更强了。

我说的工具感,不是那种演示视频里“看,我会点鼠标了”的新鲜感,而是它更知道什么时候该查、什么时候该写、什么时候该停。官方这次重点提了网页研究、工具使用、表格、文档、演示这些偏生产力场景,还说 GPT-5.4 在 ChatGPT 里对多来源研究类任务更强,在 Codex 和 API 里也更新了表格、演示相关技能。这个方向我挺认可,因为这才是大多数付费用户真正消耗时间的地方。不是写一首诗,而是把一个麻烦任务拆完、查完、整理完。还有一件,是幻觉真的往下压了一点。

这事我不敢吹太满,因为只要是模型,就不可能没有幻觉。但官方这次给的数据至少说明方向是对的:在一组用户标记过事实错误的匿名提示上,GPT-5.4 单条事实陈述出错概率比 GPT-5.2 低 33%,完整回答里出现任何错误的概率低 18%。这不代表它就“不会胡说”,但代表你在严肃任务里用它,返工概率会低一点。对普通聊天用户,这点不一定有体感;对经常拿它写报告、整材料、查信息的人,这个提升很实在。

当然,别把它想得太完美。

我看到一些讨论已经开始往“全面碾压”“重新定义生产力”那个方向吹了,这种说法我是不太信的。GPT-5.4 很强,但强得比较偏工程和工作流,不是每个人都能立刻吃到红利。

如果你平时主要拿 ChatGPT 做的是这些事:

写几段文案; 查点常识; 翻译几句话; 头脑风暴几个标题;

那你对 5.4 的感受,可能还不如一次界面改版来得明显。因为这些任务本来就不够难,模型瓶颈不在推理深度,也不在工具协作。你把超跑开到小区门口,体感当然有限。

真正能拉开差距的,还是那类又长、又杂、又容易中途跑偏的任务。比如:

让它读一堆材料后做整合; 一边查资料一边输出有结构的结果; 改代码同时处理文档和表格; 把一个多步骤工作流从“我来盯着”变成“它先跑,我再验”。

这也是为什么我觉得这代模型更适合两类人:一类是开发者,一类是高频知识工作者。尤其是会用 Codex、API,或者本来就有 agent 工作流的人,提升会更明显。官方也明确说了,GPT-5.4 是首个把 GPT-5.3-Codex 编程能力并入主线推理模型的版本,而且已经统一铺到了 ChatGPT、API 和 Codex。这个统一很关键,因为过去最大的问题之一,就是能力散落在不同模型上。还有个现实问题不能不提:价格。

能力变强了,API 也涨价了。官方给的价格是,gpt-5.4 输入价格 $2.50 / 百万 tokens,gpt-5.2 是 $1.75;输出价格也从 $14 涨到 $15。OpenAI 的说法是,虽然单价更高,但因为 token 效率更好,很多任务总消耗未必更高。这个说法我觉得要分场景看:如果你原来一个任务经常因为模型跑偏而重复三遍,那新模型可能反而省钱;如果你本来就是轻量调用,那涨价就是涨价,别安慰自己。

另外,很多人这次盯着“1M 上下文”和“原生计算机操作能力”看,我觉得可以稍微冷静一点。

它们确实重要,尤其对 agent 化方向很关键。OpenAI 这次明确提到 GPT-5.4 是首个具备原生计算机操作能力的通用模型,也提到更长上下文和更强的工具工作流能力。可问题在于,这些能力不是“有了就自动变现”,也不是“普通用户马上就爽”。它更像基础设施升级:对已经在折腾复杂任务的人,这是大件利好;对还停留在问答使用习惯的人,暂时只是新闻。

所以我的结论其实很朴素:

GPT-5.4 不是那种“所有人都会立刻惊呼升级巨大”的模型,它更像一次把底层工作能力补齐的版本。你越接近真实工作流,越能感受到它值钱;你越把它当聊天工具,越容易觉得“好像也就那样”。

如果你现在在犹豫要不要重点用它,我建议别先看测评热闹,直接拿自己的真任务试三轮,最能看出差别:

第一轮,扔给它一个你之前经常做崩的复杂任务; 第二轮,让它一边查资料一边输出成品,而不是只回答问题; 第三轮,故意加约束、改方向,看它会不会中途散掉。

这三轮下来,你基本就知道 5.4 对你是不是升级了。

最后给一个能直接收藏的判断清单。

你符合下面两条以上,可以认真用 GPT-5.4: 经常写代码,尤其是边写边改边查资料; 经常处理长文档、表格、报告、演示; 一个任务通常不是一步完成,而是多步串联; 你很在意模型中途跑偏、忘约束、工具乱用; 你本来就在用 Codex、API 或 agent 工作流。

如果你更接近下面这几条,就别被热搜带着跑: 主要是聊天、润色、翻译、简单问答; 很少做长任务; 不碰工具调用; 不在意一点点事实性和稳定性提升; 对成本比对上限更敏感。

我自己的评价是:这代不是最会“秀”的升级,但大概率是最接近“开始能接工作”的升级之一。对普通用户,它未必有传说中那么神;对真正把模型当生产工具的人,它比表面热度更有价值。

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐