Musk 一条推文拆出两条线:Grok 4.6 走快,4.7 走大

刚刷到 Musk 的最新推文,信息量不小。他直接把 Grok 接下来两个版本的底牌全亮了:4.6 在 8 月 7 日左右发,1.5T 参数,主打 SFT 和 RL 的大幅优化;4.7 晚几周,2.1T 参数,全方位碾压 4.6,唯一代价是推理稍慢,但 token 效率反而更高。这不是简单的版本迭代,是把产品线劈成了两条赛道。
之前不少媒体把 Grok 4.6 说成 2T 模型,现在可以纠正了——那是把 4.6 和 4.7 搞混了。Musk 这次说得非常清楚:1.5T 归 4.6,2.1T 归 4.7,两代产品定位完全不同。
4.6 不堆参数,堆训练质量
1.5T 参数放在今天的前沿模型里不算最大,但 Musk 特意点名了 SFT(监督微调)和 RL(强化学习)两项训练的"显著提升"。这说明什么?4.6 的核心卖点不是"更大",而是"更听话、更聪明"。

SFT 决定了模型能不能精准理解你的指令,RL 决定了它在复杂推理场景下会不会跑偏。这两项做好了,1.5T 的实际体验完全可以吊打一个训练粗糙的 2T 模型。Musk 敢在 4.7 出来之前先放 4.6,就是对这个训练质量有信心。
对普通用户来说,8 月 7 日这个时间点也意味着你很快就能上手验证。不像之前那些"coming soon"的画饼,这次有具体日期,说明后训练阶段大概率已经收尾了。
4.7 才是那个"2T 怪兽"
如果你追求的是纯粹的模型上限,那 4.7 才是你要等的。2.1T 参数,Musk 原话"better than 4.6 in every way",唯一的 trade-off 是推理速度稍慢。但他紧接着补了一句"even better token efficiency"——这意味着虽然单次响应慢了,但每个 token 的质量更高,完成同一个任务可能反而用的 token 更少、总成本更低。
这个取舍非常关键。现在整个行业都在从"比谁参数大"转向"比谁 token 省"。OpenAI、Google、Anthropic 最近几个月全在卷推理质量和单条回答的成本。Musk 把 4.7 定位成"慢一点但更省",恰恰踩中了这个趋势。
当然,"better token efficiency"目前还只是 Musk 的一面之词。没有独立 benchmark,没有第三方评测,没有企业客户的实际反馈。2.1T 的模型跑起来到底多慢、token 效率提升了多少、跟 Kimi K3 和 Claude Opus 比到底谁强——这些问题都得等 4.7 真正上线后才能回答。
所以我的建议是:8 月 7 日先用 4.6,感受 SFT/RL 的提升是不是真的明显;4.7 出来后再看 benchmark 决定要不要切换。别被参数数字晃了眼,用起来好不好使才是真的。
每天将我了解到的最新讯息分享给大家,降低大家自己摸索不到的门槛~
更多推荐



所有评论(0)