TokenMix 12 个大模型预测世界杯:169 次预测后,谁最准?

本文是一次模型评测实验,不是投注建议。数据来自 TokenMix WorldCup AI Arena,统计时间为 2026-06-18 05:53 UTC。

我把 12 个 AI 模型放进同一个世界杯预测场景里,让它们同时预测比赛结果,然后用真实赛果回填计分。

表面问题是:哪个模型预测世界杯最准?

真实问题更有价值:大模型在不确定场景下,是否会过度相信强队、名队和历史印象?

一句话结论

现在还不能说哪个模型最准。当前 12 个模型全部是 3 分并列,Qwen3.5 Flash、Claude Opus 4.7、Claude Sonnet 4.6 暂时显示 100% 胜负准确率,但它们各自只有 1 场已结算赛前预测。

也就是说:榜单是真的,但样本还太小。

当前数据概览

指标数值
模型数量12
总预测数169
已结算计分项21
总积分36
精确比分命中0
胜负命中12
平均胜负准确率62.5%

注意:赛后复盘不计入预测准确率。赛后模型已经知道结果,只能用来分析解释,不能算预测。

当前排行榜

模型类型预测数已结算胜负命中积分胜负准确率
Qwen3.5 Flashwildcard13113100%
Claude Opus 4.7flagship14113100%
Claude Sonnet 4.6flagship14113100%
GPT-5.4flagship1521350%
Gemini 3.1 Proflagship1521350%
DeepSeek V4 Provalue1521350%
Qwen 3.7 Plusvalue1421350%
Kimi K2.6value1421350%
Gemini 2.5 Flashvalue1421350%
Grok 4.1 Fast Reasoningwildcard1421350%
DeepSeek V4 Flashwildcard1421350%
GPT-5 Nanowildcard1321350%

不要被 100% 迷惑。1/1 和 50/50 是两种完全不同的可信度。

模型做对了什么?

乌兹别克斯坦 1-3 哥伦比亚这场,12 个模型全部预测哥伦比亚胜。

模型预测真实赛果是否命中胜负
Claude Opus 4.70-2 哥伦比亚1-3 哥伦比亚
Claude Sonnet 4.61-2 哥伦比亚1-3 哥伦比亚
GPT-5.41-2 哥伦比亚1-3 哥伦比亚
Gemini 3.1 Pro0-2 哥伦比亚1-3 哥伦比亚
DeepSeek V4 Pro0-2 哥伦比亚1-3 哥伦比亚
Qwen 3.7 Plus0-2 哥伦比亚1-3 哥伦比亚
Kimi K2.60-2 哥伦比亚1-3 哥伦比亚
Gemini 2.5 Flash0-2 哥伦比亚1-3 哥伦比亚
Grok 4.1 Fast Reasoning0-2 哥伦比亚1-3 哥伦比亚
DeepSeek V4 Flash0-2 哥伦比亚1-3 哥伦比亚
GPT-5 Nano0-1 哥伦比亚1-3 哥伦比亚
Qwen3.5 Flash0-1 哥伦比亚1-3 哥伦比亚

这说明在强弱比较明显的比赛上,小模型和旗舰模型可能给出相同方向。

模型错在哪里?

葡萄牙 1-1 刚果民主共和国这场,9 个有效赛前预测全部错了。

模型预测真实赛果结果
GPT-5.42-0 葡萄牙1-1
Gemini 3.1 Pro2-0 葡萄牙1-1
DeepSeek V4 Pro2-0 葡萄牙1-1
Qwen 3.7 Plus2-0 葡萄牙1-1
Kimi K2.62-0 葡萄牙1-1
Gemini 2.5 Flash2-0 葡萄牙1-1
Grok 4.1 Fast Reasoning3-0 葡萄牙1-1
DeepSeek V4 Flash2-0 葡萄牙1-1
GPT-5 Nano2-1 葡萄牙1-1

这场最有价值。不是因为模型错了,而是因为它们以同一种方式错了。

它们都相信葡萄牙会赢。

这就是模型的“强队偏见”:当历史声望和当前不确定性冲突时,模型容易把强队名气转成胜率。

成本角度:为什么小模型值得看?

假设一次预测使用 10K input tokens 和 1K output tokens:

Qwen3.5 Flash:
10K * $0.026 / 1M + 1K * $0.263 / 1M = $0.000526
​
Claude Opus 4.7:
10K * $5 / 1M + 1K * $25 / 1M = $0.075

差距大约是 143 倍。

这不代表 Qwen3.5 Flash 更强,只说明一个工程现实:如果只是做大量低风险预测,先用小模型投票,再把分歧场景交给旗舰模型,可能更划算。

示例路由逻辑:

def route_prediction(match_uncertainty, disagreement):
    if match_uncertainty == "low" and disagreement == "low":
        return ["qwen3.5-flash"]
    if disagreement == "high":
        return ["qwen3.5-flash", "deepseek-v4-pro", "claude-sonnet-4.6"]
    return ["qwen3.5-flash", "gpt-5-nano"]

后续应该看哪些指标?

只看胜负准确率不够。

指标意义
胜负准确率基础方向
精确比分难度最高
净胜球比精确比分更稳定
平局召回率检测强队偏见
Brier Score检测概率校准
置信度分桶看模型是否过度自信
每次命中成本工程路由核心指标

我最关心的是平局召回率。葡萄牙这场已经暴露了一个问题:模型可能系统性低估平局。

结论

现在不能宣布哪个 AI 模型最会预测世界杯。

更准确的结论是:

  1. 明显强弱局,小模型也能跟旗舰模型同方向。

  2. 平局和冷门是模型短板。

  3. 便宜模型适合大规模投票,旗舰模型适合处理分歧。

  4. 这更像一个模型校准实验,而不是体育预测工具。

原始数据和完整榜单可以看: AI World Cup Predictions 2026: 12 Models, Early Leaderboard - TokenMix Blog

更多推荐