大模型幻觉治理成绩单:头部模型仍有约12%摘要幻觉
大模型幻觉治理,先把敌人认清楚
“AI 一本正经胡说八道”——这事圈内有个正经叫法:大模型幻觉,指模型生成了看似流畅、实则与事实不符的内容。过去我们习惯吐槽一句"它又编了",然后接着用。
本期栏目想把这种情绪,换成一张能打分、能追责的治理成绩单:到底哪种手段,真把幻觉率压下来了、压到多少。先给结论预告:没有哪种技术能单独清零幻觉,但数据能告诉我们,谁更接近"可用",谁还停在"危险区"。
大模型幻觉率实测:先给模型们发张考卷
光比"谁更会聊"没意义,得看事实硬不硬。两组公开基准把模型摆上了同一张桌子。
SimpleQA:事实性这把尺
SimpleQA Verified 是 Google DeepMind 重建的 1000 题事实性基准(arXiv:2509.07968 可查),专门考"你说的事实对不对"。事实性 F1 得分上,Gemini 2.5 Pro 以 55.6 居首,其后 GPT-5 为 52.3、o3 为 51.9;再往后 DeepSeek R1(0528) 33.3、Claude Opus 4 28.3、Claude Sonnet 4 18.7,差距肉眼可见。记住,这是"事实准确度"的尺,不是"聊天顺不顺"的尺。
Vectara 摘要幻觉率:另一把尺
文档摘要场景,Vectara 的 HHEM 指标持续追踪(2026-05-11 更新,方法透明)。GPT-5.4-nano 摘要幻觉率仅 3.1% 最低,Gemini-2.5-flash-lite 3.3%、DeepSeek-V3.1 5.5% 也压得很低;中段 GPT-5.4 与 Gemini-2.5-pro 同为 7.0%、Qwen3-235b 9.3%;再往上 Claude Sonnet 4 10.3%、DeepSeek-R1 11.3%,最高 Claude Opus 4 达 12.0%。
这里有个坑必须点明:GPT-5 官方在 System Card(2025-08-07)自报 SimpleQA 准确率 46%、幻觉率 47%;可第三方榜单列 GPT-5 为 52.0、GPT-5.2 为 58.0。这是厂商自报、不同来源有差异,不能当定论用。 评测口径、题目版本、采样方式不同,数字会漂。

两个基准,两把尺:SimpleQA Verified 事实性 F1 与 Vectara HHEM 摘要幻觉率双图并列
读这两张表的姿势:事实性(SimpleQA)和摘要幻觉率(Vectara)是两条不同赛道。一个考"知识准不准",一个考"转述稳不稳",别拿一个当全部。
RAG:把"瞎编"拴在证据链上
RAG(检索增强生成),一句话解释:让模型先去可靠资料里检索、再据此作答,每句答案都能追溯到出处。它直接攻击幻觉的根——“凭空生成”。
同行评审证据很硬。JMIR Cancer 2025 的癌症问答研究里,用可靠医学源(CIS)做 RAG,GPT-4 幻觉率降到 0%、GPT-3.5 为 6%;不用 RAG 时约 40%;换成 Google 公开源则在 6–35% 间大幅波动。研究给传统聊天算了笔账:不用 RAG 出错风险是 OR=16.1,也就是高出约 16 倍。
微软的 GraphRAG 在 Finance Bench 上,比传统 RAG 幻觉再降 6%、token 消耗降 80%;混合检索在 HaluBench 上拿到最低幻觉率(arXiv:2504.05324)。
一句话总结:RAG 不是万能药,但它是少数能被审计、能追责的路径——答案带着出处来,错了能查、能改、能归责。强制引用绑定之所以关键,正是把"无来源断言"从根上堵死。

RAG 把幻觉率从约40%压到0-6%:同行评审证据(JMIR Cancer 2025)
微调与对齐:练内功,不能事后即插即用
另一条路在模型内部下功夫。F-DPO(事实感知的偏好优化),一种专门让模型更"讲事实"的训练方法。在 Qwen3-8B 上,它把幻觉率压到原来的约五分之一(0.424 降到 0.084,约降 5 倍),事实性 提升 50%;TruthfulQA 基准上,Qwen2.5-14B 的 MC1 +17%、MC2 +49%。
效果确实亮眼。但要泼盆冷水:对齐、微调属于"模型内功",需要训练数据支撑,不能事后即插即用。你手里的通用 API,不会因为某篇论文发了 F-DPO 就自动变强。这条路径握在模型方手里,应用者改不了。它决定"模型出厂时有多诚实",而 RAG 决定"你用的时候有多可控"——两者解决的是不同环节。
翻车现场:那约 12% 的代价,谁来付
数字再低,落到具体人身上就是事故。近年真实判例一串,越罚越重:
-
Mata v. Avianca(2023)
:律师用 ChatGPT 提交 6 个伪造判例,被罚 $5,000,行业首案。
-
Wadsworth v. Walmart(2025)
:律所用内部 AI 引 8 个不存在判例,罚 $3,000 加 $1,000,并撤销执业许可。
-
Couvrette v. Wisnovsky(2025–2026)
:15 个伪造引用加 8 个伪造引文,合计约 $109,700,迄今最高。
-
北京通州法院(2025-10)
:律师直接复制 AI 生成假案例,当庭被警告(新华社 2025-10-31)。
-
美路易斯安那州法院(2026-06)
:AI 生成虚假文书,律师罚 $1,000;密西西比(2026-06-09)4 名律师伪造判例合计罚 $8,000、2 人禁业 2 年(法治日报 2026-06-29)。
这些不是技术故障,是责任事故。模型摘要幻觉率就算压到 3%,落到法律文书、医疗建议上,一次就够致命。

AI 幻觉翻车,罚款越罚越重:近年真实判例与处罚阶梯
大模型幻觉治理,没有银弹只有组合拳
2026 年工程界的主流做法已经清晰:单点突破不够,得叠组合。
被多篇采纳、验证有效的做法摆在一起看,是串成一条流水线,而非选一个:
-
RAG + 强制引用绑定
:答案必须附带可点击出处,让无来源断言无处藏身;
-
结构化输出校验
:用格式约束卡住含糊其辞的回答;
-
多模型交叉验证
:同一问题丢给多个模型,矛盾处重点复核;
-
领域私有评测集
:拿本行业真实题测本模型,别盲信通用榜;
-
置信度阈值转人工
:模型自己都不确定时,直接交给人。
补充一个需谨慎对待的数字:Stanford HAI 2026 称自由回答中 6.8% 含无依据声明(2024 为 18.4%)。这是厂商博客转述、属二手,谨慎引用,不作为硬证据。 它只能当趋势参考,不能当治理依据。
回到本期结论——
没有银弹。RAG + 强制引用绑定,是当前最可靠的幻觉治理组合;但头部模型仍有约 12% 的摘要幻觉率(如 Claude Opus 4 达 12.0%)。在法律文书、医疗诊断等关键场景,必须保留人工兜底这道最后闸门。
写在最后
大模型幻觉不会一夜消失,治理也只能一步步来。把手段拆开看、把数字摆上桌,比单纯喊"AI 会胡说"有用得多。下一次让 AI 帮你写点什么之前,先问自己一句:它的每一句,都有出处吗?
欢迎把这篇「治理成绩单」收藏起来,也欢迎在留言区聊聊你踩过的幻觉坑。
更多推荐
所有评论(0)