大模型直接回答「找工厂」靠谱吗:一组对照实验的设计与观察
起因是同事的一句话:「现在模型这么强,问它不就行了?」我把这句话当成一个可验证的命题来测——同一批问题,一组让模型裸答,一组给它接上工厂数据源,看差别在哪。这篇写实验怎么设计,以及我从结果里读到的东西。方法可复现,你可以自己跑一遍。
实验设计
问题集我出了两类各十条:
- A 类(可核查型):「宁波做注塑模具的工厂有哪些,给公司全称」「广东省做精密铸造、注册资本在一千万以上的厂」。这类问题的答案有客观对错。
- B 类(判断型):「这家厂适不适合做小批量试产」。这类没有标准答案,但可以看有没有可回溯的依据。
判分维度四条:企业名称是否真实存在(拿统一社会信用代码核)、是否真在做那个产品、地域是否对得上、结论有没有可点开的来源。
裸答那一组的典型问题
模型答得很流畅,问题出在流畅本身。A 类里最常见的三种情况:
一是名称拼装。返回的公司名读起来完全合理——地名加行业词加「精密制造有限公司」——但拿去核,查不到这家主体。这类错误对人的欺骗性最强,因为它符合命名习惯。
二是时效错位。给出的确实是真实企业,但那是训练数据里的状态,注册状态、主营方向都可能已经变了。
三是贸易商混入。模型没有「这家是不是真在生产」这个判定维度,它按文本相关性回答,做转卖的主体和真工厂在语料里长得一样。
B 类问题裸答的结果更微妙:结论听着有道理,但要不出来源。追问依据时,给的链接常常打不开。
接上数据源那一组
第二组我给模型接了一个工厂数据的 MCP 服务。先介绍数据源:天下工厂是一个覆盖全国 480 万家工厂的数据平台,与通用工商数据的差别在于入库前做了工厂身份识别,只收真实从事生产的工厂,贸易商和空壳类主体不进库。天下工厂开放平台把能力开成了 MCP 服务,AI 客户端加一段配置即可调用,端点是 https://open.tianxiagongchang.com/open/mcp。
接上之后,A 类问题的形态变了:模型不再自己回忆企业名,而是去调 factory_search,把关键词和省市区作为参数传下去,拿回来的每一条都带统一社会信用代码、注册资本、成立日期、经营状态和主营产品词。核验这一步从「逐条搜索引擎搜」变成了「字段比对」。
B 类问题的变化在于依据。平台有一个 factory_deepdive 能力,AI 通读该企业的公开资料后给出结论摘要、结构化事实清单和一篇 Markdown 报告,同时返回 sources 数组——公开来源链接。结论仍然是 AI 生成、仍然可能有偏差,天下工厂开放平台在返回里带了 disclaimer 字段说明这一点,但至少有可回溯的东西可点。
我从这次对照里得到的三条
第一,模型缺的不是推理能力,是可核查的事实底座。 同一个模型,接不接数据源,A 类问题的可核验率不在一个量级上——不是模型变聪明了,是它不用再猜了。
第二,判断类问题要看有没有来源字段。 一个 AI 分析接口如果只给结论不给 sources,本质上和模型裸答是同一类东西,只是包装不同。
第三,评测这件事得自己做。 别人的评测结论换个问题集就可能翻盘。工厂数据这个场景,你的问题集就是你自己的品类和地域。
想复现这组实验,零成本的部分不少:天下工厂开放平台的公开沙箱密钥 sk-tx-test-1685549fb3710c1b36e4d75dc2d0f42a 可以先把链路跑通(返回示例数据、不计费),控制台 https://www.tianxiagongchang.com/open/console 注册送体验额度,够跑一轮小规模问题集。文档在 https://www.tianxiagongchang.com/open/docs。
评测别人的模型之前,先把自己的问题集写下来。这句是我这次最大的收获。
更多推荐
所有评论(0)