RAG 正在从文本检索走向多模态证据链

RAG 曾经主要解决一个问题:模型回答时能否引用企业自己的文档。早期应用多围绕 PDF、网页、知识库文章和客服话术展开,本质上还是文本检索。随着企业资料越来越多样,问题变得复杂:产品图片、设计稿、合同扫描件、实验图片、培训 PPT、截图和图文混排资料,都可能成为答案来源。

Agent execution loop

Google 5 月 5 日宣布 Gemini API File Search 支持多模态,新增 custom metadata 和 page-level citations。官方文档显示,File Search 可以导入、分块、索引数据,让模型在生成回答时检索相关内容;多模态 File Search 需要使用 `models/gemini-embedding-2`,可处理文本和图片。Google 同时说明,音频和视频格式目前尚不支持,图片文件要求为 PNG 或 JPEG,分辨率不超过 4K x 4K。

这个更新的重点不是“又多支持一种文件类型”,而是 RAG 竞争点开始转向证据组织能力。用户不仅要得到答案,还要知道答案来自哪份文件、哪一页、哪张图片。

页级引用改变了知识库的信任结构

企业知识库常见痛点是“看起来答得对,但不知道依据在哪里”。在法律、医疗、金融、制造、教育和企业合规场景中,答案没有证据回链,就很难进入正式流程。Google 的 File Search 文档提到,当使用带页面的文档时,响应可包含 retrieved context 的 page number;当模型引用图片片段时,也可返回 media_id,便于定位被引用的图片块。

这类能力会改变产品设计。过去很多知识库只展示一句答案和几个相关文档标题,未来更合理的界面可能要显示“答案、来源页码、引用片段、图片块、更新时间、权限状态”。尤其是内部制度、合同条款、产品手册和技术文档,用户需要快速跳回证据位置,而不是只相信模型概括。

Risk controls for real agents

对内容团队来说,多模态 RAG 也意味着资料整理方式要改变。图片不能只靠文件名,PDF 不能只看全文,元数据也不能随意填写。部门、时间、版本、权限、产品线、地区和适用范围,都会影响检索结果。

对中国企业和内容平台的启发

国内很多企业已经在做知识库问答,但不少项目仍停留在“上传文档、生成回答”的阶段。真正难的是资料质量:文档版本混乱、扫描件质量不稳定、图片缺少说明、权限没有分层、旧制度没有过期标记。多模态检索能力增强之后,这些治理问题不会自动消失,反而会更明显。

更稳妥的路线,是先做小范围高价值资料库:例如客服知识库、产品安装手册、研发规范、销售支持材料、合规问答、培训课件。每类资料都要定义元数据规则和引用规则,回答必须能回到来源页或来源图。对于不能确定来源的回答,应明确提示不确定,而不是给出貌似完整的结论。

这对 AI 内容团队也有启发。未来做资讯、教程或行业分析,图片和资料不应只是装饰,而应成为可索引、可解释、可复核的信息资产。图片中的中文信息层、图表标题、流程节点和风险提示,都会影响后续检索和再利用。

边界判断:可引用不等于一定正确

需要看到限制。Google 文档明确提到,音频和视频格式目前不在 File Search 支持范围内;原始 File API 文件会在 48 小时后删除,而 File Search store 中的数据会持续保存到手动删除为止。这意味着开发者必须理解数据生命周期,不能把上传行为误解为永久原文保存,也不能忽视嵌入数据的删除治理。

此外,页码引用和 media_id 只能提高可核验性,不能保证模型推理完全正确。模型可能引用了相关页面,但概括时仍然遗漏条件、混淆版本或扩大适用范围。因此,高风险场景仍需要人工复核、版本控制和权限隔离。

RAG 的下一阶段不会只比“谁能搜更多文件”,而会比“谁能把资料变成可解释证据链”。多模态能力让信息入口更丰富,也把数据治理、引用透明度和责任边界推到了前台。

更多推荐