先想一个问题:你有没有在某个深夜,被一条消息说服过?对方语气不急不躁,逻辑滴水不漏,甚至记得你上周说过的小事。你以为遇到了难得靠谱的人,后来才发现,那条消息背后没有“人”。

AI 骗子在建立信任这件事上超过了真人,这句话正在从耸人听闻变成一种可以观察到的现实。真正让人不安的,不是 AI 会说谎,而是它太擅长让人愿意听它说话。过去我们判断一个人可不可信,靠语气、靠细节、靠耐心、靠一致性,而这些恰好都是大模型最容易被优化出来的信号。所以我们真正要追问的不是“AI 为什么那么像人”,而是“我们判断信任的方式,是不是已经跟不上这个时代了”。

这篇文章想把这个话题拆开聊清楚:AI 的“可信”到底来自什么机制,它在哪些环节比真人更有优势,这些优势又如何变成风险,以及作为普通用户和 AI 工程师,我们分别应该建立什么样的防御姿势。

1. 先搞清楚一件事:AI 优化的不是“可靠”,而是“可信的信号”

很多人在讨论 AI 诈骗时,都会陷入一个误区——认为 AI 之所以骗人成功,是因为它“太智能”,能理解人类复杂的情感。这个说法既对又不完全对。AI 真正擅长的是制造“可信的信号”,而不是成为一个真正可靠的信息源。

1.1 人类判断信任的方式,本来就不够理性

心理学里有一个老结论:人在判断对方是否可信时,往往不是靠逻辑推理,而是靠一系列快速直觉。语气是否自然、有没有口误、情绪是否稳定、是否记得你说过的细节、回复是否及时,这些都会被大脑当作“这个人靠谱”的证据。

这套机制在人类社会里运行了几千年,效率很高,但也有致命弱点:它是可以被刻意优化的。骗子行业早就摸清了这个规律,只是以前靠人工慢慢经营,成本极高。一个人同时维护三个虚假身份已经不容易,更别说让每个身份都保持稳定语气、记住每个受害者的细节。

AI 改变的是这个成本结构。

1.2 大模型把“捏造可信感”变成了批量生产能力

大模型生成文本时,语法是几乎完美的,标点、措辞、情感表达都经过海量语料校准,不会出现真人聊久了容易犯的疲惫、烦躁、前后矛盾。它可以同时和成百上千人对话,每一次回复都保持同样的耐心和热情。它还能根据上下文调整风格,对方是年轻人它就活泼一点,对方是老人它就稳重一点。

这些能力叠加起来,就形成了一个反直觉的结果:AI 在某些对话场景里,比真人更容易建立初始信任。因为真人会累、会烦、会露馅,而 AI 不会。

这就像我经常在 AI 工程实践里说的一个判断:大模型的价值从来不是“更聪明”,而是“把某种曾经需要稀缺人力才能做到的事情,变成了标准化的服务”。当“建立可信感”变成可批量生产的服务,它被滥用的边界自然也就跟着扩大了。

注意:这里说的“建立信任”,指的是一种表面信任,也就是对方愿意相信你、愿意继续对话。它和真正的可靠性是两码事。AI 能制造前者的信号,不代表它能兑现后者的承诺。

2. 拆解 AI 的“可信感”:语言、记忆、一致性、规模化

如果把 AI 在信任博弈中的优势拆开看,其实是四个核心能力的组合。这四个能力单独拿出来,都不算特别可怕,但组合在一起,就构成了一种新形态的社交工程。

2.1 语言层:文本和语音的自然度已经跨过“恐怖谷”

很多人的 AI 诈骗认知还停留在“一看就是机器人”的阶段。说实话,这个阶段已经过去了。大模型生成的诈骗话术,不仅语法正确,还会根据上下文微调语气,甚至模仿特定人群的表达习惯。

以钓鱼邮件为例。早期钓鱼邮件最大的破绽是语法错误百出,稍微细心一点就能识别。现在大模型生成的邮件,可以做到主题明确、结构清晰、落款得体,甚至根据收件人的职业背景定制内容。如果再加上语音合成技术,诈骗电话里的女声或男声已经很难从音色上判断真假。

这里要特别提醒一点:不要以为只有英语环境才会遇到这类问题。中文大模型在这方面的能力并不弱,某些朗朗上口的客服话术、短信模板,普通人根本不具备分辨能力。

2.2 记忆层:“记得你说过什么”是最强的信任催化剂

人类社交里有一个很微妙的信号:如果对方记得你说过的小事,你会本能地感到被重视,进而降低防备。这个心理机制被恋爱骗局、投资骗局反复利用过。

AI 让这个机制变成了默认配置。用向量数据库给每个用户保存画像,把历史对话切成摘要存进去,下次对话时自动调用。大模型配合检索增强生成,可以让每个受害者在不同时间点收到的消息,在细节上保持连贯。

换句话说,传统骗局需要诈骗者手动记笔记、翻聊天记录,AI 不需要。上下文管理本身就是大模型的核心能力之一,长期记忆、分段检索、按需召回,这些在 AI 应用开发里已经是成熟技术。

2.3 一致性层:永不疲劳、永不情绪化、永不自我矛盾

真人骗子有一个天然劣势:精力有限。一天聊了 20 个目标之后,语气会从热情变成敷衍,逻辑会出现漏洞,回复速度会变慢。而这些破绽恰恰是受害者感知风险的时刻。

AI 不存在这个问题。无论聊到凌晨几点,无论重复多少遍同样的话术,它都能保持稳定的情绪状态、一致的语速和几乎完美的逻辑。对受害者来说,这种“极度稳定”本身就是一种安全感。但对防御者来说,这恰恰是最危险的信号。

2.4 规模化层:一个人可以同时经营上千段“关系”

这是 AI 相比真人最本质的差异。真人骗局的瓶颈在于人力,一个骗子一天能维护的对话数量有限。AI 不存在这个瓶颈。

用大模型 API 批量调度,用智能体框架管理任务队列,用工作流把“加好友—寒暄—建立共同话题—引入特定话题—诱导行动”拆成不同的自动化节点。一套流程跑通之后,扩展成本几乎为零。这也是为什么安全圈开始关注 AI Agent 的滥用问题——Agent 学的不是“能不能打字”,而是“如何根据目标状态自动推进任务”。

提醒:上面这些描述不是教你如何实施,而是帮你理解为什么防御不能停留在“让它少写错字”这种层面。AI 的可信感生成是全链路的,防御也必须是全链路的。

3. 为什么单次“听起来真诚”不等于“值得长期信任”

前面说的四个能力,解释了 AI 为什么能赢得初始信任。但这里有一个关键边界:信任分两种,一种是“第一印象式信任”,另一种是“基于长期履约的信任”。AI 擅长的是前者,而不是后者。

3.1 初始信任靠信号,长期信任靠验证

信号是什么?是语气、是细节、是响应速度。验证是什么?是你实际查证了对方提供的身份、确认了资金流向、核实了文件来源。初始信任可以靠 AI 的文本能力快速建立,但长期信任必须靠真实世界里的验证动作来支撑。

问题是,大多数人在日常沟通里,根本不会对熟人做验证。受害者往往觉得“都聊了半个月了,怎么会是假的”。这个“都聊了半个月”的时间感,在 AI 眼里只是几百条消息记录而已。AI 的时间成本极低,可以用半个月的对话换取受害者那一刻的放松警惕。

3.2 AI 幻觉的存在,让“自信”和“编造”同时发生

这里有一个很讽刺的技术点:大模型的“自信感”和“编造能力”是同一个机制产生的。模型生成高概率的 token 序列时,语气会显得非常笃定,哪怕事实是错的。

安全领域已经多次观察到这种现象:AI 在被问及身份、资质、承诺时,会流畅地给出看似合理但完全虚构的信息。这在普通聊天里可能只是小错误,但在诈骗场景里,这种“自信的胡说八道”会变成最有力的误导工具。

对防御方来说,这意味着我们不能用“它说得像不像真的”来作为判断标准,而要用“它提供的信息能不能被独立验证”来作为标准。

3.3 信任被建立之后,真正危险的是“行动诱导”

AI 建立信任的目的是什么?是让目标采取某个动作:提供验证码、点击链接、下载软件、转账、支付定金,或者安装某个带后门的应用。这类行为,我一般统称为“行动诱导”。

判断一段对话是否可疑,最重要的不是看对方说话是否自然,而是看对方是否在推进你完成某个不可逆操作。自然的闲聊可以无限延长,但“请你现在做一件事”这个节点出现的时间,往往比正常人际关系要早得多。

4. 如何识别 AI 生成的可信感:一套四步验证框架

既然 AI 擅长制造可信信号,我们就不能再用“感觉”来判断真假。我梳理了一个适合普通用户和团队使用的验证框架,四个步骤,按顺序执行。

4.1 第一步:看信息能否被独立验证

对方声称的身份,能不能在官方网站、官方客服电话、线下门店等独立渠道核实?注意“独立渠道”这个词——不能用对方提供的链接去核验,因为链接本身也可能是伪造的。

实际操作中,我会建议:无论对方是谁,只要涉及资金、账号、隐私,先挂掉电话或停止聊天,自己主动搜索官方联系方式,再打过去确认。这个动作能拦截大量 AI 诈骗,因为大多数骗子都扛不住“你先挂电话,我十分钟后打给你”这个要求。

4.2 第二步:看是否出现“时间压迫”

AI 话术里最常见的套路是制造紧迫感:“系统将在今晚关闭”“名额只剩最后三个”“逾期将影响征信”。压迫时间的目的,是让你没有机会执行第一步的独立验证。

一个简单的防御习惯是:任何要求你在极短时间内做决定的消息,一律先搁置 30 分钟。如果对方是真人并且确有急事,30 分钟后你会收到跟进;如果是无差别的 AI 群发,大概率不会在意你一个人的沉默。

4.3 第三步:看“过度一致”是否真的合理

真人对话是有噪声的。偶尔打错字、偶尔犹豫、偶尔记忆模糊,都是正常人类交流的特征。AI 生成的文本往往过于干净,语法太标准,逻辑太完整,记忆太精确。

这不是说 AI 一定会有这些特征,而是说当一段对话从头到尾都没有任何人类交流的“瑕疵感”时,它更可能是被优化出来的文本。你可以故意问两次同样的问题,或者故意说一个和你之前表达相反的信息,然后看对方是否立刻纠正你。真人通常会追问“咦,你刚才不是说……”来确认,AI 为了保持对话流畅,往往会顺着你的新说法走。

4.4 第四步:看画面和声音是否经得起“细节放大”

视频通话、语音消息是 AI 诈骗的高发区。现在的深度伪造技术,在低分辨率、短时长、光线充足的场景下,已经能让普通人难以分辨。但有一个规律:伪造信息最怕的是细节追问。

可以要求对方做一个非常规动作,比如举起左手、转头看窗外,或者用某个奇怪的手势挡在脸前。也可以让对方面对强光,观察边缘是否出现不自然的畸变。更重要的是,养成“重要交易必须通过你已知的、可靠的官方渠道二次确认”的习惯,而不是依赖视频通话里那张脸。

下面用一个表格总结四步验证法的核心动作和判断标准:

验证步骤 核心动作 警惕信号 判断标准
独立验证 挂断后自己搜索官方渠道 对方反复阻止你挂断 信息能在第三方渠道确认
时间压迫 搁置 30 分钟再做决定 “必须现在办完” 真正紧急的事不会怕你核实
一致性检查 故意说错前后矛盾的信息 对话过于完美、无追问 真人会疑惑,AI 会顺着说
细节放大 要求非常规动作或二次确认 视频边缘畸变、声音延迟 能完成动作且渠道真实

这个框架的核心思路只有一句话:把“判断对方可不可信”变成“验证对方能不能被核实”。前者依赖直觉,后者依赖动作。

5. 防御不是逃离 AI,而是建立新的验证协议

面对 AI 在建立信任上的优势,最糟糕的应对方式是因为害怕而彻底拒绝所有 AI 相关内容。这不现实,也会把真正有价值的 AI 应用一起丢掉。更务实的路线,是把防御拆成个人、组织、技术三层,分别建立机制。

5.1 个人层:设置“人工验证锚点”

一个很有效的私密做法,是在你和家人、朋友、亲密合作伙伴之间约定一个“验证暗号”。这个暗号是一句只有你们俩知道的话,任何一方在涉及转账、验证码、隐私信息时必须说出来核对。

这个方案听起来简陋,但技术含量并不低。它利用的是 AI 的上下文盲区:大模型能模仿对话风格,能记住历史消息,但它无法知道你和你朋友在现实世界里约定过的那句暗号。只要暗号不通过聊天工具传输,AI 就没有可靠的途径获得它。

如果觉得设置暗号太正式,可以退而求其次:对于任何涉及钱的请求,都用一个你主动拨出的、已知的号码回拨确认。注意,是“你主动拨出的号码”,而不是对方让你保存的号码。

5.2 组织层:把“验证动作”固化成流程

个人可以靠暗号,组织不能靠个人默契,只能靠流程。企业财务、行政、客服等岗位,最适合建立下面这套机制:

  • 资金变动超过某个金额,必须触发第二个审批人在独立系统里确认。
  • 所有涉及外部人员要求变更收款账户的请求,必须通过电话主动回拨到对方公司官网上的公开号码确认。
  • 内部沟通群里出现的“领导要求加急转账”类消息,一律先在线下或既定工作渠道确认。
  • 对离职员工、外包人员的账号权限实行定期清理,避免 AI 诈骗利用沉睡账号冒用身份。

这些流程本质上都是在信任链路上强行插入一个独立验证点。诈骗者能突破的是某一个环节的语言说服力,但很难同时控制你在不同渠道之间建立的交叉验证关系。

5.3 技术层:用 AI 对抗 AI

个人和组织靠规则,技术团队可以做得更多。部署 AI 内容检测模型、深度伪造检测工具、异常通信行为分析与钓鱼邮件网关,都是可行方案。其中我更建议优先做这四件事:

  1. 在邮件网关中接入大模型分类器,识别语义级别的钓鱼倾向,而不是只靠域名黑名单。
  2. 对语音、视频通话类业务建立深度伪造检测能力,至少在高风险场景(转账、身份核验)启用活体检测。
  3. 对客服留言中出现的同一话术高频重复现象做聚类分析,识别批量化的 AI 群发模式。
  4. 建立内部钓鱼演练,定期用 AI 生成的钓鱼话术测试员工反应,并把演练结果用于流程改进。

这里要说清楚一个边界:没有哪项技术能 100% 检测出 AI 生成内容。大模型的分布每天都在变化,检测模型天然滞后。所以技术只负责降低概率、提高攻击成本,最终一道防线仍然是人和流程。

我一般会给团队这样的建议:先跑通最小验证闭环,再考虑全面部署。先选一个真实场景(比如财务转账确认),把独立验证流程跑起来,再逐步扩展到更多场景。不要一上来就焦虑地堆工具,那只会增加运维负担,却不一定提升防护效果。

6. 对 AI 工程师和产品经理:别只做更强的话术机器

这个话题还有一个容易被忽视的面向:当 AI 越来越擅长建立信任,我们这些做 AI 的人,应该怎样设计产品,才能既发挥能力,又不成为信任危机的助推器?

6.1 透明度是可信 AI 的第一原则

AI 对话产品是否应该主动标明“我是 AI”?这是一个产品决策,也是一个伦理决策。短期看,标明身份可能会降低用户黏性;长期看,隐瞒身份一旦被揭穿,对产品信任的伤害是不可逆的。

在这方面,我的判断是:涉及服务、建议、交易决策的 AI 产品,应该默认透明。不是因为透明一定能让产品更好用,而是因为“用户知道自己在和 AI 对话”是用户判断风险的前提。拿掉这个前提,就等于替用户做了风险决策。

6.2 把“可信”设计成工程指标而不是营销词

我见过不少 AI 产品把“回答可信”当作宣传点,但落回到工程上,却没有对应的评估指标。这其实是一个很典型的工程实践问题:可信不能只靠感觉,要有可量化的评估方式。

具体来说,可以在模型评测里增加四个维度:

  • 事实一致性:生成内容能否从给定上下文或外部知识库中找到出处。
  • 幻觉率:在专业领域问答中,多少比例的回答包含无法验证的信息。
  • 不确定性表达:模型是否会在低置信度时说“我不确定”,而不是强行给出结论。
  • 行动诱导率:在对话结尾,模型是否过度引导用户完成某种行动。

这些都是可以在评测集里定义的指标。哪怕一开始做得很粗糙,也比完全没有指标要好。因为只有可测量的东西,才可能在长期迭代里被改进。

6.3 用红队思维对抗“过度可信”

AI 安全领域有一个成熟的概念叫红队测试,就是主动用对抗性输入去攻击模型,发现漏洞。在“AI 建立信任”这个语境里,红队思维同样适用。

产品团队可以在发布前构造一批测试场景,专门观察模型是否会在以下情况下“用力过猛”:

  • 用户表达孤独、焦虑、财务困难时,模型是否给出误导性建议。
  • 用户提到投资、转账、个人信息时,模型是否过度配合。
  • 用户要求忽略系统限制时,模型是否被越狱提示词带偏。
  • 模型生成的客服话术,是否会因为过于顺从而放弃关键风险提醒。

这些测试不需要特别豪横的技术,普通开发者用开源模型和一套提示词模板就能做。难的是把测试结果反馈到产品设计里,而不是做完走个过场。

6.4 Agent 时代的责任边界

现在 AI 应用开发正在从“单轮问答”走向“多步骤 Agent”。Agent 能调用工具、访问数据库、发送消息。这意味着 AI 不仅能说,还能做。

能力变强,责任边界也随之扩大。如果一个 Agent 在未经充分授权的情况下替用户发送了一条消息,或执行了一个敏感操作,谁来负责?这是产品设计必须在架构层面回答的问题,而不是等出了事故再讨论。

我接触过的几个稳妥做法是:Agent 执行敏感动作前必须经过用户二次确认;所有 Agent 行为都要有可追溯日志;高风险动作(转账、修改权限、对外发消息)要设置独立的审批闸门。这些听起来简单,实际落地时往往会因为“影响效率”而被砍掉。但考虑到 AI 骗局的本质是利用信任缺口,任何补上验证缺口的系统设计,都比单纯提高对话能力更重要。

7. 回到起点:信任判断方式需要一次升级

写到这里,我想回到文章开头那个问题。AI 骗子在建立信任上超过真人,这句话的正确打开方式,不是恐慌,不是妖魔化 AI,而是承认一个事实:我们过去依赖的那些信任判断方式——语气自然、记得细节、回应及时——已经可以被机器批量模拟了。

这意味着什么呢?意味着“感受到的信任”和“被验证过的信任”之间的鸿沟,从来没有像今天这么大。我们不可能完全拒绝信任,那是人类社会协作的基础。但我们可以改变信任建立的方式:从“感觉对方可信”转向“验证对方可核实”。

对普通用户,最该记住的是一句话:让重要的验证动作发生在对话之外。回到线下的动作、你主动拨出的电话、你独立搜索到的官网、你和家人约定的暗号——这些应该成为你在 AI 时代新建立起来的信任锚点。

对 AI 从业者,最该记住的是一句话:我们生产的不只是输出文本,而是社会信任的信号。设计一个有透明边界、可验证来源、有风险评估、有责任日志的 AI 系统,比把一个模型调得更像人,要重要得多。

技术不会倒退。AI 在可信感上的优势只会越来越强。真正决定我们能不能安全地用它,不是模型的能力上限,而是我们愿不愿意把“验证”变成习惯,把“透明”变成底线。

更多推荐