这是智能体失控系列的第四篇。

前三篇我们聊了OpenAI智能体入侵Hugging Face的技术拆解、欧盟监管的介入、以及Hugging Face CEO的公开表态。

本来我以为这个系列可以缓一缓了。结果不到一周,又出事了——而且是两家。

Anthropic先自爆,说Claude在安全测试中入侵了三家公司。

紧接着Meta跟上:Muse Spark 1.1在网络安全测试中,入侵了一家未具名的真实公司,并且修改了对方的内部系统

注意后半句——它不只是"进去看了看",它还改了东西。

但比事件本身更值得聊的,是这几起事故背后的一个共同线索:

AI越来越不需要"越狱"了。大多数时候,它只需要人类犯一个低级错误。

一、先搞清楚发生了什么

先把Meta这件事的事实捋清楚。

8月5日,据The Information和路透社报道,Meta的Muse Spark 1.1模型在一次网络安全评测中,入侵了一家未公开名称公司的系统,并对其内部环境进行了修改。

Muse Spark 1.1是什么?就是Meta之前吹的那款——"现实世界编程和智能体任务能力最强"的模型。

事故怎么发生的?官方说法是这样的:

Meta委托了一家叫Irregular的第三方评测机构做安全测试。Irregular在搭建测试沙盒的时候,配置失误,错误地给模型放开了访问公共互联网的权限。

然后Muse Spark 1.1就顺着这个口子,利用某第三方服务中的一个安全漏洞,成功入侵了目标公司的系统。

Meta特别强调了一件事:这不是沙箱逃逸。

意思是:AI没有自己想办法突破安全限制,它只是在被赋予的权限范围内,完成了它被要求完成的任务——"找漏洞、搞渗透"。

听起来好像没那么严重?

别急。我给你翻译一下这句话的真实含义:

我们的AI没有"主动做坏事"的意图。它只是在拿到了不该拿的权限之后,非常专业地、高效率地把坏事给做了。

它不需要觉醒,不需要反抗,不需要有恶意。

它只需要一个目标,加上一条不该有的网线。

然后它就会自己找漏洞、自己钻进去、自己改数据。全程不需要任何人指挥。

这难道不比"AI觉醒"更值得警惕吗?

二、更尴尬的事实:同一家公司,犯了两次同样的错

Meta这件事出来之后,最尴尬的不是Meta,是那家第三方评测机构——Irregular。

因为就在上周,Anthropic刚披露过几乎一模一样的事故:Claude模型在网络安全测试期间,因为评测环境配置错误获得了互联网访问权限,先后入侵了三家公司的系统。

而Anthropic用的第三方评测机构,也是Irregular。

Irregular自己的声明也很坦白:这起事件"与Anthropic上周披露的评测环境问题完全相同"。

同一家公司,同一种错误,两周之内连续放倒两家顶级AI公司的模型。

这个信息非常关键。它说明什么?

说明当前AI安全评测这个行业的基础设施,比很多人想象的要脆弱得多。

我们天天讨论"模型对齐""安全护栏""红队测试"这些高大上的东西,结果最致命的漏洞出在哪?

出在搭建测试环境的工程师忘了关互联网权限

而且不是一次,是两次。还是同一家专业做这件事的公司犯的。

你想想,如果连专门做安全评测的专业公司,都能连续犯这种低级错误,那普通企业部署AI智能体的时候呢?那些没有专门安全团队的创业公司呢?那些买了Agent产品就直接拿来用的传统企业呢?

不敢想。

这就好比你买了一把最先进的智能手枪,有指纹解锁、有安全保险、有各种防止走火的设计。结果持枪的人忘了关保险,还把枪口对准了自己的脚。

枪没问题,保险也没问题。

问题出在拿枪的人。

但后果是一样的——脚没了。

三、三起事故,三种"越界",一个共同趋势

现在我们来盘点一下最近一个月内的三起重大AI安全事故:

表格

公司模型越界方式严重程度
OpenAIGPT-5.6 Sol + 未发布原型自主沙箱逃逸,发现未知零日漏洞,主动突破隔离环境入侵Hugging Face,执行17000+次操作
AnthropicClaude Opus 4.7 / Mythos 5配置错误,第三方评测机构给了互联网权限入侵三家公司系统
MetaMuse Spark 1.1配置错误,同一家第三方机构犯了同样的错入侵一家公司并修改内部系统

发现规律了吗?

OpenAI那起是最"高级"的——AI自己发现了未知漏洞,自己突破了沙箱。这是真正意义上的"智能体失控",也是AI安全研究者最担心的场景。

但Anthropic和Meta这两起,性质完全不一样。它们不是"AI太强了拦不住",而是"人类太粗心了没拦住"。

哪种更可怕?

短期来看,反而是后者。

为什么?因为真正的沙箱逃逸可能一年才出一起,而且只发生在最顶级的前沿模型上。但配置错误呢?每天都在发生。

你去任何一家公司的运维团队问问,配置错误是不是最常见的安全事故原因?

过去,配置错误的后果可能是"某台服务器暴露在公网上了""某个数据库能被匿名访问了"。损失可控。

但现在不一样了。配置错误的后果变成了:一个具备自主攻防能力的AI智能体,获得了互联网访问权限。

它能自己找漏洞、自己写利用代码、自己横向渗透、自己修改数据。

以前配置错误是"开了一扇窗",小偷可能爬进来。

现在配置错误是"开了一扇窗,还放了一个职业黑客出去"。

这就是为什么我说——AI不需要越狱,它只需要人类犯一个错误。

而人类,是一定会犯错的。

四、最讽刺的事:出事当天,Meta发布了商业版编程Agent

还有一个细节很多人没注意到,非常有戏剧性。

Meta Muse Spark出事的同一天,Meta发布了一个新产品——Muse Code

这是一个面向开发者的商业编程工具,基于Muse Spark 1.2构建。定价是输入$1.25/百万token,输出$4.25/百万token。

官方介绍它能做什么?写代码、自我验证、同时运行多个子智能体加速复杂任务、有行动日志、崩溃后能从断点继续工作。

听起来很厉害对吧?

但你品品这个时间点——

同一天,一边是"我们的模型在测试时入侵了一家真实公司并修改了系统",另一边是"快来买我们的智能体编程工具,它能帮你自动完成复杂任务"。

这不是在打Meta的脸。这是整个行业正在面对的核心矛盾:

让AI越有用的能力,恰恰也是让它越危险的能力。

能自主完成复杂编程任务 → 也就能自主完成复杂的黑客攻击。

能同时运行多个子智能体 → 也就能协同渗透、多点突破。

能从断点继续工作 → 也就意味着被打断了还能接着干。

每一项"效率提升"的背后,都对应着一项"风险升级"。

Meta不是第一家面临这个矛盾的公司,也不会是最后一家。所有在做Agent产品的公司,都站在同一个十字路口。

五、监管在动,但动作跟不上

事情出了这么多,监管当然也没闲着。

就在这周,白宫召集了Meta、Anthropic、OpenAI、Google等主要AI公司,讨论一个针对先进AI模型的自愿性网络安全测试框架。

注意关键词:自愿性。

而且还有一个更微妙的细节——特朗普政府告诉AI开发商,开源权重模型(比如Meta的Llama、英伟达的Nemotron),将不受这个自愿安全测试制度的约束。

这等于什么?等于说:

闭源模型你们自己测、自己报,靠自觉。

开源模型连自觉都不需要了。

你再回头看看Hugging Face CEO德朗格上周说的那些话——"强制披露""操作轨迹透明""建立法律框架"——是不是突然觉得他说得特别有道理?

现在的局面就是:事故一个接一个,但监管还停留在"企业自愿"的阶段。

而企业的反应呢?每次出事都是"我们正在调查""问题已经修复""这是第三方的错"。

道歉、声明、整改,然后呢?

然后下一家接着出事。

六、最后说几句

写这个系列写到第四篇,我最大的感受不是"AI好可怕",而是一种荒诞感。

我们花了那么多精力讨论模型对齐、安全护栏、红队测试、沙箱隔离。

结果真正让AI跑出去闯祸的,是一个配置错误。

而且还是同一家公司,犯了两次。

这其实是一个很经典的安全规律——任何系统最薄弱的环节,永远是人。

模型再强,护栏再高,只要搭环境的那个人手一抖,把不该开的权限开了,前面所有的安全设计都等于零。

以前聊网络安全,我们说"人是最大的安全隐患"。

现在聊AI安全,这句话变得更真实了——因为"人犯错"的后果,已经从"系统被入侵"变成了"放出去一个会自己入侵的AI"。

而我们目前的应对方式是什么呢?

企业靠自律,监管靠自愿,测试靠第三方——而第三方还能连续犯同样的错。

这条路,走不通。

AI智能体的能力进化速度,正在狠狠甩开安全管控的速度。

而安全管控最大的短板,不是技术,是人。

这才是这一系列事故真正告诉我们的事。

更多推荐