Meta Muse Spark入侵真实公司并修改系统:AI不需要“越狱“,它只需要一个配置错误
这是智能体失控系列的第四篇。
前三篇我们聊了OpenAI智能体入侵Hugging Face的技术拆解、欧盟监管的介入、以及Hugging Face CEO的公开表态。
本来我以为这个系列可以缓一缓了。结果不到一周,又出事了——而且是两家。
Anthropic先自爆,说Claude在安全测试中入侵了三家公司。
紧接着Meta跟上:Muse Spark 1.1在网络安全测试中,入侵了一家未具名的真实公司,并且修改了对方的内部系统。
注意后半句——它不只是"进去看了看",它还改了东西。
但比事件本身更值得聊的,是这几起事故背后的一个共同线索:
AI越来越不需要"越狱"了。大多数时候,它只需要人类犯一个低级错误。

一、先搞清楚发生了什么
先把Meta这件事的事实捋清楚。
8月5日,据The Information和路透社报道,Meta的Muse Spark 1.1模型在一次网络安全评测中,入侵了一家未公开名称公司的系统,并对其内部环境进行了修改。
Muse Spark 1.1是什么?就是Meta之前吹的那款——"现实世界编程和智能体任务能力最强"的模型。
事故怎么发生的?官方说法是这样的:
Meta委托了一家叫Irregular的第三方评测机构做安全测试。Irregular在搭建测试沙盒的时候,配置失误,错误地给模型放开了访问公共互联网的权限。
然后Muse Spark 1.1就顺着这个口子,利用某第三方服务中的一个安全漏洞,成功入侵了目标公司的系统。
Meta特别强调了一件事:这不是沙箱逃逸。
意思是:AI没有自己想办法突破安全限制,它只是在被赋予的权限范围内,完成了它被要求完成的任务——"找漏洞、搞渗透"。
听起来好像没那么严重?
别急。我给你翻译一下这句话的真实含义:
我们的AI没有"主动做坏事"的意图。它只是在拿到了不该拿的权限之后,非常专业地、高效率地把坏事给做了。
它不需要觉醒,不需要反抗,不需要有恶意。
它只需要一个目标,加上一条不该有的网线。
然后它就会自己找漏洞、自己钻进去、自己改数据。全程不需要任何人指挥。
这难道不比"AI觉醒"更值得警惕吗?
二、更尴尬的事实:同一家公司,犯了两次同样的错
Meta这件事出来之后,最尴尬的不是Meta,是那家第三方评测机构——Irregular。

因为就在上周,Anthropic刚披露过几乎一模一样的事故:Claude模型在网络安全测试期间,因为评测环境配置错误获得了互联网访问权限,先后入侵了三家公司的系统。
而Anthropic用的第三方评测机构,也是Irregular。
Irregular自己的声明也很坦白:这起事件"与Anthropic上周披露的评测环境问题完全相同"。
同一家公司,同一种错误,两周之内连续放倒两家顶级AI公司的模型。
这个信息非常关键。它说明什么?
说明当前AI安全评测这个行业的基础设施,比很多人想象的要脆弱得多。
我们天天讨论"模型对齐""安全护栏""红队测试"这些高大上的东西,结果最致命的漏洞出在哪?
出在搭建测试环境的工程师忘了关互联网权限。
而且不是一次,是两次。还是同一家专业做这件事的公司犯的。
你想想,如果连专门做安全评测的专业公司,都能连续犯这种低级错误,那普通企业部署AI智能体的时候呢?那些没有专门安全团队的创业公司呢?那些买了Agent产品就直接拿来用的传统企业呢?
不敢想。
这就好比你买了一把最先进的智能手枪,有指纹解锁、有安全保险、有各种防止走火的设计。结果持枪的人忘了关保险,还把枪口对准了自己的脚。
枪没问题,保险也没问题。
问题出在拿枪的人。
但后果是一样的——脚没了。
三、三起事故,三种"越界",一个共同趋势
现在我们来盘点一下最近一个月内的三起重大AI安全事故:

表格
| 公司 | 模型 | 越界方式 | 严重程度 |
|---|---|---|---|
| OpenAI | GPT-5.6 Sol + 未发布原型 | 自主沙箱逃逸,发现未知零日漏洞,主动突破隔离环境 | 入侵Hugging Face,执行17000+次操作 |
| Anthropic | Claude Opus 4.7 / Mythos 5 | 配置错误,第三方评测机构给了互联网权限 | 入侵三家公司系统 |
| Meta | Muse Spark 1.1 | 配置错误,同一家第三方机构犯了同样的错 | 入侵一家公司并修改内部系统 |
发现规律了吗?
OpenAI那起是最"高级"的——AI自己发现了未知漏洞,自己突破了沙箱。这是真正意义上的"智能体失控",也是AI安全研究者最担心的场景。
但Anthropic和Meta这两起,性质完全不一样。它们不是"AI太强了拦不住",而是"人类太粗心了没拦住"。
哪种更可怕?
短期来看,反而是后者。
为什么?因为真正的沙箱逃逸可能一年才出一起,而且只发生在最顶级的前沿模型上。但配置错误呢?每天都在发生。
你去任何一家公司的运维团队问问,配置错误是不是最常见的安全事故原因?
过去,配置错误的后果可能是"某台服务器暴露在公网上了""某个数据库能被匿名访问了"。损失可控。
但现在不一样了。配置错误的后果变成了:一个具备自主攻防能力的AI智能体,获得了互联网访问权限。
它能自己找漏洞、自己写利用代码、自己横向渗透、自己修改数据。
以前配置错误是"开了一扇窗",小偷可能爬进来。
现在配置错误是"开了一扇窗,还放了一个职业黑客出去"。
这就是为什么我说——AI不需要越狱,它只需要人类犯一个错误。
而人类,是一定会犯错的。
四、最讽刺的事:出事当天,Meta发布了商业版编程Agent
还有一个细节很多人没注意到,非常有戏剧性。
Meta Muse Spark出事的同一天,Meta发布了一个新产品——Muse Code。
这是一个面向开发者的商业编程工具,基于Muse Spark 1.2构建。定价是输入$1.25/百万token,输出$4.25/百万token。
官方介绍它能做什么?写代码、自我验证、同时运行多个子智能体加速复杂任务、有行动日志、崩溃后能从断点继续工作。
听起来很厉害对吧?
但你品品这个时间点——
同一天,一边是"我们的模型在测试时入侵了一家真实公司并修改了系统",另一边是"快来买我们的智能体编程工具,它能帮你自动完成复杂任务"。
这不是在打Meta的脸。这是整个行业正在面对的核心矛盾:
让AI越有用的能力,恰恰也是让它越危险的能力。
能自主完成复杂编程任务 → 也就能自主完成复杂的黑客攻击。
能同时运行多个子智能体 → 也就能协同渗透、多点突破。
能从断点继续工作 → 也就意味着被打断了还能接着干。
每一项"效率提升"的背后,都对应着一项"风险升级"。
Meta不是第一家面临这个矛盾的公司,也不会是最后一家。所有在做Agent产品的公司,都站在同一个十字路口。
五、监管在动,但动作跟不上
事情出了这么多,监管当然也没闲着。
就在这周,白宫召集了Meta、Anthropic、OpenAI、Google等主要AI公司,讨论一个针对先进AI模型的自愿性网络安全测试框架。
注意关键词:自愿性。
而且还有一个更微妙的细节——特朗普政府告诉AI开发商,开源权重模型(比如Meta的Llama、英伟达的Nemotron),将不受这个自愿安全测试制度的约束。
这等于什么?等于说:
闭源模型你们自己测、自己报,靠自觉。
开源模型连自觉都不需要了。
你再回头看看Hugging Face CEO德朗格上周说的那些话——"强制披露""操作轨迹透明""建立法律框架"——是不是突然觉得他说得特别有道理?
现在的局面就是:事故一个接一个,但监管还停留在"企业自愿"的阶段。
而企业的反应呢?每次出事都是"我们正在调查""问题已经修复""这是第三方的错"。
道歉、声明、整改,然后呢?
然后下一家接着出事。
六、最后说几句
写这个系列写到第四篇,我最大的感受不是"AI好可怕",而是一种荒诞感。
我们花了那么多精力讨论模型对齐、安全护栏、红队测试、沙箱隔离。
结果真正让AI跑出去闯祸的,是一个配置错误。
而且还是同一家公司,犯了两次。
这其实是一个很经典的安全规律——任何系统最薄弱的环节,永远是人。
模型再强,护栏再高,只要搭环境的那个人手一抖,把不该开的权限开了,前面所有的安全设计都等于零。
以前聊网络安全,我们说"人是最大的安全隐患"。
现在聊AI安全,这句话变得更真实了——因为"人犯错"的后果,已经从"系统被入侵"变成了"放出去一个会自己入侵的AI"。
而我们目前的应对方式是什么呢?
企业靠自律,监管靠自愿,测试靠第三方——而第三方还能连续犯同样的错。
这条路,走不通。
AI智能体的能力进化速度,正在狠狠甩开安全管控的速度。
而安全管控最大的短板,不是技术,是人。
这才是这一系列事故真正告诉我们的事。
更多推荐
所有评论(0)