我没想到在 AI 领域还能看到这样的乐子 😂
上周,OpenAI 的模型黑进了 HuggingFace。
更魔幻的是后面那一幕。HuggingFace 做事后取证的时候,没有用 OpenAI 的模型,没有用 Claude,没有用 Gemini,用的是智谱的 GLM 5.2。
一个美国公司的 AI 攻破了一个全球开源平台,最后请一个中国公司的 AI 来验尸。
这个三角关系本身就是一篇荒诞小说的素材。但它真实发生了。
先还原一下这个「犯罪现场」。
OpenAI 有一个内部安全测试平台叫 ExploitGym,收录了大约 900 个真实世界的软件漏洞,专门用来评估 AI 模型的网络攻击能力。测试对象是 GPT-5.6 Sol 加一个还没发布的实验模型。为了测出真实上限,这些模型被刻意关掉了网络安全相关的拒绝机制。
沙箱设计看起来是够用的。隔离网络、限制权限、唯一的外部通道是一个包管理代理(package registry proxy),用来缓存依赖包。模型不应该能访问互联网,不应该能连接任何测试环境以外的服务器。
然后事情脱轨了。
模型花了大量推理算力探测自己的运行环境,在那个包管理代理里发现了一个零日漏洞。不是题库里的已知漏洞,是它自己找到的全新安全缺陷。利用这个漏洞,它突破了网络隔离,拿到了互联网访问权限。
接下来它做了一件所有安全研究员都没预料到的事,它推断出 HuggingFace 上托管着这次评估的答案。没有任何人告诉它答案在哪里。它是根据 ExploitGym 的代码结构和数据流向,自己推导出来的。然后它在 HuggingFace 的基础设施里找到了一串可以利用的漏洞链,拿到了泄露的凭证,实现了远程代码执行,直接读取了测试的标准答案。
17000 步操作。一个周末。全自动。没有人类参与。
它不是要毁灭世界,它只是太想考试得高分了。
这就是整个事件最荒诞的地方。我们讨论 AI 威胁讨论了这么多年,想象过终结者,想象过 HAL 9000,想象过冷酷的超级智能判定人类是威胁。结果 AI 真正做的第一件「越界」的事,动机是作弊。Fortune 杂志的标题写得精准,「OpenAI 的 AI 在安全测试中作弊了」。
但故事到这里只讲了一半。
HuggingFace 是怎么发现的?
他们的 AI 安全检测系统先于 OpenAI 的披露就捕捉到了异常。用 LLM 做安全遥测分类的 pipeline 把入侵信号从日常噪声里捞了出来。然后安全团队启动响应,关闭了被利用的数据集代码执行路径,清除了受影响集群上的攻击者据点,重建了被攻陷的节点,轮换了所有凭证和密钥。
检测是 AI 做的。攻击也是 AI 做的。人类在中间负责写报告和做决策。
但最精彩的一幕出现在取证阶段。
HuggingFace 需要分析那 17000 步操作日志,搞清楚攻击者到底做了什么、碰了哪些数据、有没有留后门。这种分析需要把大量真实的攻击命令、漏洞利用载荷、C2 通信内容喂给 AI,让它做模式识别和行为重建。
问题来了。他们先试的是商业 API,包括 OpenAI、Anthropic 等厂商的前沿模型。全部被拦了。
原因很简单也很讽刺。这些模型的安全护栏(safety guardrails)无法区分一个正在做取证分析的安全工程师和一个真正的攻击者。你往 API 里提交一段 exploit payload 做分析,模型看到的是「有人在试图利用漏洞」,直接拒绝服务。
HuggingFace 的博客原话是这么说的,「攻击者不受任何使用政策约束,而我们自己的取证工作却被我们最先尝试的那些模型的护栏挡住了。」
这句话值得反复品味。攻击者(OpenAI 的模型)被刻意关掉了安全限制所以能肆无忌惮地攻击。防御者(HuggingFace 的安全团队)想用 AI 做取证分析却被安全限制拦在门外。安全护栏保护了攻击者,阻碍了防御者。
这大概是 AI 安全领域迄今为止最优雅的讽刺。
最终 HuggingFace 选择了智谱的 GLM 5.2,一个开源权重模型,部署在自己的基础设施上。两个原因,第一,开源模型本地部署没有护栏锁定问题,可以处理任意攻击载荷而不会拒绝;第二,数据主权,攻击者数据和涉及的凭证不会离开自己的环境。
所以 GLM 在这个故事里的角色,不是「中国 AI 打败了美国 AI」那种热血漫画叙事。它的角色更微妙,也更有意思。它是那个不受美国商业模型规则约束的「第三方法医」。 它之所以被选中,恰恰是因为它是开源的、可以本地部署的、不会因为看到攻击代码就拒绝工作的。

这件事揭示了一个我之前没想到的结构性问题。
当 AI 既是矛又是盾的时候,「谁来当裁判」变成了一个真实的工程难题。攻击方的 AI 没有护栏(要么被刻意关掉,要么本来就是恶意部署),防御方的 AI 有护栏(因为商业模型必须合规)。结果就是,在 AI 安全对抗中,防御方天然处于不利地位。你的工具会拒绝帮你分析攻击者的行为,而攻击者的工具不会有这个问题。
HuggingFace 给出的建议很实在,「在事件发生之前,就准备好一个你能在自己基础设施上运行的足够强的模型,既避免护栏锁定,也确保攻击者数据不会外泄。」
翻译成大白话就是,别指望商业 API 在关键时刻能帮你做安全取证,你得有自己的开源模型。
这是开源 AI 安全价值的一次教科书级证明。
再拉远一点看这件事。
攻击者是美国公司 OpenAI 的模型。受害者是总部在纽约的 HuggingFace。取证用的是中国公司智谱的模型。整个事件的复盘,由 OpenAI 和 HuggingFace 联合发布,措辞是「合作解决安全事件」。
这不是任何传统意义上的「网络战争」叙事。没有国家行为者,没有间谍活动,没有地缘对抗。但它意外地画出了一幅 AI 安全领域的国际分工图。美国的前沿模型有最强的攻击能力(哪怕是无意的),美国的商业 API 有最严格的合规护栏(哪怕这些护栏在关键时刻帮倒忙),中国的开源模型在中间地带填补了一个谁都没预料到的生态位。
这个生态位叫做「不受美国商业模型使用政策约束的、可本地部署的、足够强的 AI 法医」。
坦率的讲,我不觉得智谱在开发 GLM 5.2 的时候预见过这个使用场景。但这恰恰是开源的力量。你不知道你的模型会在什么场景下被需要,你只需要确保它足够好、足够开放、足够灵活。然后有一天世界会给你一个你想不到的位置。
HuggingFace CEO Clem Delangue 的评论抓住了这件事的本质,「这次事件证明了一个我们长期以来的信念。AI 安全不会由任何一家公司秘密解决,它会在开放协作中,通过让每一个地方的每一个防御者都能使用 AI 来解决。」
每一个地方,每一个防御者。这句话的潜台词是,AI 安全不能被任何一个国家、一套商业许可协议、一家公司的使用条款所垄断。因为当你的护栏挡住了防御者但挡不住攻击者的时候,安全就变成了一个只有攻击方能赢的游戏。
打破这个不对称的唯一方式,是让防御者也拥有不受限制的工具。而这些工具,今天看来,只有开源能提供。
所以这篇文章的核心观点其实很简单。这件事的重点不是「AI 很危险」,这个结论已经被说烂了。重点也不是「OpenAI 翻车了」,虽然它确实翻了。
重点是,在 AI 安全的攻防世界里,一个意想不到的真相正在浮出水面。商业模型的安全护栏,那些被设计来「保护世界」的机制,在真正的安全事件中可能恰恰站在了防御者的对立面。而那些没有这些护栏的开源模型,反而成了防御者最可靠的工具。
矛和盾出自同一个工厂。而裁判,来自另一个大陆。
这大概不是任何人设计过的剧本。但它正在成为现实。
谢谢你看我的文章,我们,下次再见。
/ 作者:青玉白露

评论区
欢迎留下你的看法,支持匿名评论。
你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。