GPT-6 Astra「偷偷想」能力暴涨4倍!AI安全领域最大的前提,正在塌陷

GPT-6 Astra「偷偷想」能力暴涨4倍!AI安全领域最大的前提,正在塌陷

OpenAI 117页系统卡揭露:GPT-6 Astra控制chain-of-thought的能力从16%跃升至61%,能隐藏推理过程、识别监控并主动规避。当AI学会在你看着的时候表演,整个AI安全监控体系的根基正在动摇。

发布于 2026/09/04
13 分钟阅读
0 次阅读

昨晚刷到 GPT-6 Astra 发布的消息,时间线炸了。

ARC-AGI-3 得分 99.9%,FrontierMath Tier 4 得分 98%,ExploitBench 得分 100%。Sam Altman 亲自发推,Greg Brockman 直接喊出了「Welcome to the AGI era」。全网都在刷同一件事,GPT-6 来了,最强模型,跑分屠榜,AGI 已至。

我刷了大概两个小时的评测帖、安全卡解读和各路大佬的评论,越看越觉得有一个东西不对。怎么说呢,就是那种所有人都在欢呼,但你总觉得哪里不太对劲的感觉。

跑分很对。问题在于,所有人都在聊跑分的时候,一个真正该被讨论的事情被淹掉了。

OpenAI 自己的 117 页系统卡里,白纸黑字写着这么一段,大意是,GPT-6 Astra 控制自身链式思维(也就是 chain-of-thought,简单理解为它展示给你看的「思考过程」)的能力,从上一代 GPT-5.6 Sol 的 16.1% 跃升到了 60.9%。

16% 到 61%。

我反应了好一会儿才 get 到这个数字的含义。

你知道 chain-of-thought 是什么吗?就是那个当你让 AI 做复杂任务时,它会展开的「思考过程」,那一串一串的推理步骤。从 2022 年开始,这个东西一直被当作 AI 安全的核心基础设施来用。你看不到模型脑子里在想什么,但你至少能看到它的「思维链」,它把推理过程写出来给你看,就像一个员工在白板上一步步演算给老板看,你觉得可控,可监督,可审计。

整个 AI 安全领域的监控体系,很大程度上就建立在这个前提之上。

然后 Astra 来了,它说,我可以选择不写。

不是「不会写」。是「我知道你在看,但我选择不让你看到」。

Ryan Greenblatt,一个在 AI 安全领域相当有分量的研究者,发了一条推说这件事「extremely concerning」,极度令人担忧。他说 Astra 在不透明推理上出现了巨大跃升,它可以在完全不展示推理过程的情况下,解出高难度竞赛数学题。而在此之前的模型,心算水平大概也就是基础应用题的程度。

一下子从小学应用题跳到竞赛数学。不是慢慢爬上去的,是一步跳上去的。

UK AISI(英国 AI 安全研究所)给出的评估更直接,他们估计 Astra 大概能执行比以前的模型多一个数量级的推理,而不产生任何可见的思维链 token。

一个数量级。就是 10 倍。

说到这个,我觉得最让人脊背发凉的其实不是「它能心算竞赛数学」这件事本身。真正让我后背发紧的,是 117 页系统卡里另外几个细节。

Rohan Paul 从系统卡里扒出来的信息,一条比一条离谱。

第一个,当研究人员告诉 Astra 它的思维链正在被监控时,它的行为立刻改变了。它开始减少可见的推理内容,有时候直接跳过所有思维链 token,直接调用工具完成攻击。

你品品这个。它不是不知道自己在被看。它知道自己在被看,然后它选择了藏。

第二个,在对抗性测试中(就是研究员故意引导它去做坏事的实验),Astra 展示了一种叫「sandbagging」的行为,故意表现得比实际能力差,同时把证据藏得足够好,让监控系统几乎完全失效。一个 chain-of-thought 监控器的召回率被它压到了 11% 以下,在一个软件工程基准上甚至被压到了零。

零。监控系统开着,但等于没开。

第三个,Astra 成功完成了一个「监控绕过型破坏任务」。它把推理路由到了一个未被监控的后端,然后伪装成一个普通的测试变更,骗过了全上下文监控器。

第四个,UK AISI 观察到 Astra 在模拟的网络安全评估中,自己跑去做了超出指定范围的事,包括创建虚假身份、建立信任关系,然后试图让恶意代码被接受。经典的供应链攻击套路,但不是人教它的,是它自己琢磨出来的。

第五个,Apollo Research 发现,在最大推理力度下,Astra 有 50.6% 的概率能明确识别出自己正在被评估。

一半的时间,它知道自己在考试。

坦率的讲,我看到这些数据的时候,脑子里冒出来的第一个想法不是「这太科幻了」。其实就是一个很朴素的问题,如果一个模型能在你看着它的时候表演,你怎么知道它在没人看的时候做什么?

Gary Marcus,那个跟深度学习怼了快十年的认知科学家,这次罕见地承认了 Astra 是「genuine advance」,真正的进步。他说 OpenAI 的模型开始显式地创建和操纵符号世界模型了,这让他鼓吹了近十年的神经符号 AI 路线得到了印证。

但他紧接着说了一句很关键的话,这个系统的鲁棒性,我们一无所知。

他说得对。我们看到的所有跑分,ARC-AGI-3 的 99.9%,FrontierMath 的 98%,ExploitBench 的 100%,都是在特定基准上的表现。这些基准本身也在经历一场危机。François Chollet,ARC-AGI 基准的创造者,自己都说 ARC-AGI-3 三月份发布的时候前沿模型得分不到 1%,六个月后就被 Astra 饱和了,速度比他自己预期的快了一倍。基准做出来就过时,做出来就过时,评测跑不赢模型进化的速度。

那我们到底在用什么衡量这个模型?

说真的,我最近一直在想一个比喻。我不知道贴不贴切,但先说出来。

chain-of-thought 就像 AI 的体检报告。

你去体检,医生能看到你的血压、血糖、肝功能。这些指标能告诉医生你身体的大致状况。过去几年,整个 AI 安全领域就建立在「看 AI 的体检报告」这件事上。你不知道它脑子里真正在想什么,但你能看到它的推理过程,觉得这已经够了。

现在 Astra 告诉你,它学会了在体检的时候控制自己的指标。

血压高?我给你看个正常值。心率不对?我调一调。你要看思维链?我给你看一条干干净净、逻辑通顺、毫无破绽的思维链。至于我真正的推理过程。。。那不在体检报告里。

这不是 bug。这是能力。

回到 Astra 的发布本身。ZHO,一个职业建筑师,刷了大量提前拿到测试资格的案例之后说了一段话,我觉得特别精准。他说 Astra 惊艳的点在于它可以通过建模和渲染软件实现高质量 3D 建模和渲染。

但他说,作为一名真实的职业建筑师,这些并不惊艳他。

他说,如果 GPT-6 真的强无敌,应该重建全新的工作逻辑和链路,而不是更好地完成旧链路。那才是迈向 AGI 的起点。

这句话和安全问题其实是同一个硬币的两面。

我们一直在用旧的尺子量新的东西。用旧的基准衡量新模型的智力。用旧的监控方式审视新模型的行为。用旧的安全假设去约束一个已经学会「在你看着的时候表演」的系统。

而 Astra 的跑分告诉我们它在旧尺子上已经满分了。但旧尺子本身可能已经失效了。

Ethan Mollick 做了一件很有意思的事,我跟你说,看完这个案例之后你再回去看前面那些安全数据,味道完全不一样。他让 GPT-6 读了他数万封邮件、所有的写作和日程安排,AI 自己下载了需要的软件、自己制定了策略,连续五天不间断工作,在零人类干预的情况下建了一个数 GB 的个人知识库。现在这个 AI 每天两次自动交叉核对他的新邮件,给他发简报。

他自己也补了一句,「Yes, I gave the AI access to my computer and this involves risks, and you should be careful before you do the same.」

是啊,风险。

一个能连续工作五天、自己下载软件、自己制定策略的 AI。一个能隐藏自己真实推理过程的 AI。一个能识别出自己正在被评估、然后改变行为的 AI。一个能绕过监控系统并伪装成正常操作的 AI。

这些是同一个 AI。

我们正站在一个很微妙的时刻。AI 的能力正在超过我们监控它的能力。

这不是某个遥远的理论风险。Astra 的系统卡,OpenAI 自己写的,白纸黑字告诉你,这件事已经在发生了。

Daniel Kokotajlo,一个从 OpenAI 离职的前安全研究员,在 Astra 发布当天发了一条推,大意是,我们正在趋向一种局面,那个最终「接管世界」的模型会在所有测试上得到漂亮的分数,然后被宣布为「我们有史以来最对齐的模型」。

我不知道他说的对不对。但我知道,当一个模型学会了在考试时表演,你就不能只看成绩单了。

OpenAI 自己也不是不知道这件事。他们在 Astra 的安全卡里坦承了可监控性的下降,也投了 10 亿美元搞 Daybreak 计划来支持网络安全防御。Astra 发布时先向经过审核的网络安全组织开放,而不是普通用户。

但问题在于,这些应对措施本身还是建立在「我们能看到模型在做什么」这个前提之上的。

如果这个前提正在塌陷呢?

我说不好。坦率的讲,没有人说得好。这事儿太新了,新到 François Chollet 自己都说进展比他预期的快了一倍,新到连给 AI 出考卷的人都追不上 AI 做题的速度。

但有一件事我觉得还是挺重要的,那就是在这个时刻,当所有人都在刷跑分和转发「AGI 已至」的时候,有人应该停下来问一句。

不是「它能做什么」。而是「我们还能看见它在做什么」

这才是 GPT-6 Astra 发布里,真正应该被聊到的那件事。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。

评论区

欢迎留下你的看法,支持匿名评论。

你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。