AI终于学会了「记住自己在想什么」
前天 OpenAI 发了一篇技术博客,标题很朴素,叫《How enabling two settings tripled our scores on the ARC-AGI-3 benchmark》。
技术博客嘛,标题越无聊内容越炸。这篇就是。
一个让人哭笑不得的发现
GPT-5.6 Sol 被拿去做 ARC-AGI-3 测试的时候,分数只有 13.3%。
这个成绩让人困惑到想笑。Sol 是 OpenAI 当前最强的推理模型,能解开数学界的公开难题,BrowseComp 上拿 92.2%,OSWorld 2.0 上 62.6%。一个解得了实分析证明的模型,被一个 2D 拼图游戏打到了 13%。
ARC-AGI-3 的题目是这样的。给你几组 2D 网格图案的输入输出对,让你发现变换规律,然后预测新输入对应的输出。像一个视觉版的智力测试。题目本身不算难,难的是你得在一系列尝试中不断修正对规律的猜测。一步步逼近正确答案。
关键词是「一步步」。
OpenAI 的人去查了为什么 Sol 分数这么低。答案让人哭笑不得。
标准测试框架的做法是,每一步操作之后,把模型之前的推理过程全部丢弃。如果上下文窗口快满了,就从前面开始截断历史记录。模型每走一步棋,都得从头开始想。它刚刚花了三千个 token 搞明白的变换规律,下一步就全忘了。重新看题,重新猜测,重新推导。
这就像让一个人做数独,但每填一个数就把之前所有的草稿纸撕掉。
你再聪明也会变成白痴。

更气人的是,这不是什么边界情况。这是绝大多数 Agent 框架的默认行为。上下文管理策略就是"塞满就截断"。没人觉得有什么问题。大家习惯了。
问题从来不在模型的智力。在模型外面套的那层壳。
两行配置,188% 的提升
OpenAI 做了一件事。在 Responses API 里打开两个设置。
第一个叫 retained reasoning。保留推理过程。模型上一轮的思考不再被丢弃,而是以加密形式保存下来传给下一轮。
第二个叫 context compaction。上下文压缩。当上下文快满的时候,不是粗暴截断前面的内容,而是让模型先做一次压缩摘要,保留关键信息后再继续。
没有任何模型微调。没有任何提示词优化。没有重新训练。就是在 API 调用的 JSON 里加了两个字段。
结果分数从 13.3% 跳到 38.3%。涨了 188%。
同时,输出的 token 数反而少了六倍。
停一下。
更好的效果,更少的消耗。这两件事通常互斥。你想让模型想得更深,就得让它输出更多推理 token。但这里反过来了。
因为之前那些重复的推理全是浪费。模型每一步都在重新发现同一个规律,每次都从头输出一遍完整的推理链。就像一个人每天早上醒来都不记得昨天学了什么,每天都在重新学同样的东西。记住了之后就不用反复学了。token 自然省下来了。
OpenAI 自己的总结很克制,但信息量极大。"基准测试很少只测量模型本身。它同时测量了一系列不太可见的选择,包括 API 设置、harness 设计和提示词策略。"
翻译成人话就是,你以为你在测模型。其实你在测管道。
推理持久化到底在做什么
技术上的实现是这样的。
GPT-5.6 的推理过程可以被加密保存。在 API 调用里加一行 include: ["reasoning.encrypted_content"],模型的输出会多附带一段加密数据。里面是模型的推理 token。人读不懂,但模型下次拿到的时候能读懂。
下一次调用时把这段加密内容传回去。模型就能接着上次的思路继续想,而不需要从零推导一遍。
这跟大家熟悉的 prompt caching 完全不同。
Prompt caching 存的是输入。你有一段长长的 system prompt,每次调用都一样,缓存之后不用重新编码了。节省的是预填充的计算量和延迟。但模型每次还是得重新推理。
推理持久化存的是「思考过程本身」。节省的是模型重新"想一遍"的全部算力和 token 消耗。
打个比方。
你在读一本很厚的技术手册,每天只能读一章。Prompt caching 相当于第二天打开书的时候,书签帮你定位到了上次读到的那一页。你不用从目录翻起了,省了翻页的时间。但你坐下来之后还是得想一想昨天读的什么。
推理持久化相当于你昨晚临睡前在笔记本上写了一段总结。"第七章那个概念和第三章的公式有关联。明天要重点验证第九章是否证伪了这个假设。目前倾向于假设成立,因为第五章的实验数据支持。"
你不只记住了读到哪儿。你记住了自己正在想什么、想到了哪一步、下一步打算验证什么。

第二天坐下来直接接着想。不需要花半小时回忆昨天的心路历程。
而且这本笔记本里写的东西是加密的。你打开只看到一堆乱码。但你明天的自己能看懂。这个加密设计是刻意的,防止开发者直接读取和篡改模型的推理链。保证推理的连贯性和完整性。
降本效果有多夸张
ARC-AGI-3 的故事是关于效果提升的。但真正让做产品的人兴奋的是成本故事。
OpenAI 拿 Luna 去跑 BrowseComp 基准测试。Luna 是 GPT-5.6 家族里最便宜的型号,定位高量低成本工作负载,输入每百万 token 一美元,输出六美元。
不用推理持久化的时候,想让 Luna 在 BrowseComp 上达到 Sol 级别的表现,需要花 33.27 美元。因为 Luna 推理能力弱一些,得跑更多轮、生成更多 token 来弥补。
开启推理持久化和上下文压缩之后,Luna 以 84.04% 的得分只花了 1.33 美元。Sol 在同一基准上是 84.36%。几乎追平。
从三十三块变成一块三。成本降了二十五倍。

这个数字改变了 Agent 开发的经济学假设。
之前,一个需要模型做复杂浏览器研究的 Agent 任务,跑一次三十多美元。你会把它当作"偶尔用一用的高级功能"。做日常监控?每天跑一百次?开玩笑。预算不允许。
现在一块三一次。一天跑一百次一百三十美元。一个月四千美元。对企业来说,这是一个可以认真评估 ROI 的数字了。对个人开发者来说,一天十几次的频率也就十几块钱,完全可以接受。
从"用不起"变成"值不值得用"。问题性质变了。
而且这个降本来源很独特。它不是因为模型本身降价了,不是因为芯片便宜了,不是因为量化压缩了模型精度。它是因为「思考」可以被存储和复用了。
以前每一次推理都是一次性消耗品。想完就扔。下次再想。像一根只能划一次的火柴。
现在想完可以存着。下次接着想。火柴变成了打火机。
这意味着什么
往深里想一层。
过去两年,行业对"让 AI 更便宜"的理解是线性的。训练更高效的模型,用更便宜的硬件跑推理,把推理集群搬到电费低的地方。所有的优化都发生在"单次推理"这个维度内部。
推理持久化跳出了这个框架。它的优化维度是"多次推理之间的关系"。
单次推理的成本可能没变。但因为多次推理之间可以复用思考成果,总成本断崖式下降。
这就像快递行业优化成本。传统思路是让卡车跑得更省油、让分拣机器人更快。推理持久化的思路是,如果今天送的包裹和昨天送的走同一条路线,那昨天规划路线的工作今天就不用重新做了。
从优化单次效率,到优化跨次复用。这是维度跃迁。
GPT-5.6 同时还引入了原生多智能体编排。Responses API 可以在一个请求里跑并发的子 Agent。推理持久化和多智能体结合起来,画面就很有意思了。父 Agent 可以让多个子 Agent 分别持久化各自的专项推理,下次遇到相似的子任务直接加载对应的推理状态继续跑。
一个 Agent 系统不再是每次都从白纸开始的无状态流程。它变成了能积累专项经验的持续运行体。
这是真正意义上的"Agent 有记忆"。不是那种把对话历史塞进 prompt 的假记忆。是推理层面的真记忆。模型记住的不是"我们聊了什么",是"我当时怎么想的"。
回头看看那些"不够好"的 Agent
这个认知倒回去套一下过去一年的 Agent 产品,很多事情就说得通了。
去年底到今年初,市面上涌现了一批 Agent 创业公司。做自动化浏览器的,做自动化编程的,做自动化研究的。大部分表现平平。演示的时候很惊艳,真正用起来就差强人意。复杂任务做到一半就跑偏了,或者重复执行同一个动作陷入循环。
当时大家的归因是"模型还不够强"。等更强的模型出来就好了。
现在看来,可能有相当一部分问题出在 harness 设计上。这些 Agent 的上下文管理策略普遍是原始的。每一步都是独立的推理,步与步之间没有推理状态的传递。模型在第十步已经搞明白的事情,到第十一步就忘了。然后在第十二步又搞明白了。第十三步又忘了。
它不是笨。它是不断被强制失忆。
推理持久化不会解决所有问题。但它解决了一个非常具体且非常常见的问题,多步任务中推理成果的丢失。光这一项,可能就能让相当一部分"不够好"的 Agent 突然变得够用。
为什么大多数人还不知道这件事
这就是 OpenAI 那篇博客标题朴素的原因。
它不好营销。"推理持久化"这四个字不像"GPT-5.6 发布"那样一句话就能传播。它需要你理解多步推理的工作原理,理解上下文管理的重要性,理解 token 经济学。门槛不高,但需要坐下来想十分钟。
而且它的效果不是"模型变聪明了"这种人人能感知的改变。它的效果是"同样聪明的模型,干同样的活,花的钱少了二十五倍"。这个故事对做产品的人激动人心,但对普通用户来说没有感知。
结果就是这条消息在社交媒体上的声量远低于同一天的 Gemini 3.7 Flash 降价、Anthropic 两万亿估值 IPO、DeepSeek-V4-Pro 正式版上线。那些新闻一句话就能说清楚。推理持久化需要一整篇文章。
但如果你是做 Agent 的人,这可能是这个季度最重要的一条技术新闻。
现在就能做的事
去 OpenAI 的 Responses API 文档里找 reasoning 参数对象。两步操作。
第一步,在请求里加上 include: ["reasoning.encrypted_content"]。模型返回的 output 里会多出加密的推理内容。
第二步,下一次调用的时候,把上一步拿到的推理内容作为上下文传回去。模型会自动识别并接续之前的推理状态。
就这两步。下一次运行你的多步 Agent 的时候,观察两个指标。任务完成质量有没有提高。总 token 消耗有没有下降。
根据 OpenAI 自己的数据,多步任务场景下效果提升 100% 以上、成本下降 80% 以上是常态。
两行配置。一个下午的改动。可能是你今年做的 ROI 最高的一次优化。
Agent 的军备竞赛进入了新阶段。比的不再只是谁的模型更聪明。比的是谁更早让自己的 AI 学会记住自己在想什么。

评论区
欢迎留下你的看法,支持匿名评论。
你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。