执行能力正在贬值,判断力才是新货币
上周三凌晨,GPT-6 Astra 上线。
朋友圈炸了一整天。我刷到最多的词是"震撼"、"颠覆"、"AGI来了"。
让我真正停下来的,不是跑分,是一段 Blender 的录屏。
OpenAI 的开发者 Sharif Shameem 让 Astra 在 Blender 里重建旧金山艺术宫。这座建筑1914年为世博会而建,柱廊弧线复杂到连本地建筑师都要对着照片反复量。Astra 接到任务之后,自己打开浏览器搜了几百张参考图,翻到美国国会图书馆的扫描档案查柱子尺寸,然后回到 Blender 里建模、调材质、打光、渲染。大部分工作在夜间完成。Shameem 早上醒来,模型已经在等他了。
另一个案例更粗暴。有人让 Astra 玩 Pokémon 火红版,纯截图操作,不读内存、不给攻略、不开提示。GPT-5.5 跑了218小时没通关。GPT-5.6 Sol 用了96小时。Astra,18小时12分钟,通关。
还有 Bun 团队。他们的 JavaScript 运行时之前是 Zig 写的,超过十万行。Claude Code 用 Opus 5 跑了一个动态工作流,11天把整个代码库从 Zig 重写成 Rust。有人类在旁边盯着,但主要工作是机器干的。Boris Cherny 估计同样的活儿工程师团队要做一年多。
这些案例放在一起,说明一件事已经无法回避了。
执行能力,写代码、建模型、跑流程、填表单、做PPT,正在以肉眼可见的速度贬值。
一
我说"贬值",不是说这些能力不重要了,是说它们不再稀缺了。
区别很大。
过去二十年,"能动手"是职场最硬的通货。会写代码的比不会写的值钱,能做出原型的比只会画PPT的值钱,执行力强是所有JD里排在第一位的要求。
因为稀缺。能把一个想法变成可运行的东西,中间隔着的是大量知识、大量练习、大量试错。这道门槛挡住了绝大多数人。
现在这道门槛正在被推平。

OpenAI 上周公布了一组内部数据。他们的研究组织里,每投入1个人类工作日,同时运行着3.1个 agent 工作日的工作量。中位数研究员每天消耗600美元的推理 token。排在第90百分位的研究员,每天用掉超过7000美元的 token。4月份的时候,只有三分之一的研究者同时跑4个以上的 agent 工作流。到8月中旬,这个比例已经到了四分之三。
换句话说,OpenAI 内部最聪明的一群人,已经在用 agent 大规模替代自己的执行工作了。
这不是预测。这是已经发生的事。
二
但如果你由此推导出"所以人要被替代了",那就把事情想简单了。
Ben Evans 上周发了一篇长文,标题是《AI, tools and transformation》。他的核心观点很冷静,AI 没有那么容易直接扫清企业里的重复工作,因为难点根本不在"做",在于"知道该做什么"。
他举了个例子。假设你是一个顶尖的婚姻诉讼律师,你每天想的是案子和当事人,不会去琢磨"什么样的法律文件检索软件能提高我的效率"。假设你是一个顶尖的企业销售,你想的是客户和竞争对手,不会去想"什么样的销售辅助工具能让我更高效"。
硅谷的人容易忘记这一点,因为他们的全部生活就是造工具。但大多数人不造工具。大多数人甚至不知道自己的工作流程里有哪些环节可以被自动化。
Evans 有一句话让我印象很深。他说过去几十年里,我们自动化掉的那些东西,即使你是一个工具建造者,一开始也看不出来需要自动化它们。很多时候,你看不到问题存在。很多时候,问题藏在别的东西里面。很多时候,即使看到了问题,正确的解法也不明显。在每一个成功的软件公司之前,都有好几个失败的前辈,它们没找对问题或没找对切入方式。
造工具更便宜了,不等于你就知道该造什么。

这句话适用于每一个正在焦虑"AI会不会取代我"的人。AI 让"执行"变便宜了。但"判断该执行什么"这件事,一点没变便宜。甚至更贵了。
三
有意思的是,AI 自己也在证明这一点。
Boris Cherny 是 Claude Code 的创造者。他在今年 YC Startup School 上说了一段话,大意是,不存在用好 AI 的唯一诀窍,别听 LinkedIn 网红的。
但他接着说了一个观察,比这句话有价值一万倍。
他说,他见过的所有给人留下深刻印象的 AI 成果,背后都是同一个模式。一个足够难的目标,加上一个 AI 能自己跑的验证回路。
Bun 团队的 Zig 转 Rust 之所以能跑通,是因为 Bun 和 Node 都有庞大的测试套件。AI 每改一段代码,跑一遍测试,就知道自己改对了没有。这不是提示词写得好,是验证机制设计得好。
他自己做的一个实验也是。他让 Claude 把 Anthropic 的 Electron 桌面应用重写成 Swift 版本。怎么验证呢?Claude 在一个 macOS 虚拟机里把 Electron 版截屏,再把 Swift 版截屏,逐像素比对。不需要人盯着。这个任务跑了两个多星期,采访的时候还没停。
Cherny 把这个总结成一句话,验证能力才是瓶颈。

翻译过来就是,AI 擅长执行,但它需要有人告诉它"什么叫做好了"。需要有人设计那个判断标准。需要有人定义"对"长什么样。
这是判断力。不是执行力。
四
让我把三条线拉到一起。
第一条线,AI 的执行能力正在指数级增长。Astra 能操作 Blender、Houdini、Unity,能18小时通关 Pokémon,能72.6%完成率做 OSWorld 的任务。OpenAI 内部 agent 工作量已经是人类的3.1倍。这个数字还在涨。
第二条线,企业和个人并没有因此变得更高效。Evans 观察到,大公司给每个人配了 Copilot、ChatGPT、Claude,小部分人用得很多,大部分人一周用两次,还有一大批人根本没在用。这跟1983年给每个人发一台PC装Lotus 123、1997年给每个人一个浏览器,是一模一样的剧情。工具到手了,不等于你知道该怎么用它改变你的工作。
第三条线,即使是 AI 本身,也证明了"验证比执行更关键"。Cherny 说得很明白,让模型长时间自主运行的关键不是更好的提示词,是更好的验证回路。谁设计验证标准,谁定义"什么叫做对了",谁就在控制整个过程。
三条线的交汇点是同一个结论。
执行能力在贬值,因为供给在爆炸。但判断力没有贬值,因为它的供给没有增加。知道该自动化什么、该验证什么、什么叫"做得好",这些东西仍然极度依赖人的经验、品味、上下文理解和跨领域直觉。
经济学家会告诉你这叫互补品效应。当一种要素的成本暴跌,与它互补的那种要素的价值就会暴涨。
AI 让执行接近于免费了。那什么跟执行互补?
判断。品味。定义问题的能力。知道"对"长什么样的能力。
这些东西变成了新货币。

五
卡兹克在 Astra 上线后写了一篇文章,用了"执行能力贬值"和"判断力断层"两个词。他看到的是同一个信号。
但我觉得多数人面对这个信号的反应是焦虑。焦虑自己的执行技能变得不值钱了。焦虑要去学什么新东西。
我的反应不太一样。
我觉得这件事的意思是,你过去觉得"不重要"或者"太虚"的那些东西,正在变成硬通货。
什么东西?
你对一件事情好坏的直觉。你在乱七八糟的信息里找到重点的速度。你决定"这事该做"还是"这事不该做"时脑子里过的那些权衡。你跟一个不了解上下文的人解释清楚一个复杂决定的能力。你看一个成品觉得"哪里不对"但说不出具体哪里不对的那种感觉。
这些以前被叫做"软技能",被排在简历最后面。
现在,当任何一个人都能让 AI 在一夜之间建出一座旧金山艺术宫的 3D 模型,真正的问题变成了,你为什么要建这座艺术宫?你确定客户要的是这个而不是别的什么?你怎么知道建出来的东西是好的?
那个"为什么"和"怎么判断好不好",是 AI 回答不了的。
至少目前回答不了。
六
我知道有人会说,等模型再强一代,判断力 AI 也会有的。
也许。但即使那一天到来,有一件事大概率不会变。
Evans 在文章里引了一个类比。他说,你在1983年给一家公司的每个人发了PC和Lotus 123,这不是你改造发票处理流程的方式。你在1997年给每个人一个浏览器,这不是你重建供应链管理的方式。
每一次技术换代,最先能做的事情都是"把现有工作做得更快"。但真正重要的事情,那些之前根本不可能做、甚至没人想象过的事情,需要很长时间才会出现,而且几乎一定是从那些理解业务、理解用户、理解上下文的人的脑子里长出来的。
AI 写代码写得再快,也不会自己跑去发现你们公司有一个流程是冗余的。AI 建模建得再好,也不会自己跑去问客户"你到底想要什么"。
这些事只能由人来做。由判断力来做。
19世纪中叶,经济学家杰文斯发现一个悖论。蒸汽机效率提升了,按理说煤的消耗应该减少,结果消耗反而暴增。因为蒸汽机便宜了,用途就多了,总需求就大了。
AI 时代的杰文斯悖论长这样。智能变便宜了,对智能的需求反而爆炸了。但不是所有种类的智能需求都会爆炸。爆炸的是对"知道该把智能用在哪里"的需求。
执行力是煤。判断力是知道该用煤烧什么。
煤价崩了。但知道该烧什么的人,比以前更值钱了。
七
说回开头那段 Blender 的录屏。
让我真正停下来的不是 Astra 能建出艺术宫。是 Shameem 的那句话。他说,这是他最喜欢的旧金山建筑,因为1914年世博会建造它的那个年代,技术让每个人都有一种深深的乐观感。
技术带来乐观感。
我觉得2026年9月也该有这种感觉。不是因为 AI 替我们干活了所以开心。是因为当执行变得便宜,我们终于有理由把时间花在更值得的事情上了。
你的判断力,你对好坏的直觉,你定义问题的能力,这些过去被执行工作淹没的东西,终于有了充分施展的空间。
前提是你真的有这些东西。
如果你过去二十年只练了执行力,没有练判断力,那这个时代确实让人慌。
但如果你脑子里一直有一个"什么是好的"的标准在运转,一直在练习"看到信号、做出判断、承担后果"这个回路。
恭喜。你手里的东西,刚刚涨价了。

评论区
欢迎留下你的看法,支持匿名评论。
你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。