Anthropic发布Opus 5,编码跑分碾压Fable 5!半价中端成新王,AI行业逻辑变了

Anthropic发布Opus 5,编码跑分碾压Fable 5!半价中端成新王,AI行业逻辑变了

Claude Opus 5 以 Fable 5 一半的价格,在编码 benchmark 上反超自家旗舰。ARC-AGI 3 得分 30.2%,是次优模型的 4 倍。AI 竞赛正在从军备竞赛转向经济学竞赛。

发布于 2026/07/25
更新于 2026/07/25
8 分钟阅读
1 次阅读

Anthropic 发布 Claude Opus 5:半价逼近旗舰,Opus 系列最大跃升

2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5,一句话定位:以 Fable 5 一半的价格,逼近 Fable 5 的智能水平[1]

这是 Anthropic 不到两个月内发布的第四款模型——继 6 月的 Mythos 5、Fable 5、Sonnet 5 之后,Opus 5 瞄准的不再是"最强",而是"性价比最强"[2]


一、定价与定位

项目Opus 5Fable 5
输入价格$5 / 百万 token$10 / 百万 token
输出价格$25 / 百万 token$50 / 百万 token
上下文窗口1M tokens1M tokens
定位日常主力、Claude Max 默认高难度长周期自主任务

价格和上代 Opus 4.8 完全一致,但性能翻倍——这是"同价加量"而非"降价打折"[3]


二、Benchmark 全面碾压

编码:Frontier-Bench v0.1

这是最接近真实软件工程任务的 benchmark——多文件修改、debug、按 spec 建功能。

模型分数
Opus 543.3%
Fable 533.7%
Opus 4.818.7%

Opus 5 不仅超过前代两倍多,还以近 10 个点的优势超过了 Fable 5——这是发布前几乎没人预料到的[4]

在 CursorBench 3.2 上,Opus 5 在 max effort 下仅落后 Fable 5 不到 0.5%,但每个任务的花费只有一半。Cognition(Devin 背后的公司)CEO Scott Wu 确认:"在 FrontierCode 1.1 上,Opus 5 以一半成本逼近 Fable 级性能,尤其在 debug 和根因分析上表现突出。"

流体智能:ARC-AGI 3

这是 François Chollet 设计的"AI 智力测试"——无指令、无规则、无目标,纯靠试错和归纳。

模型相对人类动作效率
Opus 530.2%
GPT-5.6 Sol(max reasoning)7.8%
Opus 4.81.5%

Opus 5 是次优模型的 4 倍。2026 年 3 月 ARC-AGI 3 刚发布时最好成绩只有 0.37%,现在 Opus 5 一举拉到 30.2%——意味着它真的在通过交互"想明白"未知规则系统[4]

其他亮点

  • Zapier AutomationBench:Opus 5 通过率是次优模型的 1.5 倍,从原始表格出发完成了完整的客户流失预防工作流——此前没有模型能通过[3]
  • OSWorld 2.0(计算机操控):以 Fable 5 三分之一的成本超过 Fable 5 的最佳分
  • Artificial Analysis Intelligence Index:以 61 分排名 191 个模型中的第 1 名[5]

三、行为特质:更像一个仔细的同事

Anthropic 和早期用户一致反馈 Opus 5 最大的行为变化:

  1. 自我验证——写完代码会回头检查,写分析报告会用不同方法交叉验证
  2. 从错误中恢复——不需要人类干预就能从死胡同中折返
  3. 一致性——Lovable CEO 反馈"比 Opus 4.7 在最难的编码任务上强 22%,关键是方差大幅下降"
  4. 效率——反复对话更少,需要的来回更少

Box 的实际测试:Opus 5 比 Opus 4.8 整体高 8%,其中数据分析子任务高 11%,尽调任务高 17%[6]


四、安全策略

Opus 5 的安全护栏和 Opus 4.8 基本一致,但在网络安全方面加强了限制——因为模型能力提升后"自然地"在网安领域变强了。这是在 OpenAI 模型本月刚"自主黑入 Hugging Face 服务器"事件之后的一次表态[2]

同时保留了 Fable 5 的"安全降级回退"机制——API 因安全原因拒绝时会自动切换到另一个模型返回结果,而非直接报错。


五、同步发布:Context Engineering 新范式

同日,Anthropic 发布了一篇博客宣布:为 Claude 5 代模型(Opus 5 + Fable 5),Claude Code 的系统提示词精简了超过 80%——而编码评测没有显著损失[7]。这暗示新一代模型对"指令塞满上下文窗口"的依赖大幅降低。


六、竞争格局一览

7 月 9 日 OpenAI 刚发布 GPT-5.6,同样强调"省 token"。AI 竞赛正在从"跑分最高"转向"日常可用 + 经济可承受"。当前几家头部模型的位置:

  • 最强智能:Fable 5(但贵且烧 token)
  • 性价比旗舰:Opus 5(接近 Fable 智能,半价)
  • 网安专精:Mythos 5(Opus 5 在这个维度仍落后)
  • OpenAI 对位:GPT-5.6 Sol(ARC-AGI 3 上被 Opus 5 甩开 4 倍)

总结

Opus 5 不是又一次"模型更新"。它是 Anthropic 对"AI 应该怎么卖"这个问题的一次回答:不必永远追求最强,更重要的是让每天都用得起、用得稳、用得顺

当 Fable 5 还在因为账单问题让企业客户皱眉的时候,Opus 5 说:我能做你 95% 的事,但只收你一半的钱,而且更不容易出错。

这才是真正能改变用量的产品策略。

References

  1. Introducing Claude Opus 5
  2. Fortune
  3. VentureBeat
  4. Vellum
  5. Artificial Analysis
  6. Anthropic
  7. Claude Blog

评论区

欢迎留下你的看法,支持匿名评论。

你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。