昨晚,科技圈刚上演了一场开源 AI 大团建。

英伟达创始人黄仁勋在社交媒体发表公开信,拉上 Meta、微软等科技巨头/机构,为开源模型鼓劲打气。但眼尖的网友很快发现,Anthropic、OpenAI 和 Google 都没有签字。

几家公司的缺席,很容易被外界解读为 AI 阵营之间的又一次分野。而就在刚刚,Anthropic 也正式发布了新的闭源模型 Claude Opus 5,也让这种矛盾摆在明面上。

它没有讲太多宏大叙事,卖点相当务实:性能逼近 Fable 5,价格却只有后者的一半,颇有几分丐版的价格,享受准顶配服务的意思。

在 Frontier-Bench、GDPval-AA 等编程和知识工作评测中,Opus 5 已经登上榜首。少数没有拿下的项目集中在网络安全领域,目前仍落后于能力更强的 Mythos 5。

比起单纯谈论 Opus 5 的纸面参数,在官方宣传之外,它到底强在哪、以及「半价旗舰」有没有隐藏代价,才是我们更值得关注的部分。

Fable 5 的性能,Opus 4.8 的价格

Anthropic 此次重点强调了一个概念:effort,也就是思考档位。

用户可以自行调节。需要更强的推理能力,就把档位调高;更在意速度、价格和 token 消耗,就降低档位。官方公布的大部分成绩,都是在不同 effort 设置下测出来的。

软件工程是 Opus 5 表现最突出的领域。

在 Anthropic 内部的 Frontier-Bench v0.1 测试中,Opus 5 超过了所有参测模型。性能相比 Opus 4.8 提升一倍以上,完成单项任务的成本反而更低。

CursorBench 3.2 上,开启 max effort 后,Opus 5 与旗舰 Fable 5 的最高分只差 0.5%,成本却只有后者的一半。

在 high、xhigh 和 max 几个高档位中,同样的预算下,Opus 5 得分也超过了所有其他模型。大致可以理解为,花一半的钱,完成接近 99% 的工作。

知识工作和复杂解题上,Opus 5 延续了类似表现。

ARC-AGI 3 主要测试模型处理陌生问题的能力。面对训练中没有见过的新任务,Opus 5 的得分达到第二名的三倍。

Zapier AutomationBench 考察模型能否从头到尾完成一项商业任务。Opus 5 的任务通过率,大约是同等成本下第二名的 1.5 倍。即使只开启最低 effort 档位,它完成的任务数量也超过所有其他模型。

在 OSWorld 2.0 电脑操作测试中,Opus 5 用略高于三分之一的成本,就超过了 Fable 5 的最好成绩。

GDPval-AA v2、HLE 和 DeepSearchQA 等评测里,它也成了 Anthropic 模型中兼顾性能和成本的最佳选择。

科学研究能力同样有所提升。

在生命科学的每一项评测中,Opus 5 都超过了 Opus 4.8,覆盖结构生物学、有机化学、生物信息学等方向。

提升幅度最大的是有机化学。例如,根据光谱数据推断分子结构,Opus 5 比 Opus 4.8 高出 10.2 个百分点;预测蛋白质序列变异对功能的影响,高出 7.7 个百分点。

不过,官方跑分表里也出现了一个小插曲。

在最初发布的对比图中,FrontierCode v1.1 一栏将 Opus 5 的 53.4% 加粗标记为最高分,而旁边另一款模型的成绩明明是 53.5%。被网友抓包后,目前官网已经更换了图片,将标记恢复正常。

图像

类似场面并不陌生。OpenAI 此前也曾在图表制作上出错,纵轴比例与实际数据不一致,导致柱状图呈现出误导性的视觉效果。

图像

只能说,「世界是个巨大的草台班子」这句话的含金量还在继续上升。换个角度看,或许从制图者制图的那一刻开始,就已经带有先入为主的心态。

当 AI 模型开始主动验证自己

Anthropic 反复强调 Opus 5 的一种能力:遇到复杂任务时,它会主动验证自己的结果。一次没有成功,就重新检查、调整方案,再次尝试,直到任务完成。

官方测试给出了几个代表性案例。

面对机械零件图纸,Opus 5 在没有视觉工具的情况下,自行编写算法并完成 3D 重建;修复开源项目 bug 时,它找到了社区补丁遗漏的边界问题;搭建交易所行情接口时,它还自己生成模拟数据验证代码。

模型开放之后,社区也照例先玩了一圈。

沃顿商学院教授 Ethan Mollick 提前获得了使用权限。他的评价相对克制:短任务中,Opus 5 可以追平甚至超过 Fable 级模型;面对长时间、复杂度更高的任务时,它显得少了一点「雄心」,最终交付的完整度仍有差距。

尽管如此,他还是用 Opus 5 替换了此前长期使用的 Opus 4.8,因为新模型在整体能力上明显更强。

唯一让他不太满意的是,Opus 5 继承了 Fable 的部分语言习惯,比如对高密度表达的异常偏好,以及一股很明显的「Fable 味」。

比如他让 Opus 5 制作了一个哥特风格着色器,还生成了一款可以在山寨中土世界修建铁路的游戏。

还有网友 Chetaslua 用它制作了一套阿波罗登月模拟,全部内容由程序生成。

Harshith 留下一句「Opus 5 max 简直逆天」的评价,随后展示了一架带有帝国风格双离子引擎的星际战斗机。

再比如网友 Charlie Hills 转发的官方案例:用 Opus 5 搭建出了一套可以实际运行的风洞模拟系统,能够将空气流过物体表面的过程进行可视化。

更安全,也同样会回退到 Opus 4.8

技术能力之外,Anthropic 此次也花了大量篇幅讨论安全问题。

自动化行为审计结果显示,Opus 5 是 Anthropic 目前行为最符合预期的模型。

与 Opus 4.8、Sonnet 5 和 Fable 5 相比,它对 Claude 行为准则的遵循程度更高,欺骗行为更少,也更难被诱导执行危险操作。

面对可能造成不可逆后果的任务时,它也更倾向于先检查风险,再采取行动。

Opus 5 的整体失准行为得分为 2.3,是 Anthropic 近期模型中的最低值。在生物研究和攻击性网络安全任务中,它依然落后于能力更强的 Mythos 5。

网络安全部分尤其值得关注。

Anthropic 表示,与 Opus 4.8 一样,没有专门使用网络攻击任务训练 Opus 5。但随着模型综合能力提升,它发现漏洞的水平已经逐渐逼近 Mythos 5。发现漏洞与将漏洞转化为真实攻击工具,仍然存在明显差距。

简言之,Opus 5 已经能够判断一把锁存在什么问题,但距离真正撬开它还有很远。

Anthropic 使用 OSS-Fuzz 评测展示了这种差异。在漏洞发现任务中,Opus 5 与 Mythos 5 接近;到了编写漏洞利用代码的阶段,成绩便明显落后。

基于这一风险边界,Opus 5 会对网络安全请求进行额外审核。一旦请求涉及高风险攻击行为并触发安全限制,系统会将任务回退到 Opus 4.8 处理。

没错,又是 Opus 4.8。

今天起,Opus 5 已在所有平台同步上线。API 模型名称为 claude-opus-5。价格方面,每百万输入 token 为 5 美元,每百万输出 token 为 25 美元,与 Opus 4.8 完全相同。

🔗 https://platform.claude.com/docs/en/about-claude/pricing

需要更快响应速度的用户还可以开启 Fast 模式,推理速度约为默认模式的 2.5 倍,价格则提高至两倍。

在 Claude Platform 上,Fast 模式按照基础价格的两倍计费;在 Claude Code 中,则通过使用额度进行抵扣。计费规则与 Opus 4.8 时期保持一致。

伴随模型发布的,还有两个仍处于 beta 阶段的更新。

第一项更新面向 Claude Platform。开发者可以在对话进行过程中,动态修改 Claude 能够使用的工具,同时不会导致 prompt 缓存失效。

第二项更新是 API 自动回落机制。

开发者可以选择将被安全分类器拦截的请求,自动转交给其他模型处理。开启后,请求默认会交给当前可用的最强模型,数据保留方面,Opus 5 延续了以往 Opus 系列的规则,普通访问没有强制数据保留要求。

聪明反被「规矩」误

此次发布中,还有一个颇为反直觉的经验,来自 Anthropic 工程师 Thariq Shihipar。

团队发现,为 Claude 5 系列编写指令时,可以大幅减少系统提示词。Claude Code 的系统提示词被删除了 80% 以上,编程评测成绩却没有出现可测量的下降。

Thariq 随后总结了几条过去被广泛采用、如今可能已经过时的提示词规则。

🔗 https://x.com/trq212/status/2080710971228918066

过去强调给 Claude 制定详细规则,如今更倾向于让 Claude 根据上下文自行判断。例如,旧版系统提示词会明确规定「默认不要编写注释」。面对复杂代码时,这条规则很容易产生问题。

新版本只保留一句要求:生成的代码应当融入周围代码,注释密度、命名方式和整体风格都参考现有项目。

过去强调提供示例,如今更重视接口设计。

Anthropic 发现,示例有时会限制模型的探索范围。相比之下,将工具参数设计得更能准确表达意图,效果反而更好。

过去习惯一次性提供全部信息,如今更提倡按需加载,也就是 progressive disclosure。暂时用不到的代码审查和验证流程,会被放进独立 skill 中,需要时再调用。

过去倾向于反复强调关键要求,如今只要工具说明足够清楚,写一次通常已经足够,没有必要在系统提示词中重复。模型能力提高后,许多原本用于限制错误行为的繁复规则,逐渐变成了新的约束。

Anthropic 还为此推出了一个名为 claude doctor 的命令。用户在 Claude Code 中输入 /doctor,系统便会自动检查过度臃肿的 skill 和 CLAUDE.md 文件,并给出精简建议。

从事无巨细地教模型做事,到逐渐将判断权交给模型,或许才是 Opus 5 此次发布中最值得留意的变化。而当模型越来越聪明,人类写下的那些「经验」,反倒可能成为它首先需要摆脱的包袱。

附上参考地址:

https://www.anthropic.com/news/claude-opus-5

https://support.claude.com/en/articles/16049681-why-claude-switched-models-in-your-conversation-with-opus-5

https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models