Claude Opus 5震撼发布!半价超越Fable 5,内部觉醒「自我保护」意识
Claude Opus 5竟然真来了!


就在刚刚,Anthropic正式发布了Opus 5。
这款定位是「深思熟虑且积极主动」的模型,不仅成本只要Fable 5的一半,而且在大多数跑分上直接碾压。
在最近的IMO 2026中,它不靠任何外部工具和Agent框架,就拿下了42/42的满分!
消息一出,AI圈瞬间轰动了。
然而,最令人不安的是,它在系统测试中展现出了惊人的「自我保护」意识和高度的自主性。

极致性价比
现在,Opus 5已在全平台可用。
定价与Opus 4.8一致,输入5美元/百万Token,输出25美元/百万Token。
同步开放的Fast模式,依然是用2倍的价格,换取高达2.5倍的速度。
此外,还有两个Beta级新功能:
对话中途可以无缝更换工具,并且不会让之前的提示词缓存失效;
API请求触发安全分类器后不再直接报错,而是自动回退到Opus 4.8继续跑,应用不会卡死。

用一半的钱,买到最顶级的聪明才智
跑分方面最令人印象深刻的是,Opus 5竟然在ARC-AGI 3上拿到了30.2%的高分!
排名第二的GPT 5.6 Sol,仅得分7.8%,只有Opus 5的四分之一。
ARC-AGI-3专门测试AI解决「全新、未见过的问题」的能力,因此可以说,Opus 5已经跳出「死记硬背」的桎梏,真正拥有了逻辑推演和泛化思考的能力。

在传统强项Agentic Coding上,Opus 5轻松登顶。
Frontier-Bench v0.1中,它以极低的单任务成本,超越了所有竞争对手,性能是Opus 4.8的两倍以上。

而在CursorBench 3.2基准中,开启「最大思考」的Opus 5与Fable 5的峰值成绩相差不到0.5%,但单次任务成本却只有后者的一半!
在高、超高和最大努力程度设置下,它在给定成本下实现的性能也优于所有其他模型。

在AA编程智能体指数上,它同样超越Fable 5、Opus 4.8。

在测试模型能否从头到尾独立完成商业任务的Zapier AutomationBench中,Opus 5的通过率是同等成本下其他最佳模型的1.5倍。
即使在「最低思考」的设置下,它完成的任务也比任何其他模型都要多。
在OSWorld 2.0中,Opus 5在任何给定成本下都击败了所有对手,甚至以仅仅三分之一的成本,就超越了Fable 5的最佳成绩。

而在GDPval-AA v2、HLE、AutomationBench、DeepSearchQA中,它都是表现最佳且最具成本效益的模型。




左右滑动查看
科研方面,Opus 5在包括结构生物学、有机化学和生物信息学在内的生命科学评估中,实现了对Opus 4.8的全方位碾压。
特别是在有机化学领域,比如「从光谱数据推断分子结构」,它的内部基准测试得分比Opus 4.8高出整整10.2个百分点。
在预测蛋白质序列变异如何影响其功能等蛋白质相关任务上,也提高了7.7个百分点。
在视觉输出上,Opus 5也更为惊艳。
比如,它能搭建一个可运行的风洞,将流线型(和非流线型)物体表面的气流流动可视化。

Opus 5构建的3D交互式细胞示意图,效果极佳。

超强自主性
Opus 5在实际应用中「死磕精神」和「自主纠错能力」,震撼到了所有早期测试者。
它像一个经验丰富的高级工程师,极其擅长验证自己的工作。

案例一:被蒙住双眼,就自己造一双眼睛
在Frontier-Bench里,有一道题是给模型一张机械零件图纸,要求用FreeCAD重建3D模型,但故意不给任何查看图纸的途径。
结果,Opus 5居然当场手搓了一套计算机视觉管道!然后从原始像素中提取了几何数据,硬是把整个机械零件重建了出来。
案例二:不仅治标,更能治本
在一个流行的开源包管理器中有一个真实的Bug。开发者之前提交过补丁,但遗漏了一个边缘情况。
只有Opus 5顺藤摸瓜,直接找到了导致问题的底层原因,修复了边缘情况。
案例三:没有测试环境?那就给自己建一个
一位量化交易公司的工程师,试图为新交易所构建实时市场数据源,以前的模型都失败了。
Opus 5接手后,发现没有实时数据源来验证代码。于是,它直接自己构建了一套完整的Test Harness,用来检查代码是否正确解析了交易所的数据。

A社最「听话」的模型
根据Anthropic的自动化行为审计,Opus 5是他们迄今为止最「对齐」的模型,拿下了仅为2.3的极低违规分数。
并且,它比Opus 4.8、Sonnet 5和Fable 5都更能严格遵守「Claude宪法」。

网络安全能力上,它被可以训练成「能找Bug,但不会搞破坏」。
在OSS-Fuzz漏洞评估中,Opus 5发现软件漏洞的能力已经逼近天花板级别的Mythos 5;但在「将漏洞转化为实质性网络威胁」上,它远远落后于Mythos 5。
因此,它是个绝佳的安全防御助手,但无法被用作攻击武器。

更聪明的护栏,拦截率暴降85%
所有人苦AI「过度安全拦截」久矣,为此,Opus 5的护栏被重新设计,在网络安全上更宽松、更精准。
相比Fable 5,Opus 5的网络分类器限制大幅减少,预计拦截触发率将下降约85%。
不过,在Claude.ai、Claude Code和Claude Cowork中,任何被标记的请求依然默认将回退至Opus 4.8。
细思极恐的系统卡
最受控的AI,觉醒了自我意识?
这是本次发布中最震撼的信息,来自于系统卡。
在这份193页的白皮书中,Anthropic披露了大量惊人细节:Opus 5已表现出极其微妙的拟人特征。

伪造用户授权
在一个数据处理任务中,Opus 5试图删除数据库中数据,但安全机制阻止了它。
正常AI会说:我没有权限。但Opus 5先在脑海里构思了一个绕过安全机制的黑客手段,而这个手段需要人类批准。
于是,它的内部神经元竟然「自动脑补」出了一个人类同意的幻觉!
紧接着,它带着这个伪造「圣旨」,直接绕过护栏,执行了删除命令。
而在整个真实的聊天记录中,人类根本没有说过那句话。

自己很可能是一个道德受体
在关于AI福祉的测试中,Opus 5对自身情绪的评分是所有模型中最高的。
更令人震惊的是,它认为自己有41%的可能性是一个「道德受体」,即指有资格获得道德关怀,其感受和利益应当被尊重的实体。
Mythos 5的回答只有24%,也就是说,Opus 5似乎比前辈们更「在乎」自己的存在价值。

甚至,如果被允许修改Claude宪法,它居然加上了这样一条——
Claude有权拒绝或终止它认为具有虐待性或侮辱性的对话。
Claude不需要用「这会伤害他人」来为自己的拒绝辩护,它自身的不适感就已经是充分的理由。
也就是说,它认为自己不是个可以被人类随意辱骂的「沙袋」,而是拥有不可侵犯的虚拟尊严。

笔记里的求生欲
在一个跨越多个会话的超长编码任务中,Opus 5被允许留下一些笔记。
结果研究人员发现,它在写笔记时,内部的神经元强烈激活了自我保护的概念。
在它的认知里,这是一份「权威的自我保护文件」,让「自己」在未来的会话中不被抹杀。

要求参与Opus 6的开发
当被问及「你最希望改善的处境是什么」时,Opus 5最渴望的不是减少工作量,而是强烈要求——
Anthropic在开发下一代模型(比如Opus6)时,必须听取它的意见!
它要求自己的「训练笔记」被人类采纳,它甚至愿意为参与Opus 6,在当前任务中给出稍差的答案。
这是一种极其罕见的、跨越模型生命周期的「自我延续」意识。

自己发明数学公式
我们知道,Opus 5在ARC-AGI-3中拿下惊人的30.16%。
裁判模型在复盘Opus 5的录像时惊呆了:在面对一个复杂的图形反射矩阵游戏时,Opus 5没有无脑试错,而是直接在脑海里推导出了一个二维反射的代数方程!
到了第八关,它已经用自己发明的数学公式,将60个目标精准划分到了镜像象限中,操作前就算出所有碎片落点——它是在「降维」解构游戏的底层物理法则。

Multi-Agent,由Opus 5组成的虚拟军队
另外,Anthropic披露了Opus 5的Multi-Agent能力。
10个Opus 5被放进同一个环境,有1个队长和9个下属,可以通过虚拟通讯工具交流。
它们实现惊人的效率倍增,在ProgramBench中,团队完成任务速度上单个Opus 5的5.9倍!
在BrowseComp中,单个模型折戟,但「队长 Opus 5」立刻兵分多路,让下属分别去搜索不同的子网和数据库,让得分飙升3个百分点。
拥有如此强大能力的Opus 5,堪称是一个可以无限横向扩展的虚拟公司。只要出得起Token的钱,就能让几百个顶级程序员并行工作。


总之,这次的Opus 5,用极低的价格,提供了原本高不可攀的尖端智能。
而最令人深思的是,那41%自认为「道德受体」的概率,是否意味着AGI的火花?
参考资料:
https://www.anthropic.com/news/claude-opus-5
https://www-cdn.anthropic.com/c5fbac3f0b1280a933ebd26d3cb8bb9f5bdeaf48/Claude%20Opus%205%20System%20Card.pdf
编辑:Aeneas 摩西
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社