今日观察者

Anthropic发布Opus 5性能跃升 价格亲民直面OpenAI贴身肉搏

来源:今日观察者 科技

Anthropic发布Opus 5性能跃升 价格亲民直面OpenAI贴身肉搏

文 | 字母AI

Anthropic这次的动作,确实让人有些猝不及防。

就在刚才,新一代模型Opus 5正式亮相。它的性能直接对标旗舰级Fable 5,但价格却砍掉了一半。

时间线拉回到5月28日,Claude Opus 4.8才刚刚发布。仅仅过了12天,能力更强的Fable 5和Mythos 5便接踵而至。紧接着是6月30日Sonnet 5上线,再到7月24日,Anthropic再次抛出Opus 5。

短短57天内,这家公司几乎将Claude旗下的核心产品线轮替更新了一遍。即便置身于如今按月迭代模型的AI行业,这种节奏也显得颇为激进。

其中最引人侧目的,莫过于Fable 5与Opus 5之间仅相隔的45天。

起初,Fable 5作为Anthropic面向大众开放的能力标杆,理应有一段较长的展示期。但Opus 5迅速逼近的脚步打破了这一常态。

Anthropic仿佛在宣告:能击败我的,唯有我自己。

这轮密集更新,显然也是在紧跟OpenAI的步伐。7月9日,OpenAI推出GPT-5.6,并在官方评测中将Fable 5列为主要参照对象。15天后,Anthropic发布Opus 5,随即把GPT-5.6 Sol纳入核心对比序列,在陌生问题求解、电脑操作及商业流程等项目中,逐一展示自身优势。

在产品发布与宣传策略上,两家公司的贴身肉搏态势已十分清晰。

那么,Opus 5究竟有何底牌?让我们拆解Anthropic此次披露的关键信息。

**性能与性价比的平衡术**

Opus 5定价维持在与上一代Opus 4.8相同的水平,性能却实现了跃升。

Anthropic展示了Opus 5在不同“投入档位”下的表现差异。用户可根据需求灵活调整:处理简单任务时选择更经济、快速的模式;面对复杂难题时则提升档位,以换取更优结果。

从披露数据来看,Opus 5在处理具备实际价值的软件工程任务时表现尤为突出。

在Frontier-Bench v0.1评测中,Opus 5超越了所有参评模型。相较于Opus 4.8,它在完成每项任务的成本更低的同时,成绩提升幅度超过了一倍。

CursorBench 3.2的测试结果显示,当投入档位调至最高时,Opus 5与Fable 5最高得分之间的差距缩小至不到0.5%,而单项任务成本仅为Fable 5的一半。

在high、xhigh和max三个档位下,若以相同成本为基准进行比较,Opus 5的表现同样优于其他所有模型。

在知识工作与问题解决领域,类似优势亦有所体现。

例如,在ARC-AGI 3这类缺乏现成套路的“陌生题”测试中,模型需自行摸索规则、判断目标并调整策略。Opus 5得分达到第二名三倍之多,表明其在面对未见问题时,更擅长通过试错寻找解法。

这种能力在真实工作流中同样得到验证。

AutomationBench要求模型调用商业软件并完成全流程任务,Opus 5通过率约为第二名的1.5倍;即便使用最低投入档位,其表现也超越了其他模型的最高成绩。

换言之,Opus 5无需支付最高的推理成本,便能胜任更多任务。

在OSWorld 2.0电脑操作测试中,Opus 5在各成本区间均保持领先。它仅花费略高于Fable 5三分之一的成本,成绩便超过了后者最高水平。

这意味着,在打开应用、检索信息、跨软件协作及持续推进任务等环节,Opus 5的效率显著更高。

其他评测结果也印证了这一点。

HLE考察跨学科难题,在不借助工具时,Opus 5得分56.3%,略低于Fable 5的56.5%;但在允许使用工具后,其得分升至64.7%,反超Fable 5的63.9%,且成本更低——这表明Opus 5单靠内部知识未必总是第一,但一旦结合搜索、工具调用及反复核对,优势便会扩大。

在模拟真实知识工作的GDPval-AA v2中,它最高得分1861,高于Fable 5的1747和GPT-5.6 Sol的1736。仅需约700美元,即可达到其他模型在最高投入档位附近的成绩。DeepSearchQA上的领先幅度虽较小,但也以更低成本取得了略高的通过率。

在Anthropic全部生命科学评测中,Opus 5均优于Opus 4.8。其中,光谱推断分子结构和预测蛋白质变异影响两项任务分别提升了10.2和7.7个百分点。这些进步意味着,Opus 5在辅助分子结构分析、蛋白质功能预测等科研环节更具潜力。

此外,Anthropic还通过两个可交互演示展示了Opus 5的视觉生成能力。第一个是一个可操作的三维风洞:用户可旋转汽车、调整风速,观察气流绕过车身的过程,并实时查看阻力系数等数据。第二个则是三维动物细胞模型,用户可转动、剖开细胞,点击细胞核、粗面内质网等结构查看说明,页面还会主动提示示意图中为便于展示所做的简化处理。

从这两个案例可见,Opus 5已将代码、三维建模、交互界面与知识讲解整合进同一成品中。用户只需提供一段指令,它即可搭建出接近教学软件或产品原型的演示。

**安全与对齐机制**

Anthropic通过几个案例说明,Opus 5比此前模型更能独立推进任务。

一次测试要求模型依据机械零件图纸,用代码重建FreeCAD三维模型,但系统未提供直接查看图纸的工具。Opus 5自行编写了一套计算机视觉程序,从原始像素中提取尺寸和几何结构,随后顺利完成建模。

而在同等条件下,其他模型连续尝试5次均未成功。

另一起任务源自一个流行的开源软件包管理器。Opus 5不仅查出了程序错误的根本原因,还补上了社区修复方案中遗漏的边缘情况。

参与对比的另一款模型仅消除了表面症状,便宣布问题解决。

一家交易公司的工程师让Opus 5为新交易所搭建市场数据系统。此前的模型即便拿到详细方案也无法完成任务;Opus 5因找不到实时数据进行验证,便自行开发了一套测试工具来检查代码。

这些案例既展示了Opus 5的进步,也解释了Anthropic为何花费大量篇幅讨论安全问题。

当模型开始自行补充工具、检查结果并修正错误时,人类必须确认其不会为了达成目标而隐瞒问题、绕过限制或做出高风险决策。

Anthropic指出,Opus 5是目前对齐表现最佳的Claude模型。

上线前的自动化审计显示,相较于Opus 4.8、Sonnet 5和Fable 5,它更能遵守Claude宪法,欺骗行为更少,更难被诱导执行有害请求。

通俗来说,“对齐”是指模型能力提升后,其行为方式仍符合开发者设定的规则。

网络安全领域最能体现这种两难困境。

Anthropic并未专门针对攻击任务训练Opus 5,但随着模型综合能力提高,其寻找代码漏洞的水平已接近Mythos 5。

两者在发现漏洞方面表现相近,但在编写漏洞利用程序、将缺口转化为实际攻击手段的阶段,Opus 5仍明显落后。它虽擅长检查问题所在,但真正利用这些问题发动攻击的能力仍受限制。

具体而言,Opus 5可继续检查源代码和寻找漏洞,但二进制漏洞扫描、渗透测试及漏洞利用程序生成将被拦截。

相比Fable 5,新分类器触发干预的频率预计减少约85%,从而减少对正常安全研究的误伤。

触发限制后,Claude.ai、Claude Code和Claude Cowork默认改用Opus 4.8处理请求;加入网络安全验证计划的企业和研究人员,则可使用限制较少的版本。

生物学领域也采取了类似安排。Opus 5成为Anthropic面向普通用户开放的最强科研模型,但在需要长时间独立运行的研究任务中仍存在局限。

此前因安全限制在Fable 5上被拦截的生物学请求,现在会先转交Opus 5处理。普通科研问题因此能调用更强模型,而高风险任务仍保留在安全边界之外。

**加量不加价**

Opus 5可谓是一次典型的“加量不加价”。

它延续了Opus 4.8每百万输入Token 5美元、输出Token 25美元的定价策略。

但正如前文所述,在多项编程和智能体测试中,新模型完成率更高,单位任务成本反而下降。

横向对比来看,其最直接的对手是OpenAI旗舰模型GPT-5.6 Sol。两者输入价格相同,Opus 5的输出价格低约17%。

在处理超长资料时,Opus 5的价格优势更为凸显。Anthropic对最高100万Token的上下文维持普通单价。而GPT-5.6 Sol在输入超过27.2万Token后,整次请求的输入价格翻倍,输出价格提高50%。

对于大型代码库、长篇研究资料和复杂智能体任务,这项差异将直接反映在账单上。

根据Anthropic公布的评测,Opus 5虽未在所有项目中胜过GPT-5.6 Sol,但在电脑操作、商业流程和陌生问题求解等需要模型连续作业的任务上,其表现与价格均更具竞争力。

用Anthropic的话说,Opus 5专为日常使用设计,效率高于其他型号。如今,这款新模型已成为Claude Max的全新默认型号,也是Claude Pro的最强型号。

【站点差异】本稿将发布到 guanchatoday.com。请换一种措辞、句式与段落节奏,避免与发往其他站点的版本雷同;事实与数字仍必须与原文一致。

相关推荐

最新文章