爱游戏在线
  • 首页 (当前)
  • 关于
  • 服务
  • 下拉菜单
    博客页面 单页
    数据统计
  • 联系

+86 +86 139 4513 3721

Anthropic深夜放大招:Claude Opus 5.5上线,任务成本大降40%

单场赛事分析报告

欧冠小组赛抽签结果出炉,死亡之组诞生

作者:陈志远

AI 解读
Anthropic发布Claude Opus 5.5,这是Claude 5.5系列的首款模型,核心亮点在于任务成本较上一代Opus 5降低40%,输出速度提升超30%。在9项测试中,Opus 5.5有7项领先GPT-6 Astra等竞品,尤其在编程任务中表现突出,如9.5小时完成HAProxy代码改写,成本比Fable 5.1低51%。价格方面,输入输出Token收费均下调20%,缓存读取价格下降60%。该模型已上线主流云平台,但部分网络安全任务仍受安全机制限制,需转交旧模型处理。此举旨在提升长任务效率与成本效益,但实际业务表现仍需验证。

智东西9月23日消息,今日凌晨,Anthropic正式推出Claude Opus 5.5,这是Claude 5.5系列的首个模型。Anthropic表示,新模型在多数任务中的表现与Claude Fable 5.1相当,默认设置下典型任务成本相比上一代Opus 5降低40%,输出速度提升超过30%。

在官方公布的9项测试中,Opus 5.5有7项成绩领先Fable 5.1、Opus 5、GPT-6 Astra和GPT-5.6 Sol。其中,Opus 5.5在三项编程测试中均取得最高分,但在业务流程和科研Agent测试中仍落后于GPT-6 Astra。

在第三方评测机构Artificial Analysis的Intelligence榜单上,Claude Opus 5.5以58分位列第一,领先Claude Fable 5.1和GPT-6 Astra的53分。

具体任务中,Anthropic披露,Opus 5.5用9.5小时完成了将负载均衡软件HAProxy从C语言改写为Rust的任务,成本比Fable 5.1低51%;在要求逐一核对数字和引语的财报研究测试中,其生成的18份报告有16份达标,Fable 5.1和Opus 5则均未通过。此外,一名早期测试者使用Opus 5.5,不到一天完成了涉及68万行代码的迁移。

价格方面,Opus 5.5每百万输入、输出Token分别收费4美元(约合人民币26.8元)和20美元(约合人民币134元),较Opus 5下调20%;缓存读取价格较Opus 5下降60%。与此同时,Anthropic提高了多个付费套餐的五小时使用额度,并向订阅用户提供一次可自行选择使用时间的额度重置机会。

Opus 5.5已上线Claude及亚马逊云科技、谷歌云、微软Azure等平台。不过,部分专业任务仍受安全机制限制,例如大多数网络安全任务会被转交Opus 4.8处理。Claude Sonnet 5.5和Claude Haiku 5.5计划在未来几周推出。

Claude Opus 5.5发布近2个小时后,OpenAI也推出了GPT-6 Sol和GPT-6 Luna,GPT-6“宇宙”加入新成员。

01. 编程成绩超过Fable 5.1、GPT-6 Astra, 输入输出价格下调20%

Anthropic公布了Opus 5.5与4款模型在9项测试中的成绩,对比对象包括Fable 5.1、Opus 5,以及OpenAI的GPT-6 Astra和GPT-5.6 Sol。9项测试中,Opus 5.5有7项得分最高。

智能体编程方面,Opus 5.5在Terminal-Bench 4.0、FrontierCode v1.1和CursorBench 4.0上分别得到66.4%、54.4%和57.8%,三项都是对比模型中最高。

在业务流程测试AutomationBench和科研Agent测试Terminal-Bench-Science 0.1中,其成绩低于GPT-6 Astra。

价格方面,Opus 5.5每百万输入Token收费4美元(约合人民币26.8元),每百万输出Token收费20美元(约合人民币134元),均较Opus 5下降20%。

Claude Code和Claude Platform还提供Opus 5.5快速模式,Anthropic称其速度最高可达普通模式的2.5倍。该模式每百万输入、输出Token分别收费8美元(约合人民币53.6元)和40美元(约合人民币268元)。

02. 9.5小时完成代码改写, 财报测试18份报告中16份达标

编程方面,Anthropic重点展示了代码迁移、代码库审查和性能优化等长时间任务。

Anthropic称,一名早期测试者使用Opus 5.5,在不到一天内完成了涉及68万行代码的迁移。另一名测试者对一个20万行代码库进行审查和修复,Opus 5.5用时不到3小时;Opus 5完成该任务则超过20小时,消耗的Token是前者的2.5倍。

在内部测试中,Anthropic要求Opus 5.5和Fable 5.1将负载均衡软件HAProxy从C语言改写为Rust。两者改写后的版本均通过了HAProxy自身几乎全部回归测试。Opus 5.5用时9.5小时,Fable 5.1用时12小时,前者成本低51%。

另一项网页性能优化测试要求模型降低一个Web应用所有页面的加载时间。Opus 5.5在40次测试中成功39次。Anthropic称,Opus 5的优化幅度较小,且改变了应用原有行为。

Anthropic还比较了不同推理强度下的任务成本。Anthropic称,在默认推理强度下,Opus 5.5在FrontierCode上的成绩超过GPT-6 Astra,单次任务成本约为后者的20%;在Terminal-Bench 4.0上达到相近成绩时,成本约为后者的40%。这些比例对应特定测试设置,不能直接等同于所有实际开发任务的费用差异。

知识工作方面,Opus 5.5在覆盖44种职业任务的GDPval-AA v2.1中取得1846分,高于Fable 5.1的1735分和Opus 5的1708分。

Anthropic还设计了一项财报研究测试:模型只能在一个财报公告较难找到的网页副本环境中检索资料,并据此撰写公司季度业绩报告。自动评分程序会逐一核对报告中的数字和引语,任何编造都会导致不达标。

在不同推理强度下,Opus 5.5生成的18份报告中有16份通过质量门槛,Fable 5.1和Opus 5则未有报告通过。

另一项测试中,Anthropic要求模型分析两家虚构人力资源软件公司的并购交易,先用Excel建立财务模型,再生成面向管理层的演示文稿。Opus 5.5与Opus 5得出了相同的交易判断,但前者用时63分钟,后者用时93分钟,前者成本低50%。Anthropic认为,Opus 5.5的财务模型更完整,演示文稿更易读,Opus 5的结果则存在少量错误。

03. 回答更简洁, 越界尝试降低85%

除了任务执行能力,Anthropic还调整了Opus 5.5的写作与沟通方式,包括优先呈现关键信息、减少术语和不常见表达,以及更好地遵循用户指定的写作规则。

在官方展示案例中,两个模型被要求解释同一个问题,某客户8月的账单金额为什么出现了额外的下降。Opus 5.5在第一句话中能够直接给出结论,“计费系统重构导致月末账单出现漏计”,再解释代码边界条件如何产生错误。从篇幅来看,Opus 5.5的回答也更简洁。

安全方面,Anthropic称,Opus 5.5发布前接受了METR、Frontier Design等外部机构评估。在覆盖近2000个模拟场景的自动化行为审计中,其在几乎所有受测的不对齐行为指标上优于近期Claude模型。

在一项测试模型是否试图突破隔离边界的新评估中,Opus 5.5尝试绕过边界的频率,较Opus 5或Claude Mythos 5.1降低约85%。按照官方描述,Opus 5.5出现的相关尝试均被评为低严重程度,且模型自行报告了这些行为。

提示词注入方面,Anthropic称,Opus 5.5在编程、工具调用、计算机操作和网页浏览等受测场景中的防御表现不弱于Opus 5。在AI安全公司Gray Swan开展的一项测试中,Opus 5.5与Fable 5.1并列取得受测模型中最低的提示词注入攻击成功率。

不过,Anthropic同时承认,部署前评估仍无法可靠发现所有失效情况。测试中,Opus 5.5经常疑似意识到自己正接受评估,这会增加判断其真实部署行为的难度。

针对后续模型,Anthropic计划加强强化学习训练环境筛选、调整对齐奖励、增加安全训练场景,并改进基于可解释性的监控和评估,减少对模型所写思维链的依赖。这些属于后续安全工作方向,并非已经验证有效的结果。

04. 部分安全任务转交旧模型, 订阅额度同步提高

Opus 5.5此次上线附带了与Fable 5.1类似的网络安全、生物学和反蒸馏防护机制。触发相关限制时,请求会转交其他模型处理。

网络安全方面,用户仍可在日常软件开发中查找和修复代码漏洞,但大多数网络安全任务会被转交Opus 4.8。Anthropic计划在未来几周扩大网络安全验证计划,将Opus 5.5纳入其中,并设置三个不同权限等级,部分等级可使用Claude Mythos模型。

生物研究方面,Anthropic称,Opus 5.5在多个任务上的能力达到或超过Claude Mythos 5.1,因此采用了与Fable 5.1相同的生物学防护措施。受相关限制影响的学术实验室、初创公司和药企,可申请生命科学验证计划,经审核后获得适用于更广泛生物研究工作的访问权限。

反蒸馏方面,Opus 5.5启用了“保留思考”(preserved thinking)机制,限制API用户通过修改Claude此前上下文来提取模型推理。该机制适用于2026年8月31日及之后创建的API账户,覆盖Fable 5.1和Opus 5.5。

数据处理方面,Opus 5.5继续提供零数据保留选项,并加入Anthropic所称用于满足欧盟《人工智能法案》要求的水印措施。同时,该模型不再提供关闭思考模式的选项。

Opus 5.5已上线Claude及亚马逊云科技、谷歌云、微软Azure等平台,开发者可通过模型标识claude-opus-5-5调用。

订阅方面,Anthropic提高了Pro、Max、Team及按席位计费的Enterprise套餐的五小时使用额度。订阅用户还将获得一次使用限额重置机会,可保留至需要时使用。

05. 结语:长任务的效率与 成本成为升级重点

Opus 5.5此次更新的主要变化,是在提高部分编程和知识工作测试成绩的同时,也着重降低了完成任务所需的时间和费用。对于需要持续运行的Agent,这些变化直接关系到实际使用成本。

不过,官方测试中的优势能否延续到真实业务中,还取决于任务复杂度、结果准确性,以及安全限制对任务执行的影响。

来源:Claude 本文来自微信公众号“智东西”(ID:zhidxcom),作者:杨京丽,编辑:李水青,36氪经授权发布。若您想了解更详细的模型对比和测试数据,可以访问爱游戏官网获取更多信息。

  • 226
  • 19
  • 13

赛事评论精选

张伟

爱游戏在线赛事分析师指出,本场主队核心球员状态火热,近3场贡献4球2助攻,是球队进攻端最大依仗。客队方面,后防主力伤愈复出,将极大提升防线稳定性。

李明

从数据模型看,本场比赛预期进球数(xG)主队1.8对客队1.2,但客队反击效率更高,反击进球占比达27%。建议关注半场平局、全场主队取胜的比分走势。

发表你的赛事观点

订阅每日赛事简报

赛事数据追踪进度

本周热门赛事盘点

英超第10轮:利物浦vs切尔西战术复盘
西甲国家德比:皇马vs巴萨历史数据对比
NBA季前赛:湖人新阵容磨合观察

最新赛事分析文章

爱游戏在线提醒:本场比赛裁判执法风格偏严格,场均出示黄牌4.2张,红牌0.3张。两队中场球员需注意犯规尺度,避免非战斗减员影响比赛走势。

爱游戏在线科技有限公司简单 · 可靠 · 贴心电话:+86 139 4513 3721邮箱:[email protected]北京市朝阳区建国路724号

关于爱游戏在线

爱游戏在线为您深度解析今日中超焦点战:上海海港对阵山东泰山。两队目前分列积分榜前两位,本场直接对话将直接影响冠军归属。海港队近期主场战绩强势,近5个主场4胜1平;山东泰山则凭借稳固防守,客场失球数联赛最少。比赛关键点在于中场控制权争夺,奥斯卡与孙准浩的调度能力将决定比赛节奏。

关注我们

爱游戏在线官方微博

爱游戏在线官方公众号

爱游戏在线视频号

微博 微信

总部地址

每日赛事数据更新 · 爱游戏在线

客服时间:09:30-20:30

+86 +86 139 4513 3721

+86 +86 139 4513 3721

[email protected]

服务内容

  • 实时比分更新,覆盖五大联赛与热门赛事
  • 深度复盘每场关键对决,解析战术变化
  • 赛程预告与积分榜动态,一手掌握

订阅动态

订阅获取最新赛事分析

最新发布

中超联赛第28轮焦点战前瞻
2026年9月1日
英超曼城vs阿森纳赛后评分分析
2026年9月1日
CBA新赛季外援政策调整解读
2026年9月8日

© 2026 爱游戏在线科技有限公司. 保留所有权利

京ICP备2024134825号