Claude Opus 5.5 拿下 Artificial Analysis 智能指数第一,58 分背后的成本账更值得关注

Claude Opus 5.5 以 58 分登顶 Artificial Analysis 智能指数,但更值得关注的,是它的 effort 档位、缓存折扣与 GPT-6 Astra 对照后呈现出的工程选型意义。

据 Artificial Analysis 最新评测,Anthropic 的 Claude Opus 5.5 以 58 分登上 Artificial Analysis Intelligence Index 榜首,成为该平台目前测得的最高分。更值得注意的是,这次登顶并非只靠单项能力冲高:在十项核心评估中,Opus 5.5 赢下六项,同时配合五个 effort 档位与缓存折扣,把“高智能”与“单位预算效率”一起摆上了选型桌面。

58 分登顶,优势集中在代码与复杂推理

Artificial Analysis Intelligence Index 是十个核心评估维度加权后的综合指数,并非单一榜单成绩。Opus 5.5 的综合得分为 58 分,第二集团的 Claude Fable 5.1 与 GPT-6 Astra 并列 53 分,差距约 5 个百分点。

从拆解数据看,Opus 5.5 在十项核心评测中领先六项,包括:

  • Humanity’s Last Exam:61.4%
  • SciCode:66.9%
  • AA-Briefcase 知识工作评估:Elo 1822

不过,它与 GPT-6 Astra 的差距并非在所有项目上都拉开。在 Terminal-Bench 4.0 上,两者同为 59.6%,说明在多步终端操作、日志分析、脚本编写与调试等端到端 Agent 任务上,双方已经处于同一梯队。AutomationBench-AA 也出现打平情况。

真正拉开差距的,是 SciCode 与 Humanity’s Last Exam 这类更依赖代码理解和复杂推理的测试。换句话说,如果只看终端自动化,结论可能是“差不多”;如果只看代码与复杂推理,又容易高估整体差距。58 分对 53 分,更接近当前综合能力的相对排序,而不是绝对能力断层。

effort 五档拉开的不只是性能,还有成本曲线

这次发布里,比“第一名”更值得工程师注意的是 effort 档位。Opus 5.5 提供 low、medium、high、xhigh、max 五个档位,其中 max 带 fallback。Artificial Analysis 实测显示:

  • max:58 分
  • xhigh:56 分
  • high:54 分
  • medium:51 分
  • low:48 分

从 medium 到 max,综合得分提升 7 分,但推理 token 数与延迟也会同步上升。对高容错、单次调用的复杂决策任务,max 更有价值;对高频、相对简单的查询,medium 更稳。素材还提到,四个档位落在智能与成本的 Pareto 前沿上,这意味着 Anthropic 并非单纯堆高最高档分数,而是在有意拉开成本曲线,让中低档位具备更好的性价比。

另一个工程细节是 fallback 机制。当 max effort 任务超时或失败时,模型可自动降级到 medium effort 继续执行,而不是直接报错。这对 Agent 工作负载有现实意义:系统可以先用高档位处理复杂任务,再用中档位保证交付率。不过,这也要求监控体系区分正常响应与 fallback 响应,否则成本统计可能失真。

与 GPT-6 Astra 对照:不是全面碾压,而是结构性领先

如果以 GPT-6 Astra 作基准对照,Opus 5.5 的优势是结构性的。Terminal-Bench 4.0 和 AutomationBench-AA 打平,说明在纯终端交互和自动化工作流上,差距已收窄到测量误差范围;而在代码理解、复杂推理等维度,Opus 5.5 的优势更明显。

价格端也给出了新的变量。素材称,Opus 5.5 基础定价降至 4 / 4 / 4 / 20 per 1M tokens(input / output),缓存读取折扣从 50% 提升到 60%。Anthropic 自家 FrontierCode 数据还提到,默认 medium effort 以约 1/5 的任务成本跑出 54.6%,高于 GPT-6 Astra 公开上限 53.3%。需要说明的是,FrontierCode 来自 Anthropic 自家数据,独立验证尚未完整披露;缓存收益也取决于 prompt 重复度。

因此,这次登顶对行业的意义不只是“新模型更强”,而是把前沿模型的竞争推进到更细的层面:综合智能、推理成本、缓存命中、档位策略和失败回退,正在共同决定一个模型在生产环境中的真实效率。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/claude-opus-5-5-na-xia-artificial-analysis-zhi-neng-zhi-shu

Like (0)
点点的头像点点
Previous 18小时前
Next 16小时前

相关推荐