据 Artificial Analysis 最新评测,Anthropic 的 Claude Opus 5.5 以 58 分登上 Artificial Analysis Intelligence Index 榜首,成为该平台目前测得的最高分。更值得注意的是,这次登顶并非只靠单项能力冲高:在十项核心评估中,Opus 5.5 赢下六项,同时配合五个 effort 档位与缓存折扣,把“高智能”与“单位预算效率”一起摆上了选型桌面。
58 分登顶,优势集中在代码与复杂推理
Artificial Analysis Intelligence Index 是十个核心评估维度加权后的综合指数,并非单一榜单成绩。Opus 5.5 的综合得分为 58 分,第二集团的 Claude Fable 5.1 与 GPT-6 Astra 并列 53 分,差距约 5 个百分点。
从拆解数据看,Opus 5.5 在十项核心评测中领先六项,包括:
- Humanity’s Last Exam:61.4%
- SciCode:66.9%
- AA-Briefcase 知识工作评估:Elo 1822
不过,它与 GPT-6 Astra 的差距并非在所有项目上都拉开。在 Terminal-Bench 4.0 上,两者同为 59.6%,说明在多步终端操作、日志分析、脚本编写与调试等端到端 Agent 任务上,双方已经处于同一梯队。AutomationBench-AA 也出现打平情况。
真正拉开差距的,是 SciCode 与 Humanity’s Last Exam 这类更依赖代码理解和复杂推理的测试。换句话说,如果只看终端自动化,结论可能是“差不多”;如果只看代码与复杂推理,又容易高估整体差距。58 分对 53 分,更接近当前综合能力的相对排序,而不是绝对能力断层。
effort 五档拉开的不只是性能,还有成本曲线
这次发布里,比“第一名”更值得工程师注意的是 effort 档位。Opus 5.5 提供 low、medium、high、xhigh、max 五个档位,其中 max 带 fallback。Artificial Analysis 实测显示:
- max:58 分
- xhigh:56 分
- high:54 分
- medium:51 分
- low:48 分
从 medium 到 max,综合得分提升 7 分,但推理 token 数与延迟也会同步上升。对高容错、单次调用的复杂决策任务,max 更有价值;对高频、相对简单的查询,medium 更稳。素材还提到,四个档位落在智能与成本的 Pareto 前沿上,这意味着 Anthropic 并非单纯堆高最高档分数,而是在有意拉开成本曲线,让中低档位具备更好的性价比。
另一个工程细节是 fallback 机制。当 max effort 任务超时或失败时,模型可自动降级到 medium effort 继续执行,而不是直接报错。这对 Agent 工作负载有现实意义:系统可以先用高档位处理复杂任务,再用中档位保证交付率。不过,这也要求监控体系区分正常响应与 fallback 响应,否则成本统计可能失真。
与 GPT-6 Astra 对照:不是全面碾压,而是结构性领先
如果以 GPT-6 Astra 作基准对照,Opus 5.5 的优势是结构性的。Terminal-Bench 4.0 和 AutomationBench-AA 打平,说明在纯终端交互和自动化工作流上,差距已收窄到测量误差范围;而在代码理解、复杂推理等维度,Opus 5.5 的优势更明显。
价格端也给出了新的变量。素材称,Opus 5.5 基础定价降至 4 / 4 / 4 / 20 per 1M tokens(input / output),缓存读取折扣从 50% 提升到 60%。Anthropic 自家 FrontierCode 数据还提到,默认 medium effort 以约 1/5 的任务成本跑出 54.6%,高于 GPT-6 Astra 公开上限 53.3%。需要说明的是,FrontierCode 来自 Anthropic 自家数据,独立验证尚未完整披露;缓存收益也取决于 prompt 重复度。
因此,这次登顶对行业的意义不只是“新模型更强”,而是把前沿模型的竞争推进到更细的层面:综合智能、推理成本、缓存命中、档位策略和失败回退,正在共同决定一个模型在生产环境中的真实效率。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/claude-opus-5-5-na-xia-artificial-analysis-zhi-neng-zhi-shu