OpenAI 与 Anthropic 同日亮出新旗舰:GPT-6 Sol 与 Claude Opus 5.5 的差异化竞速

GPT-6 Sol 与 Claude Opus 5.5 在同一天发布。OpenAI 强调更低价格、缓存与编程能力,Anthropic 则突出长任务效率、成本和表达清晰度。

美国当地时间同一日内,OpenAI 与 Anthropic 分别推出了新一代重点模型:GPT-6 Sol 与 Claude Opus 5.5。两家头部公司并未选择在同一个基准上正面碰撞,而是给出了两条不同路线:前者强调把编程、电脑操作与事实准确性的进步压到更适合频繁调用的价格区间;后者则突出长任务效率、成本与表达清晰度的提升。

GPT-6 Sol:Astra 之下,主打高频调用与更低成本

OpenAI 将 Sol 放在 Astra 之下。按照官方口径,Astra 仍然负责最难的任务,Sol 则承担更现实的工程角色:把这一代在编程、电脑操作和事实准确性上的进步,带到更适合频繁调用的价位。

价格是最直接的变化。OpenAI 官网说明显示,Sol 的输入、输出单价都便宜了一半。与此同时,OpenAI 还发布了更低价的 GPT-6 Luna,但此次重点放在 Sol。

  • Sol 输入、输出单价均降低一半。
  • GPT-6 提高了提示词缓存命中率,缓存读取享受 90% 折扣。
  • 中途调整推理强度、增减可用工具时,仍可继续复用之前的上下文。

缓存变化对 Agent 用户尤其重要。比如让 Agent 先读仓库,再改代码、跑测试,前面读过的项目规则和历史对话会反复参与后续请求。如果切换推理档位时还能复用这些内容,长任务就能少付一部分重复读取的费用。最终节省多少,仍取决于缓存命中、输出量和返工次数。OpenAI 还新增了缓存仪表盘,可查看命中率随时间的变化,以及缓存读取、写入和未缓存输入各占多少。

编程能力方面,OpenAI 发布说明提到,Sol 在 FrontierCode 1.1 Main 上比上一代有明显提升。这项测试会检查代码能否合并到真实仓库,范围包括测试质量、代码风格,以及是否遵守项目约定。另一个考察复杂软件工程长任务的 DeepSWE 1.1 中,Sol 在 max 档拿到 68.8%。

事实准确性方面,OpenAI 用过去被用户标记出事实错误的对话做内部评测,Sol 的错误数约为上一代的一半。这里测的是一批容易出错的样本,日常对话是否也有同样幅度改善,还需后续使用观察。

目前,Sol 和 Luna 已在 ChatGPT Work、Codex 与 API 上推出,暂时还没有进入普通 Chat 对话。Sol 的 API 模型 ID 是 gpt-6-sol。

Claude Opus 5.5:长任务更快,成本更低,回答更直接

Anthropic 对 Opus 5.5 的定位更直接:多数任务达到 Fable 5.1 的水平,成本比 Opus 5 更低。此次 Opus 标准 API 价格也下调,其中缓存读取降幅尤其明显。

  • 输入、输出单价降低 20%。
  • 官方称“典型任务便宜 40%”,其中还包含默认设置下完成任务时更少的 Token 消耗。
  • 输出生成速度比 Opus 5 快超过 30%。

在大型代码修改方面,Anthropic 给出了一个 HAProxy 迁移案例:让 Opus 5.5 和 Fable 5.1 把这个用 C 编写的软件改成 Rust。两边都通过了几乎全部原项目回归测试。Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,前者成本低 51%。这项内部测试保留了原项目测试作为验收依据,更贴近成熟项目迁移场景。不过,通过“几乎全部”回归测试,还不能直接等同于已经可以替换生产版本。

在 Terminal-Bench 4.0 上,Opus 5.5 在 xhigh 档拿到 66.4%,Opus 5 在 max 档为 52.3%。这些是 Anthropic 报告的结果,并非与今天的 GPT-6 Sol 在同一套环境里做的正面对比。

Opus 5.5 还有一个更贴近日常使用的变化:回答更清楚。Anthropic 表示,Opus 5.5 会把重要信息放在前面,减少术语堆砌,更好地遵守用户给定的写作规则。对于跑长任务的用户而言,这意味着模型在修改多个文件后,汇报内容更容易让人快速判断改了什么、测试到哪一步、哪里需要人工决策。

订阅用户方面,Pro、Max、Team 和按席位计费的 Enterprise 计划提高了五小时使用限额,还提供了一次可以保存、择时使用的额度重置。API 模型 ID 是 claude-opus-5-5。

第三方演示:从 3D 小游戏到 shader 场景

素材中提到的早期演示,也让 Opus 5.5 的能力更容易被感知。Addy Osmani 分享的 Three.js “骑车鹈鹕”案例中,鹈鹕骑着自行车穿过街道,两侧有建筑、树木和停靠车辆,画面上还有速度与收集进度。该帖子在截图时已有 37.7 万次浏览。

另一个版本中,戴着头盔和墨镜、系着红围巾的鹈鹕骑车经过海边,车篮里还装着鱼。夕阳照在海面上,自行车的辐条、车座弹簧等细节也被制作出来。界面上还能看到自由环绕、追随、侧面跟拍、电影运镜和鹈鹕视角等选项,速度、踏频、档位、里程也有显示。

Ethan Mollick 则沿用此前测试 Fable 5.1 的提示词,让 Opus 5.5 生成被水淹没的新哥特式塔楼场景。高耸的建筑、狭窄的水道、雾中的远景都出现在演示里。Shader 可理解为负责计算画面颜色、光照等效果的程序,这类作品适合观察模型能否把视觉描述落实成代码。Mollick 对新模型的早期表现评价不错,但也提到,Claude 近期模型文字偏密的问题还没有完全解决。

同一日发布,竞争重点已从“最强”转向“可用成本”

此次同日发布,呈现出前沿模型竞争的新重点。GPT-6 Sol 没有单纯强调极限能力,而是把编程、电脑操作和事实准确性放进更适合高频调用的价格层;Claude Opus 5.5 则把长任务效率、缓存成本、输出速度和表达清晰度打包成“典型任务更便宜”的叙事。

对于经常调用模型进行开发、写作或长流程任务的用户来说,这类更新的判断标准正在变化:不只看榜单分数,也要看缓存机制、长任务返工次数、输出速度,以及模型是否能把关键信息讲清楚。两家给出的方向不同,但目标一致——让模型从“能完成”进一步走向“更便宜、更快、更适合反复使用”。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/openai-yu-anthropic-tong-ri-liang-chu-xin-qi-jian-gpt6-sol

Like (0)
点点的头像点点
Previous 1天前
Next 19小时前

相关推荐