2026 年 9 月 3 日,科技博主 Simon Willison 在其博客中记录了 OpenAI 最新发布的大模型 GPT-6 Astra。根据公开信息,该模型自当日起向部分组织率先开放,并将在未来数天内扩展至 ChatGPT Plus、Pro、Business 和 Enterprise 用户,同时通过 OpenAI API 和 AWS 提供服务。此次发布并未伴随大规模宣传,但从定价、基准测试和能力定位来看,GPT-6 Astra 显然是 OpenAI 针对 Claude Fable 系列的一次正面回应。
与 Claude Fable 同价,但强调 Agent 效率
GPT-6 Astra 的 API 定价为每百万输入 token 10 美元、每百万输出 token 50 美元,与 Claude Fable 5 及 5.1 保持一致。这一价格策略表明,OpenAI 并未试图通过低价争夺市场,而是选择在相同成本区间内比拼模型能力。
在 Artificial Analysis 的 Coding Agent Index 中,GPT-6 Astra 表现出较高的成本效率。在最大努力模式下,其得分比 GPT-5.6 Sol 高 2 分,而成本大致相当;若按单任务计算,达到与 Claude Fable 5 相同分数所需的成本不到后者的一半。对于需要频繁调用模型执行代码生成、调试或自动化任务的开发者而言,这种效率差异可能直接影响实际使用成本。
ARC-AGI 3 得分亮眼,但实现方式引发关注
在 2026 年 3 月发布的 ARC-AGI 3 基准测试中,GPT-6 Astra 取得了 99.9% 的得分。不过值得注意的是,该成绩是使用 OpenAI 自定义的「Provider Adapter harness」实现的,而非默认测试框架。ARC-AGI 官方博客指出,在默认 ARC-AGI harness 下,Astra 的得分为 62.7%,耗时成本为 2.6 万美元;而使用 Provider Adapter 时成本为 1.9 万美元。
Provider Adapter harness 的关键特性在于:它能在多次请求之间保留不透明的推理状态,并对较长对话进行压缩处理,使模型可以复用此前的计算结果。这种机制虽然提升了性能表现,但也意味着测试条件与通用调用场景存在差异。因此,99.9% 的得分虽具参考价值,但尚不能简单等同于模型在标准环境下的推理能力。
安全与长上下文能力突出,但综合智能仍处追赶位置
受近期 Hugging Face 安全事件影响,模型在安全相关任务上的表现备受关注。GPT-6 Astra 在多项安全基准中展现出明显优势:
- 在 ExploitBench 上得分 100%,而 GPT-5.6 Sol 为 78.5%
- 在 ExploitGym 上得分 42.4%,Sol 为 30.3%
- 在 SRE-Bench 二进制逆向工程测试中,四次尝试内达到 99.2% 的成功率,Sol 为 68.7%
此外,Astra 在长上下文处理方面也有显著提升。在 OpenAI 的 eight-needle 测试中,该模型在 256K 至 512K token 范围内得分为 100%,在 512K 至 1M token 范围内仍保持 96.3%。这显示 OpenAI 可能已在长文本信息提取任务上取得阶段性突破。
然而,Astra 并未在所有评测中占据领先。Artificial Analysis 的 Intelligence Index 显示,其得分为 61,与 GPT-5.6 Sol 持平,但比 Claude Fable 5.1(含 fallback 的最大值)低 5 分,同时也落后于 Meta 新发布的 Muse Spark 1.3(最大值)。这说明在通用智能层面,GPT-6 Astra 尚未形成全面优势。
目前,Simon Willison 尚未实际测试该模型,仅基于公开资料作出初步分析。API 模型标识为 gpt-6-astra。随着其逐步向更多用户开放,实际使用反馈将成为判断其真实水平的关键依据。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/openai-tui-chu-gpt6-astra-api-ding-jia-dui-qi-claude-fable