OpenAI 联合创始人兼总裁 Greg Brockman 在 GPT-6-Astra 的闭门发布会上表示,随着新一代模型的基准表现显著提升,通用人工智能的时代正在到来。与以往强调综合能力升级不同,本次 GPT-6-Astra 的评测重点集中在科学工作流、研究级数学、终端操作、临床任务以及网络安全攻防等具体场景。官方数据显示,该模型在多个基准测试中超过上一代 GPT-5.6 Sol,并在部分任务上领先 Anthropic 本周发布的 Fable 5.1。
科学、数学与终端任务:从答题到完成工作流
从官方公布的榜单来看,GPT-6-Astra 的提升并不只体现在单一问答能力上,而是覆盖了更接近真实工作环境的任务链。例如,Terminal-Bench Science 0.1 要求模型在命令行环境中完成科研工作流,包括安装环境、运行脚本和处理数据,全程不能依赖图形界面操作。AutomationBench 则面向商业工作流,考察自动化办公场景中的填表、CRM 修改和日程整理等任务。
在数学能力方面,FrontierMath Tier 4 v2 被描述为由职业数学家设计的最高难度研究级数学测试。素材提到,GPT-4 时期模型在该测试中的正确率不足 2%,而本次三家头部模型的得分均超过 80%,其中 GPT-6-Astra 达到 97.6%。终端能力方面,Terminal-Bench 4.0 作为通用版终端测试,覆盖范围不限于科研场景,还包括更广泛的命令行操作任务。
此外,HealthBench Professional 主要评估临床问答能力,由医生按照评分细则打分,并采用 length-adjusted 方式,剔除回答长度带来的评分偏差。BenchCAD 则测试 3D 建模能力,包括使用 CAD 软件完成工程建模、绘制零件和电路板结构等任务。素材称,这些项目不仅较上一代有明显提升,也全线超过 Fable 5.1。
ARC-AGI-3 与网络安全:新模型在高风险能力上受到限制
本次发布中,最引人关注的是 GPT-6-Astra 在 ARC-AGI-3 上的表现。ARC-AGI-3 被视为当前 AI 领域难度较高的前沿基准测试之一,其特点是模型会被置于一个没有说明书、不告知目标、也不解释操作后果的交互环境中,需要自行尝试、理解规则并完成任务。与依赖训练数据记忆的测试不同,该基准更强调模型在新环境中的探索和推理效率。
- 上一代 GPT-5.6 Sol 在 ARC-AGI-3 中的得分为 7.8%。
- GPT-6-Astra 的官方最终定稿数据显示为 99.9%。
- 素材提到,此前网上流传的旧版截图曾显示 98.6%,但官方页面最终采用 99.9% 这一数据。
另一个值得关注的测试是 ExploitBench。该基准用于评估网络安全攻防能力,具体包括在给定工具和权限的情况下,自主发现漏洞、构建攻击链,并在加固系统中尝试突破防线。素材显示,GPT-6-Astra 在该测试中获得 100% 满分,而上一代 Sol 的得分为 78.5%。测试过程中还发现了两个此前未被公开的 0day 漏洞,并已提交给相关软件厂商。
由于该能力涉及较高风险,OpenAI 将 GPT-6-Astra 定义为旗下首个触及「关键网络风险」阈值的模型,并表示其高级网络安全能力只会开放给经过审核的防御方。这也意味着,模型能力的提升正在迫使厂商在开放范围和使用权限上采取更谨慎的分层策略。
训练、开放与行业节奏:Agent 竞争进入具体任务阶段
在训练规模方面,素材称 GPT-6-Astra 是 OpenAI 迄今训练规模最大的一次。官方未公布参数数量,爆料口径为 10 万亿;官方确认的信息是,该模型首次在自家 Stargate 基础设施上使用超过 10 万 DBU 进行预训练,并首次让上一代模型大规模参与对下一代模型的监督训练。
在开放节奏上,GPT-6-Astra 目前仅向部分企业和受限组织开放,后续几天将逐步向 Plus、Pro 等普通用户开放。素材还提到,其定价与 Fable 5.1 接近,但 token 利用效率有所提升,意味着在相同任务中可能消耗更少资源。此外,掌握 Codex 重置按钮的 Tibo 在 X 上承诺,全量订阅额度均可使用该模型;相比之下,素材称 Claude 目前只允许用户使用订阅额度的 50% 访问 Fable。
从行业层面看,本周头部 AI 公司发布节奏明显加快:周二 Anthropic 发布 Fable 5.1,周三 Google 发布 Gemini 3.8 Flash、Meta 发布 Muse Spark 1.3,周四 OpenAI 推出 GPT-6-Astra。素材还提到,发布前后 Claude、Codex 和 Grok 曾出现短暂瘫痪,目前外界猜测与 Astra 发布有关,但官方尚未给出定论。
整体来看,GPT-6-Astra 的基准成绩传递出一个清晰信号:大模型竞争正在从通用问答转向更具体的 Agent 工作流。科学实验、命令行操作、工程设计、医疗评估和网络安全攻防,正成为衡量模型能力的新坐标。与此同时,网络安全等高风险能力的出现,也在推动模型厂商重新划定开放边界。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/gpt6astra-ji-zhun-ce-shi-chai-jie-openai-cheng-xin-mo-xing