ARC-AGI-3
-
GPT-6-Astra 基准测试拆解:OpenAI 称新模型在科学、数学与安全攻防上全面提速
OpenAI 发布 GPT-6-Astra,官方基准显示其在科学工作流、研究级数学、终端任务、临床问答和网络安全攻防等场景较上一代明显提升,其中 ARC-AGI-3 达到 99.9%,ExploitBench 获得满分。
OpenAI 发布 GPT-6-Astra,官方基准显示其在科学工作流、研究级数学、终端任务、临床问答和网络安全攻防等场景较上一代明显提升,其中 ARC-AGI-3 达到 99.9%,ExploitBench 获得满分。