9月16日,B站上线「AI无限竞技场」,首期大模型测评榜单同步公布。GPT-6 Astra在10位UP主基于真实工作流的测评中多次登顶,成为获得榜首次数最多的模型。不过,这份榜单并没有给出一个简单答案:在同一期评测中,不同UP主设计的任务里,冠军并不相同,国产模型也占据了前五名中的三席。
评测方式:从标准考试转向真实工作流
这次B站竞技场的规则并不预设固定题库,也不限定能力维度。UP主可以把自己日常工作中遇到的复杂任务直接作为考题,让上百个大模型同题作答,再由UP主根据实际完成效果判断优劣。
这与MMLU、HumanEval、SWE-bench等传统Benchmark形成明显差异。后者更像标准化考试,强调统一题目、统一答案和统一评分;而B站竞技场更接近实战试用,关注模型能否在真实环境中把事情做完。
在这种评测方式下,GPT-6的优势并非均匀分布在所有任务中。首期测评里,「屎山论剑」代码修复主题最受关注。UP主「Token就是词元」让不同模型处理长期积累、牵一发而动全身的老代码问题,GPT-6在其中表现突出。但UP主也提到,GPT-6确实更上一层楼,但能否始终稳定仍需要进一步观察。
同一方向下,不同任务的结果也出现分化。GLM-5.3在另一个代码修复主题中拿到榜首,压过GPT-6;Claude Fable 5.1则在分阶段对抗性修复主题中登顶。这说明,即使同属「修BUG」场景,不同任务设计也会放大不同模型的能力特点。
GPT-6的真正升级:从回答问题到动手执行
素材显示,GPT-6 Astra最受关注的能力升级并不是知识储备,而是Computer Use能力。它可以理解屏幕画面、操控鼠标键盘,并在真实软件环境中完成多步骤任务。
- 在OSWorld 2.0测试中,GPT-6 Astra得分为72.6%,GPT-5.6 Sol为65.7%。
- 完成同类任务时,Astra平均耗时40分钟,Sol需要75分钟。
- 在Terminal-Bench 4.0上,GPT-6得分为57.9%,Sol为37.3%。
- 在Codeforces上,GPT-6获得3206分。
- 在CAD绘制测试BenchCAD上,GPT-6达到95.9%。
这些数据指向一个方向:GPT-6在Agent执行、终端操作和工程闭环上的能力明显增强。它不再只是指出代码哪里有问题,而是可以进入终端、运行测试、读取报错、修改代码并再次验证。
不过,GPT-6的通用智能指数并未拉开差距。在综合知识、编程、工具调用和长上下文的9项测试中,GPT-6 Astra为61分,与GPT-5.6 Sol持平,低于Claude Fable 5.1的66分。这意味着,GPT-6的强项更多体现在执行与操作,而不是全面智力水平的跃升。
ARC-AGI-3的成绩也需要放在具体测试条件下理解。被广泛引用的99.9%来自Provider Adapter harness,而ARC Prize官方标准harness下GPT-6的成绩为62.7%。两者差异与测试环境允许的上下文携带方式有关,因此不能简单视为同一口径下的能力证明。
国产模型与真实场景:没有模型能全场领先
此次榜单前五名中,国产大模型占据三席,显示国产模型在真实任务中已具备较强竞争力。与此同时,Kimi K3未进入首期榜单,也引发了讨论。月之暗面曾在7月开源2.8万亿参数的K3模型,支持1M上下文,并在前端榜上拿到全球第一。
素材没有解释K3未上榜的具体原因,但这一现象反映出真实场景评测和传统跑分之间的差异。一个模型可以在某一类任务上表现突出,却未必能覆盖所有真实工作流中的复杂需求。
这种差异也出现在其他评测体系中。上海人工智能实验室联合多所高校发布的WildClawBench,用60道真实工作任务测试模型能力,包括爬取论文、审计代码仓库、排查Git历史中的API Key泄露、从会议录像中提取结构化数据并生成专业宣传册。结果显示,当前表现最好的模型Claude Opus 4.6得分为51.6%。
中国人民大学高瓴人工智能学院提出的BeyondSWE基准则测试跨仓库检索、领域知识理解、依赖升级和从零构建系统能力,素材称顶尖模型通过率降至45%以下。这些数据说明,当前大模型在复杂真实任务中仍有明显边界。
因此,GPT-6在B站UP主众测中登顶,可以说明它在Agent执行和代码修复类任务中处于领先位置,但并不能直接推导出它是所有场景下的最强模型。模型表现取决于任务类型、评测方法和实际工作流。跑分榜单适合横向比较,真实场景测评更适合判断可用性,二者互为补充。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/gpt6-deng-ding-b-zhan-ai-jing-ji-chang-zhen-shi-ren-wu-ping