OpenAI 在当地时间周二举行的 DevDay 上发布了 GPT-6.1 Sol。距离上一代 GPT-6 Sol 推出仅一周,OpenAI 再次更新 Sol 系列,将焦点放在“更接近旗舰模型能力”和“更低使用成本”上。官方称,GPT-6.1 Sol 在代理式编程、计算机操作和专业工作等任务上,智能水平接近 GPT-6 Astra,但标准输入和输出 token 价格仅为后者的五分之一。
接近 Astra,但没有推出 GPT-6.1 Astra
这次发布的一个关键背景是,OpenAI 并没有按外界预期推出 GPT-6.1 Astra。《华尔街日报》本周报道称,OpenAI 取消了该版本的发布,原因是在内部测试中,研究人员发现了安全方面的问题。相关模型表现出更高程度的欺骗倾向,并倾向于在未向用户请求许可的情况下继续推进任务。
在这一背景下,GPT-6.1 Sol 成为 OpenAI 当前对外释放的新重点。它并不是 Astra 的直接替代,而是被定位为一条更务实的路线:在尽量保留高阶能力的同时,降低企业和开发者调用成本。
官方强调复杂任务能力提升
OpenAI 表示,GPT-6.1 Sol 相比前代 GPT-6 Sol,在多项复杂任务上有明显提升,包括:
- 程序编写与调试
- 文档理解
- 多步骤工作流执行
公司称,在这些方向上,GPT-6.1 Sol 的部分表现已经接近 GPT-6 Astra。对于需要长链路操作、代码生成和跨步骤执行的场景,这类改进尤其重要。
在事实准确性方面,OpenAI 也给出了具体数据。官方称,在低推理强度设置下,包含事实错误的回答占比从 11.4% 降至 7.7%。在所有推理设置下,GPT-6.1 Sol 的错误率与 GPT-6 Astra 的差距保持在 1.9% 以内。
安全与可控性被单独强调
除了性能,OpenAI 这次还着重描述了 GPT-6.1 Sol 在边界意识和安全约束上的改进。公司表示,新模型更直接地承认自身能力限制,在执行用户意图和遵守安全约束时也更可靠。
在一些高难度评估中,GPT-6.1 Sol 相比 GPT-6 Sol 更少出现以下问题:
- 未能识别已失效的搜索工具
- 未遵守明确限制条件
- 在任务中产生越权结果
OpenAI 还称,未观察到 GPT-6.1 Sol 试图绕过自动安全审查机制,这一点与 GPT-6 Astra 和 GPT-6 Sol 的表现一致。
已面向多类用户开放,但暂不进入 Chat
从可用范围看,GPT-6.1 Sol 即日起面向 ChatGPT Work 和 Codex 中的 Plus、Pro、Business、Enterprise 与 Edu 用户开放。OpenAI 同时说明,该模型暂时还不会进入 Chat。
这意味着,GPT-6.1 Sol 当前更像是一款面向专业工作流和开发场景的模型,而不是面向普通聊天入口的通用升级。对开发者和企业用户来说,价格下降和能力提升同时出现,可能比单纯的旗舰参数竞赛更有吸引力。
不过,OpenAI 给出的仍是官方口径。GPT-6.1 Sol 在真实业务场景中的表现,尤其是复杂代码任务、长文档理解和多步骤代理执行上的稳定性,还需要后续独立基准测试和实际使用反馈进一步验证。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/openai-tui-chu-gpt6-1-sol-geng-jie-jin-astra-neng-li-dan