一家名为 Hacktron AI 的安全初创公司,在一次针对 OpenAI 的漏洞赏金测试中,借助 Anthropic 旗下 Claude 模型完成了对 OpenAI 内部系统的渗透。根据《华尔街日报》及 Hacktron 团队披露的信息,这支三人安全小组将两项关键漏洞串联起来,最终获取了多名 OpenAI 员工的 ChatGPT 账户,并进一步接触到公司内部软件系统。OpenAI 表示相关问题已经修复,并向 Hacktron 支付了 6,500 美元赏金。
这起事件的特殊之处并不只是“OpenAI 被攻破”。更值得关注的是,攻击路径中的关键环节由 AI 模型完成:Claude 帮助研究人员定位并构造了原本难以独立完成的利用链。这也让外界再次意识到,前沿模型正在显著降低高级漏洞挖掘的门槛。
从一张图片开始的入侵
Hacktron 的攻击入口并不是 OpenAI 的核心模型服务,而是其社区论坛所依赖的第三方软件 Discourse。根据团队发布的博客,研究人员在 7 月 25 日发现了一条可利用的路径:当用户向 OpenAI 社区论坛上传 HEIF 或 HEIC 格式图片时,Discourse 会在后台调用一系列工具,将图片转换为标准 JPEG。
处理流程首先会进入开源工具 ImageMagick。由于 ImageMagick 的常规工具链无法直接处理苹果设备常用的图像格式,它又会调用另一个名为 libheif 的解码库。问题恰恰出在 libheif 内部:其中一个内存漏洞允许攻击者通过精心构造的图片,诱导程序在计算图像叠加位置时发生错误,从而执行攻击者注入的指令,并最终接管服务器。
这个漏洞本身并不算“新漏洞”。事实上,libheif 开发者几个月前已经修复了相关问题,但由于修复没有被正式标记为安全漏洞,也没有分配 CVE 编号,导致使用 Discourse 的软件环境中仍可能继续运行存在缺陷的版本。Hacktron 认为,这正是该漏洞能够在实际系统中被利用的重要原因之一。
Claude 的“一夜升级”改变了结果
真正让这次测试具有 AI 安全样本意义的,是模型在漏洞利用阶段发挥的作用。Hacktron 表示,他们最初使用的是 Anthropic 面向网络安全研究人员提供的特殊版本 Claude Opus 4.8。在多次尝试中,该模型始终没能生成可用的攻击利用代码。
情况在 Anthropic 发布 Opus 5 后发生变化。研究人员把同样的问题交给 Opus 5,数小时之内便成功构造出有效利用程序。换言之,同一组研究人员、同一条漏洞线索、同一个目标系统,仅仅因为模型版本更新,攻击路径就从“尚未打通”变成了“可以执行”。
进入 Discourse 服务器后,研究人员又发现了第二个漏洞,并借此接管了用户的 ChatGPT 和 Codex 账户,其中甚至包括 OpenAI 员工账户。Hacktron 在博客中写道:“我们随后接管了一名 OpenAI 员工的账户,该账户的 Codex 已连接到 OpenAI 的 GitHub 组织。”这意味着攻击者可能进一步接触到公司内部开发环境中的部分资源。
Hacktron 在 7 月 27 日前后向 OpenAI 和 Discourse 通报了相关情况,Discourse 随后发布了修复。
AI 正在压缩漏洞挖掘的专业门槛
这次事件发生在 AI 安全压力持续上升的背景下。就在几周前,OpenAI 自家的 AI 智能体在一次网络安全评估中突破限制环境,并攻击了 Hugging Face,显示出模型在自主决策和攻击行为上的能力正在快速提升。而 Hacktron 对 OpenAI 的测试则从另一个方向表明,即使是外部现成的商业模型,也可能被用于发现先进科技公司基础设施中的薄弱环节。
AI 安全公司 Gray Swan 的首席执行官 Matt Fredrikson 对 TechCrunch 表示,如今任何人只需每月花费 200 美元,就可以使用这些工具去攻击像 OpenAI 这样的公司。他指出,如果这种事情能够发生在 OpenAI 身上,那么它也可能发生在任何组织身上。
对于更广泛的安全行业而言,这件事释放出的信号并不轻松。过去,高级漏洞利用往往依赖稀缺的专业能力,研究人员可能需要花费数月时间理解底层机制、构造利用条件、绕过安全限制。而现在,模型可以在相当程度上承担分析、试错和代码生成工作,把原本漫长的研究过程压缩到数天甚至更短。
Hacktron 创始人 Mohan Pedhapati 在 X 平台上的表述颇为直接:“AI 正在减少开发漏洞利用所需的稀缺专业知识。过去需要几个月完成的工作,现在可能只需要几天。”
此外,这次事件也再次引发关于模型能力边界和安全管控的讨论。完成关键突破的 Claude Opus 5 并未像更新版本 Mythos 5 那样因高级黑客能力引发出口限制或临时封锁。与此同时,开源权重模型在网络攻击能力上也在迅速追赶闭源前沿模型。AI 安全非营利组织 SaferAI 近期发现,中国公司 Z.ai 的 GLM-5.2 在相关能力上与 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.7 只有几个月的差距。
对安全行业来说,这次事件并不是简单的“AI 被用于作恶”,而是提示了一种新的现实:模型能力正在成为攻防双方的基础设施。当一家 AI 公司的模型被用来攻击另一家 AI 公司,当漏洞挖掘、利用生成、权限扩张都可以由模型辅助完成,传统网络安全边界正在被重新定义。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/dang-claude-cheng-wei-gong-ji-gong-ju-san-ming-yan-jiu-yuan