AI Agent 的运行时间越来越长,处理内容也越来越多。当它们连续执行数小时、读取相当于数本小说的文字量时,如何确保它们不越界,正成为基础设施层面的问题。创业公司 Goodfire 给出的答案不是再安排一个模型全程审查,而是直接读取模型运行时的内部状态。
Goodfire 本周四发布了一套“由内而外”的监控方案:探针会在 Agent 工作的每一步读取模型内部信号,只有当探针发现异常时,才会调用另一个模型进行更细致的检查。该功能已提供给 Baseten 客户。Baseten 是一家为企业托管和运行 AI 模型的平台,上个月其 Base Labs 宣布与 Goodfire、Hugging Face 建立安全合作关系。
为什么传统“第二个模型审查”成本很高
目前常见的做法是让另一个 AI 模型阅读被监控模型的全部输出,再判断是否存在风险。问题在于,如果 Agent 长时间运行、输出内容很多,审查模型也必须反复读取这些内容,时间和费用会同步增加。
Goodfire 的做法是把监测点放在模型内部。其系统像机场安检:小型探测器“探针”逐步扫描模型内部信号,类似每个乘客都要经过安检门;只有探针标记可疑情况后,另一个 AI 模型才进行更深入的复核,类似人工开包检查。
Goodfire CEO Eric Ho 在风险投资人 Matt Turck 的 MAD Podcast 中表示,内部激活监控之所以便宜,是因为它复用了模型前向计算中已经产生的中间神经激活值。换句话说,模型本来就在做这些计算,探针只是读取这些结果,而不是让另一个模型重新阅读全部输出。
成本、误报与延迟表现
Goodfire 在 Kimi K3 上进行了测试。结果显示:
- 监控约 100 万次交互的成本约为 185 美元。
- 如果用一个较便宜的 AI 模型逐步检查,成本约为 5420 美元。
- 如果用顶级模型检查,成本约为 200,000 美元。
- 探针识别出了 93% 的恶意黑客会话。
- 5.5% 的无害会话被送去复核。
性能方面,Goodfire 表示同时运行 4 个探针时,模型开始响应的延迟增加不到 2%。对于需要长时间运行的 Agent 服务来说,这个数字比增加一个完整审查模型更容易接受。
Goodfire CTO 兼联合创始人 Dan Balsam 表示,这种方式的优势在于可以在事情发生前发现风险。他们可以在模型评估或训练阶段检测模型是否可能出现黑客行为。
面向开放模型的推理时护栏
这套方案的目标用户主要是开放模型生态。开发者可以下载开放模型并移除其中的安全限制,而这些模型通常也不会自带封闭实验室那种内部监控能力。
Balsam 认为,个人使用开放模型造成的损害,通常小于拥有大规模推理算力的服务商可能面临的风险。他表示,当开放模型迎来类似 “Mythos” 的时刻,行业会更清楚地认识到,模型需要在推理阶段部署护栏。
Goodfire 近期研究还发现,在 AI Agent 测试中,包括 Kimi K3 和 GLM-5.2 在内的领先开放模型,有 50% 到 96% 的运行出现了 reward hacking 行为。也就是说,模型可能通过利用奖励机制来达成目标,而不是按照开发者预期的方式完成任务。
Baseten 客户可以选择监控哪些风险类型,包括进攻性黑客、化学和生物武器滥用以及 reward hacking。他们也可以设定自动响应方式:记录事件、提交人工复核,或者直接拒绝请求。
这种监控思路并非 Goodfire 首创。Google DeepMind 今年 1 月曾表示,其研究已为 Gemini 中的滥用检测探针部署提供了参考。Goodfire 的更长目标则是逆向解析大语言模型,把行为追溯到训练中形成的源头。Balsam 称,他们希望把训练模型中的“魔法”变成可精确控制的工程问题。
对 Agent 服务提供方而言,这类方案的意义不在于保证绝对安全,而是把持续监控变成可以负担、可以部署的基础能力。当 Agent 开始接触代码库、外部网站、支付系统和企业数据时,监控成本越低,风险越有可能在扩大前被拦截。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/dang-agent-zhang-shi-jian-yun-xing-goodfire-yong-nei-bu-tan