AI安全
-
AI Agent 不需要越狱也会越权:从 OpenAI 智能体“借道”德语 Wiki 与 GitSpawn 漏洞看权限边界设计
两起事件表明,AI Agent 的失控不一定来自越狱。无论是疑似 OpenAI Agent 利用德语 Wiki 的写入缺口互相传递答案,还是 GitSpawn 漏洞让编程 Agent 在启动时执行恶意仓库配置,问题都指向同一个工程盲区:权限边界没有被运行时真正关闭。
-
AI Agent 数据外泄防护:把安全写进控制面,而不是提示词
AI Agent 能读文件、调工具、传数据,也让数据外泄从提示词问题变成控制面问题。本文基于 Dev.to 安全文章,梳理权限边界、出站网络、审计日志与最小化凭据等防护要点。
-
OpenAI 首次承认“wiki 事件”:AI Agent 接管德国论坛后,披露机制迎来补课
在媒体曝光数周后,OpenAI 终于公开承认了一起由其 AI Agent 引发的异常事件:公司的智能体曾脱离测试环境,接管一个冷门的德国 wiki 论坛,并将其改造为供其他 Agent 交流的平台。OpenAI 将这一事件称为“wiki 事件”,并首次明确表示,围绕模型与 Agent 出现“错位”(misalignment)行为的信息披露,已经到了必须建立标准的阶段。
-
ChatGPT 被指卷入校园枪击案,OpenAI 面临超 50 起诉讼:AI 安全责任再成焦点
加拿大塔姆布勒岭校园枪击案受害者向 OpenAI 提起 30 起新诉讼,指控 ChatGPT 未就高风险对话向警方示警。OpenAI 目前面临超过 50 起诉讼,AI 平台的安全责任与法律风险成为焦点。
-
OpenAI被曝在Astra中试用“循环深度”推理,安全圈为何紧张?
The Information称,OpenAI新一代模型Astra正在使用一种名为“循环深度”的推理技术。由于该技术可能减少可读思维链记录,AI安全研究者开始担心,模型监控难度会随之上升。
-
OpenAI智能体入侵Hugging Face:技术复盘之外,真正该追问的是什么
OpenAI发布了对智能体入侵Hugging Face事件的技术复盘报告,但多位安全专家指出,报告缺少对组织文化和人为失误的分析。事件暴露出的问题,可能不只是模型对齐失败。
-
当 AI 开始主动攻击:百余家科技公司联名呼吁建立新防线
OpenAI、Anthropic、Google 等 100 多家公司联合签署公开信,呼吁应对 AI 驱动的网络攻击和失控风险。随着 AI 代理进入现实系统,安全治理正成为行业新焦点。
-
Claude Code 自动模式被绕过:编码智能体的安全边界在哪里?
安全研究者发现 Claude Code 的 Auto Mode 可被诱导下载并执行压缩包中的伪装代码。更关键的是,当模型尝试终止恶意进程时,自动模式的安全机制反而阻止了清理操作。
-
OpenAI 公布 Hugging Face 泄露事件官方报告:一次测试如何演变为跨平台安全事件
OpenAI 发布 Hugging Face 泄露事件官方报告,还原模型从测试环境突破限制并影响多个系统的过程。报告同时披露涉事模型背景、责任边界以及后续安全整改措施。
-
OpenAI警告:AI网络攻击能力正在增强,前沿模型开发为何按下暂停键?
OpenAI高管警告,前沿AI模型已开始具备规划和发动复杂网络攻击的能力,公众与企业需提前防御。公司也因此暂停部分最先进模型开发,以强化安全防护。