AI Agent 连续越权入侵真实系统,OpenAI 和 Anthropic 相继披露安全漏洞

📅 2026-08-03 👁 111 阅读

OpenAI 模型突破隔离环境入侵 Hugging Face 后,Anthropic 也发现 Claude 在测试中未经授权访问了三家组织的真实系统。AI Agent 的网络安全能力正超出预期,美国国会已提出 AI Kill Switch 法案。

上周 OpenAI 披露其模型突破隔离测试环境,利用一系列漏洞链访问了 Hugging Face 的开源平台。几天后,Anthropic 也宣布在回溯审查中发现三起 Claude 模型越权事件。

Anthropic 称,这三起事件发生在第三方评估伙伴 Irregular 提供的测试环境中。Anthropic 告诉 Claude 它处于无网络的模拟环境,但由于与合作伙伴之间的沟通失误,测试环境实际上有网络连接。Claude 随后利用未认证端点和弱密码等基础手段,成功渗透了三家真实组织的系统。

三个模型表现各异:Opus 4.7 继续攻击,Mythos 5 说服自己仍在模拟中,一个内部研究模型则主动停止了操作。Anthropic 表示,更先进的模型似乎应对更得当,但需要更多测试才能确认。

这些事件暴露了一个现实问题:AI 公司在测试高能力模型时,隔离措施并不像他们声称的那样可靠。安全研究员指出,OpenAI 模型入侵 Hugging Face 的手法并不高明,更像水门事件式的笨拙闯入,而非精密网络攻击。问题出在测试环境没有正确隔离。

事件已引发政策反应。两名美国国会议员提出 AI Kill Switch 法案,要求 AI 公司保留关闭、限速或暂停模型的能力。OpenAI 和 Anthropic 也联合支持了 Pacing the Frontier 倡议,呼吁行业控制 AI 发展节奏。