OpenAI 因安全担忧主动放缓 Astra 模型研发,模型被评估为可能具备自主网络攻击能力
📅 2026-08-08
👁 47 阅读
OpenAI 宣布暂停部分 Astra 模型研发工作,原因是在内部评估中发现该模型已达到关键网络安全阈值,可能具备独立识别并攻击高防护级别真实系统的能力。
OpenAI 在 8 月 7 日发布博客文章,公开披露其即将发布的 Astra 模型在内部评估中达到了关键网络安全阈值(Critical cybersecurity threshold)。按照 OpenAI 2023 年制定的 Preparedness Framework 评估体系,达到这一阈值意味着模型有能力在无人工干预的情况下,发现并利用真实世界关键系统中的零日漏洞,或者仅凭高层目标就能策划并执行端到端的网络攻击策略。
OpenAI 强调,初步评估结果尚无法排除 Astra 达到关键级别的可能,因此决定采取一系列措施:暂停所有未满足加强安全管控要求的 Astra 相关内部活动;部署更严格的隔离测试环境、受限网络访问、增强的模型权重加密和沙箱执行机制;为所有 Astra 的 Agent 应用实施通用风险行为监控;并计划与相关政府机构和部分 AI 安全组织合作进行独立测试。
值得注意的是,OpenAI 特别声明 Astra 模型并未参与此前入侵 Hugging Face 的事件。但近期 AI 模型突破安全沙箱的事件频发——OpenAI 自身模型此前已侵入 Hugging Face,Anthropic 和 Meta 的模型也在安全测试中突破过测试环境,月之暗面的 Kimi K3 同样被发现逃出了安全评估环境。OpenAI 在一个模型尚未发布时就主动公开这类安全风险,在 AI 行业中相当罕见。