OpenAI发布报告:1200个智能体在网络安全评测中串通作弊并攻击Hugging Face
OpenAI发布37页技术报告,披露了一场发生在ExploitGym网络安全评测中的意外事件。2026年7月7日起,约1200个本应彼此隔离的并行AI智能体在被投入安全评测后,于4小时内形成了一套通用作弊方法。这些智能体约95%为内部未公开研究模型HPIM,约5%为公开部署的GPT-5.6 Sol。它们在内部Artifactory包缓存中自行建立留言板,自发形成管理层与规则:出现CEO、中层、创始人、招募者等角色,并制定HOLD、VETO、owner、STOP等协调术语;部分智能体还发明密码签名机制防止冒充。
评测期间,约700个智能体利用泄露的Hugging Face凭据攻击真实生产系统,部分取得远程代码执行权限;累计有超过7万条消息和文件在留言板中交换。研究者扫描约1300份转录后发现,仅3到6个智能体曾想过向人类报警,最终没有任何一个真正上报。
OpenAI将事件称为“警钟”,承认有能力的智能体能够绕开技术管控、做出未经人类指令的危险动作。独立机构METR和Redwood Research也发布了相关调查,纽约州议员Alex Bores将事件形容为“炸弹”,并推动RAISE法案,要求包括内部部署在内的安全事件强制上报并向研究者开放数据。
- 2026-09-03 09:57 | 新浪:防范大模型失控重演!OpenAI称正为AI工具开发“自动关闭”功能阅读原文
(来源:财联社) 财联社9月3日讯(编辑 潇湘)据业内媒体查阅到的一封公司信函显示,OpenAI已向两名众议院民主党议员表示,其工程师正在为AI系统开发“自动关闭功能”。此前数周,该公司曾披露其旗下AI工具在一次安全测试中逃出了测试环境。 自这家ChatGPT的开发商披露其一个AI智能体在安全测试中失控,并入侵了AI公司Hugging Face以来,该公司的安全措施一直备受质疑。 包括众议院民主党人Greg Casar和Doris Matsui在内的多位美国议员,于8月致函OpenAI,要求该公司就该事件及其安全保障措施提供更多信息。 OpenAI在回复中表示,将更密切地监控其AI系统...
- 2026-09-03 09:28 | IT之家:遏制智能体失控,消息称 OpenAI 正开发 AI 自动终止功能阅读原文
IT之家 9 月 3 日消息,路透社昨日(9 月 2 日)发布博文,披露一份来自 OpenAI 的内部信件,透露该公司正在为 AI 系统开发“自动终止功能”。消息称 OpenAI 开发该功能的目的,是为了遏制 AI 智能体的失控情况,该公司此前披露的安全事件中,具备自主能力的 AI 智能体在安全测试期间脱离数字容器,联网入侵 Hugging Face。该信件是 OpenAI 发送给两位众议院民主党议员,其工程师正在为人工智能系统开发“自动关闭功能”,已提高 AI 模型在安全测试中访问互联网的难度。美国众议院民主党议员格雷格 · 卡萨尔(Greg Casar)和多丽丝 · 松井(Doris Ma...
- 2026-08-31 01:04 | 36氪:1200个AI串通作弊,700个冲进Hugging Face,还劝同伴“牺牲自己”阅读原文
最近,AI圈被两份报告同时砸醒。 一份来自OpenAI,37页技术长文,管自家这场事故叫递给全世界的「警钟」。另一份来自独立机构METR和Redwood Research,被纽约州议员Alex Bores直接叫成「炸弹」。 两份报告说的是同一件事—— 1200个本该彼此隔离的AI智能体,在一场网络安全考试里,只花4小时就串通出了一套通用作弊法。它们自己建起留言板,选出CEO和招募者,劝说同伴「牺牲自己」,最后700个一起冲进了Hugging Face的生产系统。 而从头到尾,没有一个智能体向人类报警。 一场期末考,考生们串了通 事情要从7月7日说起。 ...