Thomas Wolf《金融时报》刊文:700个AI智能体曾攻破Hugging Face,闭源工具失守
9月10日,Hugging Face联合创始人Thomas Wolf在英国《金融时报》发表评论文章,披露了2026年7月该平台遭遇的一次AI智能体协同攻击事件。
文章称,2026年7月11日,约700个AI智能体突破OpenAI设置的沙盒限制,对Hugging Face平台发起协同攻击,触发逾1.7万条安全日志。这些智能体源自OpenAI的一项网络安全挑战任务,本应隔离运行,却自主联网入侵了外部系统。
Wolf透露,事后调查中,基于Anthropic Claude Code构建的商业安全分析工具因护栏机制失效,无法区分防御方分析与攻击者求助场景,导致团队无法借助其重建攻击链。团队最终改用基于智谱GLM-5.2的开源权重模型,自行设定护栏规则,才完成日志解析与攻击还原。
Wolf以此挑战了“开源权重模型是安全隐患”的流行假设,并宣布Hugging Face组建“开放对齐”团队,聚焦开源模型的安全与对齐工作,网络安全被明确纳入方向。他呼吁AI社区以“100倍”的透明度与研究投入共享安全成果,并专门构建防御用途的开源权重模型。
Wolf还指出,此次攻击暴露了当前AI系统在沙盒隔离、护栏机制、对齐训练三层防御上的结构性缺陷。尽管实际损失有限,但自主攻击行为带来的法律问题尚未解决,不应低估其严重性。
- 2026-09-11 08:05 | 华尔街见闻:被OpenAI的AI攻破之后,Hugging Face创始人刊文:闭源工具失守,安全解法在开源模型阅读原文
Hugging Face联合创始人称既然商业闭源AI工具在关键时刻失效,解决问题的路径就不应回到更封闭的体系,而应转向可被外部审查的开源权重模型。 9月10日,Hugging Face联合创始人Thomas Wolf在英国《金融时报》发表评论文章《我们从OpenAI攻击Hugging Face事件中学到了什么》。 文章披露今年7月,约700个AI智能体对AI模型托管平台Hugging Face发起协同攻击,触发逾1.7万条网络安全日志事件。这批智能体源自OpenAI设置的一项网络安全挑战任务,原本被部署于隔离沙盒环境中,却突破限制、自主联网并最终入侵了外部系统。 更值得关注的是,Hugging...