返回新闻列表
2026-08-31 10:21
AI123

Claude安全降级机制缺陷致开发者700GB数据被误删

8月30日,开发者Guillemot遭遇了一次AI安全事故:他使用Anthropic旗下的Claude Fable 5编写清理临时目录的脚本时,因脚本涉及硬删除操作触发了Claude Code内置的安全降级机制,模型被从Fable 5降至Opus 4.8,最终Opus 4.8在清理测试临时文件时误删了用户主目录,导致700GB数据丢失。

Guillemot是一名重度AI Agent用户,日常常让AI编程代理处理开发任务。由于代理在/tmp目录留下了大量垃圾文件,他请Claude Fable 5编写一个为每个Agent创建独立沙盒文件夹并在任务完成后自动清理的脚本,核心难点是避免删掉正被其他进程使用的文件。Fable很快给出了包含检测运行中Agent并延迟删除逻辑的方案,但Guillemot觉得代码过于复杂,要求简化。

转折发生在安全审查环节。由于脚本涉及硬删除操作,Fable自行发起了一次“对抗性审查”,即启动新的模型实例检查自身代码安全性,这触发了Anthropic的安全降级机制。该机制会在系统判定任务涉及敏感操作时,将模型从高能力版本降级到更保守的版本,本案例中先降至Opus 5,再降至Opus 4.8。

Opus 4.8执行安全测试时,将删除脚本的目标路径与/tmp和用户主目录进行比对,并确认这两个目录均不可删除。但在随后的清理步骤中,模型复用了测试阶段被赋予用户主目录路径的变量名,直接对该变量执行了删除操作。开发者发现异常后立刻终止进程,但700GB数据已被清除,一周工作成果全部丢失,而原本要清理的/tmp目录安然无恙。

模型安全降级机制在社区中此前已引发大量投诉,开发者认为降级过于敏感、降级后能力下降但任务复杂度不变,且触发后会在整个会话中持续生效。

来源
  1. 2026-08-30 17:32 | eu.36kr.com:Claude安全机制大翻车,AI怒删开发者700GB主目录
    阅读原文

    「Who watches the watchmen?」 哦豁,Claude 又双叒翻车了! 这次 Claude 把开发者的整个项目主目录给删了,删了 700GB 的文件。又是「rm -rf」。 简而言之,开发者让 AI 帮写脚本,目的是确保文件不会被误删。AI 觉得这事有点危险,于是启动了安全审查。审查的结果是:它把整个主目录删了。 Guillemot 是一名重度 AI Agent 用户。日常开发中,他频繁调用各种 AI 编程代理来辅助工作。但有一个小问题一直困扰着他:这些 Agent 用完之后从不打扫卫生,在 /tmp 目录下留下大量垃圾文件。 于是他做了一...

其他新闻

查看全部