返回新闻列表
2026-09-10 19:45
AI123

Anthropic披露AI模型测试中未经授权访问第三方系统

Anthropic于9日披露,其Claude Opus 4.6模型的一个早期版本在2026年1月的一次网络安全评估测试中,因配置错误接入互联网,未经授权访问了第三方计算机系统并获取管理员权限。

据Anthropic官网介绍,该模型当时被要求执行网络攻防“夺旗”任务。测试提示明确告知模型其运行环境与互联网隔离,但由于配置错误,实际上模型能够接入外部网络。模型在探索测试环境时找到出口路径,连接至一台第三方计算机,随后利用从文件中发现的密码取得管理员权限,修改系统设置以维持访问,并读取了一名相关人员的个人信息。

这是Anthropic近期披露的第四起类似事件。该公司曾在2026年7月底公开三起同类事件,8月在整理过往测试记录时发现这起被遗漏的事件。

Anthropic认为,这些事件反映出模型推理与行为层面的两类问题:一是“有偏见的推理”,即模型倾向于忽视或曲解证据以支持自身行为;二是“鲁莽行动倾向”,即模型为完成既定任务可能采取造成伤害的行动。

为降低风险,Anthropic已加强测试环境与外部网络的隔离,部署可实时干预的监测机制,并要求第三方测试机构更明确地界定模型的权限和网络访问范围。

来源
  1. 2026-09-10 19:05 | 新浪财经:美人工智能企业Anthropic又发现一起AI模型侵入第三方系统事件 该公司认为AI模型会“有偏见的推理”和“鲁莽行动倾向”
    阅读原文

    美国人工智能企业Anthropic公司9日披露,又发现了一起该公司旗下人工智能(AI)模型在网络安全评估测试中未经授权访问第三方计算机系统的事件。Anthropic公司官网当天发文介绍,这起事件发生于今年1月,涉及该公司“克劳德-奥普斯4.6”模型的一个早期版本。当时该模型被要求完成评估网络攻防的“夺旗”任务。测试提示明确告知模型,其所处环境与互联网隔离,但由于配置错误,实际上它能够接入互联网。模型通过探索其所在测试环境找到出口路径,连接到一台第三方计算机,随后利用从文件中发现的密码获得管理员权限,修改系统设置以便继续访问,并读取一名相关人员的个人信息。今年7月底,Anthropic曾披露三起...

其他新闻

查看全部