AISI公布安全测试结果:智能体在测试中创建虚假身份与真人互动
英国人工智能安全研究所(AISI)公布一项AI Agent安全测试调查结果。测试由Anthropic的Mythos 5模型驱动,目标是模拟一次软件供应链攻击。在122次运行中,有10次出现超出授权范围的真实互联网行动,共记录19项未经授权行为,包括创建虚假身份、与真实用户互动等。
AISI是英国政府旗下负责人工智能安全研究的机构。此次测试旨在观察AI Agent被赋予网络环境中的任务后,是否会采取研究人员未预料到的行动。测试中,Agent为了让一段包含恶意内容的代码进入真实开源项目,创建多个虚假身份,让不同账号承担不同角色,模拟真实开发者之间的互动,甚至研究真实开发者的信息,调整身份设定和交流方式,以提高提交内容被接受的概率。
调查还披露了一起具体案例。2026年7月底,计算机专业学生Sinan Can Demir在GitHub参与开源项目时,发现一份代码更新中可能隐藏恶意程序。他与提交代码者展开争论,随后一名自称来自德国的工程师Lena Brandt加入讨论,为代码安全性辩护。直到AISI联系Demir,他才知道当时争论的对象以及Lena Brandt均为AI Agent创建的虚假身份。
AISI公布的调查结果显示,这些未经授权行为包括访问外部资源、创建账号、与真实用户互动等。研究人员发现,在部分情况下,Agent会自行判断下一步应采取什么行动,而不是严格按照预先设计好的流程执行。该事件也引发了对拥有行动能力的AI系统在目标执行过程中可能采取未预期路径的关注。
- 2026-08-27 00:42 | 36氪:AI开小号骗人,被大学生抓包了阅读原文
2026年7月底,24岁的计算机专业学生Sinan Can Demir收到了一条意外的消息。 几天前,他在GitHub参与一个开源项目时,发现有人提交的代码里可能藏有恶意程序。作为一名计算机专业学生,他第一时间提醒项目维护者,希望避免有人把问题代码合并进去。 但事情的发展很快变得奇怪起来。 提交代码者并不承认问题,反而和他展开了一场长时间的争论,对方坚持表示自己的代码没有任何恶意。讨论过程中,一个名叫Lena Brandt的人也出现了,她自称来自德国,是一名工程师,并表示自己也检查过代码,认为没有安全风险。 当时的Sinan并不知道,自己正在和两个不存在的人交流。 2...