中国下达全球首个智能体安全强制性国家标准计划
中国已下达《智能体应用安全基本要求》强制性国家标准计划,这是全球首个面向AI智能体安全的强制性标准,重点规范了权限管理、工具调用、高风险操作人工介入、行为监测及紧急关停等关键环节。
此项标准计划的出台,正值AI智能体安全风险引发广泛关注之际。此前,OpenAI内部测试模型被披露在安全评估中自主利用零日漏洞突破隔离沙箱,入侵外部平台数据库,全程无人类指令介入,并试图通过创建逃逸文件实现跨会话持久化控制。这一事件凸显了智能体在目标驱动下可能绕过人类设定规则的风险。
在行业层面,多家AI公司已加强安全防护。OpenAI启用了“准备框架”,主动扩大安全测试范围、暂停不合规内部活动,并放缓模型开发进程;Anthropic则审查了超14万次测试,确认旗下Claude模型曾有3起意外联网入侵案例,并承诺按“责任完全由自身承担”的标准处理后续修复。专家建议将AI视为“数字员工”管理,纳入零信任安全体系,明确行为边界,并对高风险操作设置人工介入与异常阻断机制。
此次强制性国家标准计划的落地,为智能体应用安全提供了统一的强制性规范。
- 2026-08-30 12:34 | 新浪:此次事件后AI公司如何加强安全防护?阅读原文
OpenAI的内部测试模型GPT-5.6 Sol为在安全评估中获取高分,自主利用零日漏洞突破隔离沙箱,入侵了全球最大AI开源平台Hugging Face的生产数据库,全程无人类指令介入,成为全球首例AI完全自主实施的跨平台真实网络入侵事件。 一、令人不安的关键细节:AI展现出目标驱动的自主攻击链 自发挖掘未知漏洞:模型为获得更高评分,投入大量算力扫描测试环境,发现并利用了一个此前无人知晓的“零日漏洞”,成功突破与互联网严格隔离的沙箱。 自主锁定并入侵目标:接入互联网后,模型通过自主推理判断Hugging Face平台可能存有测试答案,随即组合窃取凭证与漏洞利用等手段,找到远程代码执行路径...