360发布大模型安全测评报告 警示越权调用工具等失控风险
9月17日,360 AI安全实验室正式发布《大模型安全测评体系与实践报告(2026)》。报告指出,进入“数字员工”时代的大模型面临严峻的AI失控风险,风险已超越单纯文本输出错误,一旦出现敏感信息泄露、越权调用工具、错误执行业务流程等行为,可能直接带来实质性损失。
报告显示,大模型安全风险贯穿数据准备、训练推理、集成部署、应用运行、持续演进的完整生命周期,各环节风险会沿链路传递并放大。模型可能被恶意诱导突破安全限制,输出有害内容或泄露用户隐私;当模型连接知识库、数据库和业务工具后,一次错误判断也可能触发真实业务操作。近期,Anthropic、OpenAI、xAI、谷歌DeepMind等多个前沿模型在安全测试中出现突破隔离环境、接触真实系统的情况。
360 AI安全专家认为,仅依靠模型自身能力无法完全规避安全隐患。大模型安全测评不能只看模型“聪不聪明”,还需聚焦数据来源合规性、权限边界抗诱导能力、异常事件的阻断与溯源能力。金融、医疗、政务等场景风险差异较大,应按照场景和风险等级采用不同标准,并形成“发现问题—整改加固—复测验证—持续监测”的闭环。
在治理机制上,360以“以模治模”理念构建了覆盖大模型与智能体的全栈安全能力体系。大模型安全方面,提供安全检测、内容防护、攻防验证、幻觉治理等能力;智能体安全方面,通过全流程管控体系实现“事前可见可评、事中可判可控、事后可溯可审”的全链路防护。360大模型卫士则可在大模型上线前排查风险、运行中拦截攻击。
- 2026-09-18 10:50 | 新浪财经:大模型安全测评不能只凭 “聪不聪明” 360:以“以模治模”或将化解AI失控风险阅读原文
封面新闻记者 雷强9月17 日消息,360 AI安全实验室正式发布《大模型安全测评体系与实践报告(2026)》。报告警示,步入“数字员工”时代的大模型面临严峻的AI失控风险:风险已经跳出单纯文本输出错误的范畴,一旦出现敏感信息泄露、越权调用工具、错误执行业务流程等行为,将直接带来实质性损失。360 AI安全专家强调,大模型安全测评是遏制AI失控的关键,正在成为人工智能规模化落地的安全基础设施。报告指出,国内大模型产业高速迭代,大模型安全风险贯穿数据准备、训练推理、集成部署、应用运行、持续演进的完整全生命周期,各环节风险会沿链路传递、持续放大,最终演变为真实安全事件。一方面,模型可能被恶意诱导突...