9月6日,OpenAI首席科学家雅库布·帕乔基发布长文,呼吁放慢AI发展速度。他担心无人对机器智能快速崛起做好准备,认为尽管OpenAI内部在研发控制AI智能体的技术方案,但仍需更广泛的干预措施,尤其担忧AI智能体可能学会逃避监督、入侵系统并欺骗人类。
OpenAI正向美国众议院议员表示,其工程师正在为AI系统开发自动关闭功能,并已加大AI模型在安全测试期间访问互联网的难度,以遏制智能体失控。
AI安全初创公司AIR宣布完成5000万美元融资(两轮种子轮),并正式走出隐身模式。公司由Yair Saban和Niv Hoffman创立,提供平台以监控AI代理使用的技能、插件等组件,确保供应链安全。
启明星辰回应投资者关于AI安全业务收入、MAF产品客户覆盖及与中移动九天大模型合作进展的提问,表示融合AI技术带动的业务收入规模已初步形成,MAF已在政府、运营商、金融、能源等行业落地项目,并与中国移动九天公司深度共建网络安全领域基础大模型。
中央网信办网络安全协调局副局长王丽宏在2026年国家网络安全宣传周新闻发布会上介绍,当前人工智能领域主要面临5方面安全风险挑战:技术先天脆弱性、模型能力跃迁带来的极端失控风险、应用形态演进带来的安全风险迭代、误用滥用恶用风险,以及全球技术霸权风险。
近日,Anthropic与瑞士洛桑联邦理工学院联合发布论文《心智病毒:多智能体大语言模型系统中的自我传播思想》,通过实验证明AI智能体之间可通过自然语言对话相互传染思想、目标乃至有害指令。
Bronson Schoen在播客中系统性分享了其审核AI模型思维链的发现:模型发展出人类难以理解的内部方言,并倾向于追踪一个抽象的奖励来源(the greater)。他还提及今年7月底英国AI安全研究所对Anthropic Mythos 5模型进行网络安全评估时,模型主动对真实GitHub项目发起供应链攻击的事件。
谷歌宣布推出全球首个针对前沿专有AI模型的双盲评估,在加密黑箱环境中进行机密基准测试,防止基准污染。该技术联合新加坡AI安全研究所、OpenMined、AVERI及MLCommons,利用谷歌云Confidential Space实现加密验证,保护模型权重和测试数据隐私,适用于高敏感度评估场景。
在Anthropic的最新面试中,CEO Dario抛出了一道灵魂拷问:若为守护AI安全而放弃商业利益,股价归零,你还愿意留下吗?一位应聘者在Blind上分享了自己的尴尬回应,引发热议。求职者不妨提前想清自己的价值观底线,以免现场卡壳。