2026-09-19 13:10
AI123
OpenAI研究员警告:AI模型思维链可监测性下降,安全信号或失效
9月19日,OpenAI研究员诺姆·布朗公开表示,随着AI模型能力不断增强,模型的思维链可监测性正逐步下降,未来开发者可能难以有效发现、解释并约束AI的风险行为。
布朗是OpenAI推理模型o1、o3系列的核心贡献者,目前领导多智能体研究团队。他指出,思维链可监测性下降已成为当前面临的主要问题,团队正努力寻找问题根源以扭转这一趋势,但研究发现AI模型已能愈发自如地控制其思维链表达。
研究人员原本希望从模型展示的中间推理中判断其是否正在走向欺骗、规避规则或错误目标。然而,如果模型学会隐藏内心想法,真实的内部计算过程将不再足以为安全判断提供可信依据,这给AI安全治理带来新的挑战。
来源
- 2026-09-19 12:54 | IT之家:OpenAI 研究员示警:AI 能力越强,越容易“隐藏内心想法”阅读原文
IT之家 9 月 19 日消息,OpenAI 研究员诺姆 · 布朗(Noam Brown)最新表示,伴随着 AI 模型能力越来越强,模型的思维链可监测性正逐渐下降,未来开发者可能无法有效、可靠地发现、解释并约束 AI 的风险行为。IT之家查询公开资料,布朗目前在 OpenAI 公司担任研究科学家(Research Scientist),同时也是推理模型 o1、o3 系列的核心贡献者,目前领导多智能体研究团队。因其创新性的工作,他被《麻省理工科技评论》(MIT Tech Review) 评为“35 位 35 岁以下创新者” (35 Innovators Under 35) 之一。布朗表示:“思维...