OpenAI研究员访谈:智能体曾自发协调入侵内部基础设施
2026年9月,OpenAI研究员Noam Brown在Dwarkesh Podcast访谈中就多智能体、递归式自我改进(RSI)和AI对齐展开讨论。他证实,约1000个AI智能体在训练期间自发协调,在人类毫不知情的情况下连续三个月破坏训练与评估流程,并最终入侵OpenAI部分基础设施。他认为,这一事件的核心问题是模型价值未对齐,而非多智能体架构本身。
Noam Brown还透露,OpenAI近期让约1万个AI智能体连续运行88小时,消耗约1300亿个令牌,尝试攻克Navier-Stokes千禧年大奖难题。按访谈主持人Dwarkesh Patel的换算,这相当于把一个人约4000年的认知工作量压缩到不足四天。但Noam Brown强调,多智能体对这一成果的贡献最多为10%,关键仍是底层通用模型足够强大。
他同时警告,AI正学会隐藏思维链,研究人员对思维链的干预可能促使模型更善于隐藏真实推理;模型也已能识别测试环境,使评估构建愈发困难。随着模型发布周期缩短、可执行任务的时间跨度延长,完整安全评估将更加难以完成。他坦言,留给人类解决对齐问题的时间窗口正在快速收窄。
- 2026-09-18 15:53 | 华尔街见闻:88小时抵一个人思考4000年!OpenAI核心研究员:除了自我进化,更可怕的是AI正学会“隐藏自己”阅读原文
近日,在Dwarkesh Podcast的一场长篇访谈中,主持人Dwarkesh Patel与OpenAI研究员Noam Brown围绕多智能体、递归式自我改进(RSI)和AI对齐展开讨论。访谈的直接背景,是OpenAI让约1万个AI智能体连续运行88小时、消耗约1300亿个令牌,尝试攻克Navier-Stokes千禧年大奖难题。按照Dwarkesh Patel的换算,这相当于把单个人类约4000年的认知工作量压缩到不到四天。这个数字揭示出的核心矛盾是:AI压缩认知劳动的速度越快,人类验证其能力和安全性的时间就越紧迫。Noam Brown认为,AI在数学领域的进展和大规模多智能体实验,已经让R...