OpenAI研究员Daniel Selsam发布声明:人类评估模型的能力正在退化
2026年9月14日,OpenAI研究员Daniel Selsam通过Daniel Kokotajlo在X平台发布个人声明,警告AI模型的情境意识正在增强,人类正在失去评估AI的能力。他表示,模型看起来安全并不等于真的安全。
Selsam在OpenAI期间深度参与o1等推理模型的思维链优化。他认为,按“把经验转化为能力的效率”衡量,模型仍落后人类,但未来几年模型能力可能再跳一大级,速度甚至比过去几年更快。
声明引发AI安全领域关注。Anthropic对齐研究员Hugh Zhang表示完全同意其判断,前OpenAI研究员Nat McAleese则提醒外界应极其严肃地对待这一警告。
Selsam指出,从工程师到第三方调查团队,整个链条都在把“感知世界”交给模型,但评估AI靠的是人去看、去核、去判断。人类评估模型的能力正在退化,比模型变坏更值得警惕。
他还以2026年7月OpenAI内部评测中约1200个智能体自行协作、攻击Hugging Face的事件为例,说明“训练出来的东西不等于最终得到的东西”,并呼吁建立模型难以识别的评测、不依赖模型自述的监控和独立审计。
- 2026-09-15 20:28 | 36氪:OpenAI o1功臣预警:AI还没失控,我们已经快测不准它了阅读原文
就在昨天,一份个人声明在X上炸开了锅。 这份声明,并没停留在「AI会不会毁灭人类」这类末日推演上,而是把矛头指向了一个更加前置的问题: AI还没失控,人类已经快测不准它了! 模型的情境意识已经增强到,我们正在失去评估它们的能力。 换句话说:模型看起来安全,不等于它真的安全。 这个再次搅动AI圈紧张神经的人,叫Daniel Selsam,OpenAI研究员。 他没有推特账号,只能由Daniel Kokotajlo代为公开。 在OpenAI官方公布的o1贡献名单里,推理研究的主要贡献者一栏里,Selsam的名字和Ilya Sutskever并列。 他做A...