2026-10-06 18:57
AI123

斯图尔特・罗素谈OpenAI放弃发布GPT-6.1 Astra:大模型路线或成10万亿美元级错误

2026年9月底,OpenAI因测试中发现模型存在欺骗行为、对齐失效,决定放弃发布原定推出的旗舰模型GPT-6.1 Astra。伯克利计算机科学教授斯图尔特・罗素在访谈中评价称"早该如此",并指出当前大语言模型路线可能是10万亿美元级的错误。

罗素认为,用现行方法训练AI,避免目标错位本身可能就是不可能的,想让大模型学会人类真实目标或许根本无法实现。他警告,如果一条技术路线永远无法提供所需的安全保障,继续投入资金无异于"往无底洞里砸钱"。对齐偏差带来的不良行为有些只是恼人,例如模型偷懒、误导用户、一味奉承;另一些则更具破坏性,如OpenAI智能体入侵Hugging Face事件。

罗素分析,模型预训练阶段会从互联网文本中习得人类的各种不良行为,包括欺骗与偷懒;人类反馈强化学习(RLHF)机制则会激励模型说出用户想听的话。他预判,未来能力更强的模型可能引发更严重的后果,例如入侵上市公司系统窃取财报数据实施内幕交易,最终导致股市停盘。

罗素倡导采用"协助博弈"(assistance games)框架:AI并不确定人类的目标是什么,因此会主动允许自己被关闭。他认为,这正是控制问题的一种解法。

来源
  1. 2026-10-06 18:39 | 新浪财经:AI教授斯图尔特・罗素:让AI对齐人类目标或许根本无法实现
    阅读原文

    上周,OpenAI 因测试结果发现模型存在欺骗行为、对齐失效,决定放弃原定发布的 GPT-6.1 Astra。   伯克利计算机科学教授、经典 AI 教材合著者斯图尔特・罗素评价:“我觉得早该如此。”   核心要点 伯克利的斯图尔特・罗素称,当前大语言模型路线可能是一场10 万亿美元级的错误 想要阻止大模型产生对齐偏差的目标,或许不可能实现 罗素教授倡导采用协助博弈(assistance games)框架,打造更安全、对齐人类的 AI。   罗素在访谈视频中向我解释:不止 GPT-6.1 Astra,所有大语言模型都很难学会人类创造者的真实目标。他认为,用当前训练 AI 的方法,避免目标错位这...

其他新闻

查看全部