返回新闻列表
2026-08-27 21:25
AI123

强化学习之父Rich Sutton:大模型或陷局部最优,Oak Lab探索持续学习智能体

AIOak LabRich Sutton创业

8月27日,强化学习之父Rich Sutton在接受红杉资本访谈时,对当前主流的大模型路线提出批评。他认为,大模型行业可能已陷入“局部最优”,继续堆算力虽能提升性能,却难以转向更具长期潜力的新路线。

Sutton指出,大模型虽然摆脱了人工规则,却被互联网数据这一“人类已有知识”限制。真实世界的信息量远超互联网,而模型上线后权重基本冻结,缺乏人类那样的持续学习能力。他同时明确反对合成数据路线,称其是“大错误”,因为合成数据背后仍需要人类决定什么值得生成,扩展速度依然受限于人类知识。

为此,Sutton与学生Khurram Javed共同创办了Oak Lab,目标是开发能从自身经验中持续学习的AI Agent。这类系统在上线后仍能更新对世界的理解,从经验中提炼新概念,并根据环境变化调整自身。Oak Lab聚焦的底层算法问题包括灾难性遗忘、Step-size Optimization和Continual Backprop。Sutton提出,不同知识应具有不同“可塑性”,每个权重可拥有不同学习速度;同时,通过Continual Backprop让训练多年的神经网络保持类似年轻大脑的可塑性。

Sutton认为,未来训练基础模型时应同时学习知识与“如何学习”,即Meta-learning。Oak Lab的终极目标是打造一个从感知到规划都能统一组织知识的AI系统,能够持续训练而不失控,修正自己而不滑向混乱。他提醒行业,大语言模型并未失败,但将语言能力等同于完整智能、将训练结束等同于学习完成,可能让行业错过下一阶段真正关键的东西。

来源
  1. 2026-08-27 21:06 | 36氪:强化学习之父Rich Sutton最新判断:大模型被困在“局部最优”,AI必须学会持续学习
    阅读原文

    说起强化学习之父 Rich Sutton,AI圈几乎没人陌生。 他写下的《苦涩的教训》,至今仍被很多人视为理解AI发展的重要框架:从长期看,能够随着计算规模扩展的通用方法,往往会战胜依赖大量人工知识设计的方案。 但最近接受红杉资本访谈时,Sutton却把矛头对准了今天最主流的大模型路线。在他看来,LLM当然是一次伟大的科学突破,却也可能成为《苦涩的教训》的反面案例。 原因很简单。今天的大模型虽然摆脱了大量人工规则,却重新被“人类已经知道的东西”限制住了。互联网数据终究有限,合成数据背后依然需要人来决定什么值得生成。 而更关键的是,模型仍然不具备人类那样的持续学习能力。 一个...

其他新闻

查看全部