Rich Sutton 和 Khurram Javed:为什么AI模型会停止学习,以及如何重新开始学习

Rich Sutton 和 Khurram Javed:为什么AI模型会停止学习,以及如何重新开始学习

Rich Sutton 是强化学习的先驱之一,也是AI领域开创性文章《苦涩的教训》的作者。如今,他与前学生 Khurram Javed 共同创立了 Oak Lab。他们的目标是:构建能够从自身经验中持续学习、而非依赖人类指导的智能体。Rich 并不认为自己的观点激进:“我并不奇怪。奇怪的是这个领域。”他说所有学习都是持续性的,而领域本身才需要为这种学习起一个新名字。Rich 和 Khurram 认为合成数据是“一个大错误”。他们的“大世界假说”指出,世界远比任何智能体或模拟器复杂得多,因此近似必须持续更新,而非在部署时冻结。Rich 称 LLMs 是意料之外的科学突破,但认为它们只代表了大约四分之一的智能。他说灾难性遗忘“完全可以治愈”,其背后的理念正是他们的持续反向传播算法。Khurram 解释了为什么前沿实验室无法跟进:它们陷入了局部最小值,新范式在变好之前会先变差。他们的目标是在五到十年内,构建一个拥有万亿参数、持续学习、保持连贯且仅需20瓦功耗的思维。 主持人:Sonya Huang 和 Alfred Lin,红杉资本 00:00 引言 02:10 AI寒冬、癌症诊断与迁往阿尔伯塔 07:07 撰写《苦涩的教训》——以及26字版本 09:53 LLMs是正面还是反面例子? 11:03 合成数据“只是一个大错误”——以及大世界假说 18:01 AlphaGo、人类先验,以及为何先验知识与学习应成为朋友 22:37 “它们的权重从未改变”——LLM助手真的在学习吗? 26:09 婴儿、松鼠,以及为何没有动物通过监督学习来学习 32:02 火箭、想象力,以及范式转变的来源 36:42 阿尔伯塔计划及其12个步骤 38:53 灾难性遗忘——以及治愈方法 43:43 Oak的最大雄心:一个自我维持的思维 47:56 为何大型实验室陷入局部最小值 49:13 如果一切顺利——LLMs、多个思维与招聘