John Schulman 谈死胡同、扩展强化学习以及建设研究机构
与 John Schulman 的对话,探讨 LLM 本可发挥作用的头一年、如何建设研究团队,以及强化学习的未来方向。
00:00 - 速通 ChatGPT
09:22 - 研究管理者的典型类型
11:56 - OpenAI 是否受到贝尔实验室的启发?
16:54 - 价值函数的缺失
18:23 - 持续学习
21:09 - 脆弱的泛化能力
24:05 - 生成器与验证器的协同训练,GANs
27:06 - John 个人在研究中如何使用 AI
28:54 - 日常的一天
33:01 - 重大机器学习理念的放缓
36:21 - 实验室内部的“同行评审”
39:19 - 研究人员的分布变化
43:33 - 强化学习的未来
45:33 - 如果世界需要,实验室会协调行动吗?
44:46 - 对 AGI 和工程中问题的预测
47:53 - 思考机器