RL环境解析:AI代理如何学习真实世界的工作 | Brendan Foody, Mercor

RL环境解析:AI代理如何学习真实世界的工作 | Brendan Foody, Mercor

RL环境已成为AI训练数据中最热门的话题。但它们到底是什么?在Sequoia Capital的Own Your Intelligence活动中,Mercor首席执行官Brendan Foody分解了三个组成部分:世界(真实项目中的消息、文档和文件)、应用(Salesforce和Google Workspace等工具的高保真克隆)以及任务(提示与基于量规的验证器配对)。他详细介绍了与顶级律所律师共同构建的真实法律环境,并分享了训练后的结果,显示了在适度计算下领域特定任务的显著提升。 Brendan还涵盖了为什么人类在衡量前沿方面仍然不可或缺,Mercor如何为数据定价,从众包标注到专家构建环境的转变,以及下一步:超长期任务和虚拟同事。他认为,曾经仅限于前沿实验室的技术现在正在进入应用公司,而他们构建的数据集正在成为其护城河。 00:00 引言 00:47 数据市场简史:从众包到代理数据 02:29 RL环境是什么:世界、应用、任务 03:57 为什么只有人类能衡量前沿 05:35 构建验证器是难点 06:44 详解:一个真实的法律RL环境 08:18 排行榜——以及开放权重改变了什么 09:45 Apex Agents的训练后结果 11:17 公司购买数据的三种方式 12:49 Q&A: 如何为数据定价? 14:17 Q&A: “数据质量”到底意味着什么 16:42 Q&A: 对合成数据的误解 18:17 Q&A: 为什么现在讨论RL环境——接下来是什么 21:20 Q&A: 能否用模型扩展量规生成? 23:00 Q&A: 用于网络防御的RL环境 25:33 Q&A: 内部构建数据还是合作?