RL环境解析:AI代理如何学习真实世界的工作 | Brendan Foody, Mercor
RL环境已成为AI训练数据中最热门的话题。但它们到底是什么?在Sequoia Capital的Own Your Intelligence活动中,Mercor首席执行官Brendan Foody分解了三个组成部分:世界(真实项目中的消息、文档和文件)、应用(Salesforce和Google Workspace等工具的高保真克隆)以及任务(提示与基于量规的验证器配对)。他详细介绍了与顶级律所律师共同构建的真实法律环境,并分享了训练后的结果,显示了在适度计算下领域特定任务的显著提升。
Brendan还涵盖了为什么人类在衡量前沿方面仍然不可或缺,Mercor如何为数据定价,从众包标注到专家构建环境的转变,以及下一步:超长期任务和虚拟同事。他认为,曾经仅限于前沿实验室的技术现在正在进入应用公司,而他们构建的数据集正在成为其护城河。
00:00 引言
00:47 数据市场简史:从众包到代理数据
02:29 RL环境是什么:世界、应用、任务
03:57 为什么只有人类能衡量前沿
05:35 构建验证器是难点
06:44 详解:一个真实的法律RL环境
08:18 排行榜——以及开放权重改变了什么
09:45 Apex Agents的训练后结果
11:17 公司购买数据的三种方式
12:49 Q&A: 如何为数据定价?
14:17 Q&A: “数据质量”到底意味着什么
16:42 Q&A: 对合成数据的误解
18:17 Q&A: 为什么现在讨论RL环境——接下来是什么
21:20 Q&A: 能否用模型扩展量规生成?
23:00 Q&A: 用于网络防御的RL环境
25:33 Q&A: 内部构建数据还是合作?