哈维如何在预算内建立研究实验室 | 加布·佩雷拉

哈维如何在预算内建立研究实验室 | 加布·佩雷拉

一家应用公司如何与拥有更多资金、人才、算力和数据的顶尖实验室竞争?在红杉资本的“掌握你的智能”活动中,哈维联合创始人兼总裁加布·佩雷拉分享了策略:利用前沿生态系统,而不是一切自建。 加布讲述了哈维如何建立其研究实验室,从LegalAgentBench等基准测试及其开源尽职调查数据集开始,利用领域专家指导合成数据生成,与多家新实验室合作进行后训练,并构建服务和评估基础设施,以自信地将模型投入生产。他解释了为什么开源权重模型首次使得后训练变得值得,以及为什么每家公司最终都需要这个策略的某种版本。 00:00 引言 00:37 在预算内建立研究实验室 02:28 法律代理基准、合同和尽职调查数据集 03:57 领域专家指导合成数据生成 05:23 哈维为何开源其数据集 06:55 与新实验室合作——以及为什么不止一个 08:20 内部后训练:构建“助理1号” 09:44 模型服务矩阵:60个国家、备用方案、服务等级协议 11:05 决定什么留在生产中 12:29 简单的开源切换和模型路由 13:55 点球成金:“如果我们在这个预算下获胜,我们就改变了游戏规则” 14:53 问答:使用敏感数据进行训练 17:16 问答:争夺研究人才 18:46 问答:设计真正挑战前沿模型的评分标准 20:19 问答:流程中的瓶颈——数据、研究还是基础设施 22:59 问答:开源基准测试中的张力 25:02 问答:最大的未解决问题 27:10 问答:与横向产品竞争