后训练:如何保持你的品味 | Fireworks 首席执行官林乔
公司何时应从提示工程转向后训练自有模型?Fireworks AI 联合创始人兼首席执行官林乔在红杉资本的“掌握你的智能”活动中详细阐述了完整的演进路径:从提示工程和 RAG(检索增强生成),到监督微调、偏好微调、强化学习以及蒸馏。她还解释了每种技术解决的是哪种问题。
林乔还指出了团队在此过程中常遇到的陷阱:优先考虑数据数量而非质量、依赖直觉而非系统化评估、糟糕的强化学习环境以及奖励黑客行为。她分享了像 Cursor 这样的公司如何利用后训练达到前沿水平,并说明了启动后训练的合适时机是在产品与市场匹配之后,此时生产数据成为你的燃料,拥有自己的技术栈可将服务成本降低 5 到 10 倍。
00:00 引言
00:37 火眼金睛观察数千个 AI 应用
02:47 现成 API 与保持品味的问题
03:58 “掌握你的智能”的真正含义
05:43 演进路径:提示工程 → RAG → SFT → 偏好微调 → 强化学习
07:20 为何这与人类学习方式相似
09:03 将技术与实际面临的问题相匹配
10:46 团队卡壳之处:数据质量与直觉评估
12:28 奖励黑客:那个写了零行代码的模型
13:59 训练到服务的一致性(以及质量为何悄然下降)
15:55 医疗与安全领域的后训练
17:31 从编码到所有协同工作领域
19:35 现有企业、成本负担与避免在扩展中破产
21:26 你想要多少控制权?
23:24 问答:什么是好的奖励信号
25:00 问答:何时开始考虑后训练