持续学习:AI 代理如何通过每次使用变得更好 | Arjun Karanam, Trajectory
如今的人工智能模型越来越智能,但每次对话感觉都像是它们第一天上班。Trajectory 联合创始人 Arjun Karanam 称这种情况为"经验鸿沟":模型在智商上不断进步,但在经验方面却没有提升。持续学习旨在缩小这一差距,将那些被丢弃的、数以万亿计的代理交互令牌转化为信号,使代理每次使用都变得更好。
在红杉资本举办的"Own Your Intelligence"活动中,Arjun 为希望实现这一目标的企业提出了四个目标:完全可追溯性(包括子代理以及编辑、重试等纠正行为)、基于真实生产流量的评估、能让代理自主编排而非限制它们的"工具链",以及习惯在开放权重上运行。他还讨论了哪些内容应该训练到模型中,哪些应该留给工具链,以及如何在不使用客户数据的情况下从交互中学习。
00:00 引言
00:12 构建持续学习平台
01:33 经验鸿沟:模型有智商但没有资历
02:52 可追溯性 → 模型规范 → 更好的模型和工具链
05:27 对代理生态系统的四个期望
06:34 期望1:追踪完整树结构——并捕捉修正行为
08:03 期望2:基于真实流量的评估,在真实工具链中评分
09:26 期望3:让代理自由发挥,并使工具响应信息丰富
10:34 期望4:习惯在开放权重上运行,尝试使用路由器
11:51 为什么"拥有你的智能"不应被外包给咨询
13:15 演示:导入基准、训练模型、部署
14:28 问答:可训练的对象是什么——权重、工具链还是上下文?
16:08 问答:在不使用客户数据的情况下进行持续学习
17:13 问答:情景记忆与反馈层级
19:37 问答:持续学习最关键的领域