何时构建你自己的 Agent Harness | Harrison Chase, LangChain
智能体(Agent)是一个编排模型和上下文的 harness。如果你想拥有自己的智能,你可能需要同时拥有这三者。LangChain 联合创始人兼 CEO Harrison Chase 聚焦于 harness:这个循环在正确的时间将正确的上下文提供给模型,以及如何通过中间件、钩子和子智能体来定制它。
在 Sequoia Capital 的 Own Your IntelligenceI 活动中,Harrison 解释了何时现成的 harness 就足够了,何时需要构建自己的 harness(你的任务越偏离分布,你就越需要定制),以及为什么即使是自定义 harness 也应该将分布内的部分(如文件编辑)保持接近每个模型的训练方式。他还涵盖了构建基准测试、为什么可观测性在调试智能体时被低估,以及将生产轨迹转化为 harness、模型和上下文改进的数据飞轮。
00:00 引言
00:58 智能体的三个部分:harness、模型、上下文
02:12 harness 实际做什么
03:25 使用中间件定制核心循环
04:41 沙箱、文件系统、子智能体、摘要
05:47 认知架构——以及何时仍然需要它们
07:03 构建自己的 harness 还是使用现成的?
08:24 分布内与分布外:文件编辑示例
09:39 为什么评估(evals)定义了一个组织中“好”的含义
11:04 Harbor:一个评估任务实际的样子
12:11 在准确性、延迟和成本方面比较 harness 和模型
13:20 为什么可观测性被低估——通常问题在于上下文
14:34 数据飞轮:轨迹 → 筛选 → 实验
15:42 通过 UX 设计和在线评估者获取反馈
16:51 演示:LangSmith Engine
19:23 问答:在 Engine 上运行 Engine,以及“codex 化”
20:44 问答:harness 会趋同还是分化?