Linear如何在其AI代理上运行评估

Linear如何在其AI代理上运行评估

"每当用户做了我们没预料到的事,我们就把它加入评估集。它们会随着时间增长。" 来自 Jacob(Linear 工程师): "我们有评估,其中很多来自实际使用。用户做了我们没预料到的事,我们就把它加入数据集,评估集随着时间增长。我们尝试混合客观和主观指标。如果用户说‘进行中’,确保它总是将状态设为进行中。这是确定性的。然后还有主观的东西,比如你是否把描述组织得很好。对于这个,我们用LLM作为评判。" 📌 观看下方完整对话。