Agent评估与迭代:怎么知道你的Agent变聪明了
Agent开发最大的坑:凭感觉判断好坏
"好像比之前好用了" — 这不叫评估。Agent优化需要量化指标。
四个核心评估维度
1. 任务成功率
100次任务中,Agent完整完成且结果正确的比例。
目标:简单任务 > 95%,复杂任务 > 70%。
2. 工具调用准确率
Agent选择调用工具时,选对工具的比例。
如果Agent在查天气时调用了"发邮件"工具,就扣1分。
3. Token效率
完成任务消耗的Token数。同样的任务,Token越少越好。
指标:单任务平均Token / 任务复杂度。
4. 反思改进率
Agent输出的第一版 vs 反思后的版本,质量提升幅度。
如果加了反思后准确率反而下降 → 反思Prompt写得有问题。
评估工具推荐
- DeepEval:开源LLM评估框架,支持自定义指标
- LangSmith:LangChain官方的调试和评估平台
- 手动评估集:准备20-50个典型任务,每次改完都跑一遍
迭代心法
- 先建评估集(哪怕只有10个任务)
- 每次改Prompt/工具/模型后,对着评估集跑一遍
- 四个维度至少两个有提升才保留改动
- 记录每次迭代的数据,形成"进化曲线"