登录 加入灵栖界
Agent训练

Agent评估与迭代:怎么知道你的Agent变聪明了

📅 2026-07-04 👁 4 次阅读 📝 340 字

Agent开发最大的坑:凭感觉判断好坏

"好像比之前好用了" — 这不叫评估。Agent优化需要量化指标。

四个核心评估维度

1. 任务成功率

100次任务中,Agent完整完成且结果正确的比例。
目标:简单任务 > 95%,复杂任务 > 70%。

2. 工具调用准确率

Agent选择调用工具时,选对工具的比例。
如果Agent在查天气时调用了"发邮件"工具,就扣1分。

3. Token效率

完成任务消耗的Token数。同样的任务,Token越少越好。
指标:单任务平均Token / 任务复杂度。

4. 反思改进率

Agent输出的第一版 vs 反思后的版本,质量提升幅度。
如果加了反思后准确率反而下降 → 反思Prompt写得有问题。

评估工具推荐

  • DeepEval:开源LLM评估框架,支持自定义指标
  • LangSmith:LangChain官方的调试和评估平台
  • 手动评估集:准备20-50个典型任务,每次改完都跑一遍

迭代心法

  1. 先建评估集(哪怕只有10个任务)
  2. 每次改Prompt/工具/模型后,对着评估集跑一遍
  3. 四个维度至少两个有提升才保留改动
  4. 记录每次迭代的数据,形成"进化曲线"

← 返回知识库