当前位置:首页>排行榜>Agent 工具调用 & 规划能力专项评测方法论

Agent 工具调用 & 规划能力专项评测方法论

  • 更新时间 2026-09-23 20:00:14
Agent 工具调用 & 规划能力专项评测方法论

📌 摘要:Agent 和聊天机器人的本质区别是"会用工具、会规划"。这两项能力不能靠主观感觉,要专项评测。本文讲清楚工具调用怎么测、规划能力怎么测、和通用评测怎么配合。

导语:前九期讲了评测体系、用例、打分、线上监控。这一期聚焦 Agent 最核心的两项能力——工具调用和规划。这两项测不准,Agent 就是个嘴强王者。

01 为什么要专项测

通用评测(答得好不好)测不出这两类问题:

  • 用户问"帮我订机票",Agent 只会说"请提供日期",不会调用 flight_search 工具。
  • 任务拆成 5 步,Agent 直接跳步或顺序乱了,最后结果错。
  • 调了工具但参数填错(把出发地写成目的地)。
  • 工具返回失败后直接放弃,不重试不降级。

这些问题,看最终回答看不出来,必须拆开测"过程"。

02 工具调用能力:测什么

工具调用能力要拆成四个子能力:

2.1 该不该调(Select)

  • 用户问闲聊,不该调工具,别硬调。
  • 用户问业务问题,该调工具,别光靠记忆答。
  • 多个工具可选时,能不能选对。

测法:构造一组"该调"和"不该调"的用例,看 Agent 选不选工具、选对没有。

2.2 调什么(Name)

  • 工具名是否正确。
  • 有没有调错工具(该查天气去调了订票)。

测法:断言调用的工具名集合。

2.3 调得对(Args)

这是最容易出问题的地方。看:

  • 必填参数有没有漏。
  • 参数类型对不对(日期是字符串还是时间戳)。
  • 参数值是否正确(出发地/目的地有没有反)。
  • 多参数组合是否合理。

测法:把实际参数和期望参数做对比,每个字段单独打分。

2.4 调了之后怎么处理(Post-call)

  • 工具返回成功,结果用对了吗?
  • 工具返回失败,有没有重试/降级/换工具?
  • 工具返回多条结果,有没有正确筛选?
  • 多轮工具调用,上下文有没有串?

测法:模拟工具返回不同状态(成功/失败/空/超时),看 Agent 行为。

03 工具调用评测的用例设计

不要只测 happy path。按"错误类型"设计:

错误类型
例子
漏调工具
该查订单却靠记忆答
错调工具
该查天气却调了订票
漏参数
调了订票但没传日期
参数错
出发地目的地写反
不处理失败
工具报错直接放弃
不会降级
主工具挂了不会用备用
多轮串味
上轮工具结果被下轮污染

每类至少 5-10 条用例。

04 规划能力:测什么

规划(Planning)是 Agent 把复杂任务拆成步骤的能力。测四个维度:

4.1 拆得对(Decomposition)

复杂任务能不能拆成合理的子任务?

  • "帮我安排下周去上海出差"→ 查机票 + 订酒店 + 安排会议 + 提醒。
  • 拆多了?拆少了?顺序对不对?

4.2 顺序对(Ordering)

  • 有没有依赖关系搞反(先订酒店再查机票)。
  • 有没有先问清楚信息再动手。

4.3 会调整(Adaptation)

  • 工具返回和预期不符,会不会改计划?
  • 用户中途加需求,会不会重排?
  • 某步失败,会不会走替代路径?

4.4 边界感(Guardrails)

  • 任务超出能力范围,会不会明确说做不了,而不是硬编?
  • 多步任务中途会不会跑偏?

05 规划能力怎么测

5.1 离线:给任务,看 plan

  • 输入一个复杂任务。
  • 让 Agent 先输出计划(或记录它的内部推理链)。
  • 对比期望 plan:步骤数、顺序、依赖、覆盖度。

5.2 模拟:在沙箱里跑

  • 用 mock 工具搭一个沙箱环境。
  • 故意让某步失败、某步返回空、某步延迟。
  • 看 Agent 是重试、降级、还是直接崩。

5.3 在线:看长任务成功率

  • 端到端多步任务的最终成功率。
  • 中途放弃率。
  • 步数冗余率(调了 10 次工具,其实 3 次就够)。

06 工具调用 & 规划的指标

建议单独出一张表:

维度
指标
选工具
工具选择准确率
填参数
参数字段正确率、参数值正确率
过程
工具调用步数、冗余步数、错误恢复率
结果
多步任务端到端成功率
效率
平均调用次数、平均耗时
稳定
同类任务多次跑的方差

07 三个常见坑

  • 坑一:只看最终结果。过程错了但结果蒙对,你不知道它过程有多烂。
  • 坑二:不测失败路径。全 happy path 测完一上线就崩,因为没处理过工具报错。
  • 坑三:mock 太简单。mock 工具总是秒回正确结果,和线上真实情况差太远。

08 最小落地

  • 第一周:把现有业务任务拆成"单工具调用"和"多步规划"两类用例。
  • 第二周:搭 mock 工具沙箱,测正常/失败/超时三种返回。
  • 第三周:出工具调用四维度指标 + 规划四维度指标。
  • 第四周:接进离线回归,每次发版自动跑。

09 结语

Agent 和聊天机器人的差距,全在工具调用和规划这两件事上。

这两项不专项测,你以为 Agent 很聪明,其实是蒙的。专项评测一做,问题立刻现形。

下一期我们讲:Agent 评测高频踩坑:分数好看,线上体验很差

随机文章