📌 摘要:Agent 和聊天机器人的本质区别是"会用工具、会规划"。这两项能力不能靠主观感觉,要专项评测。本文讲清楚工具调用怎么测、规划能力怎么测、和通用评测怎么配合。
导语:前九期讲了评测体系、用例、打分、线上监控。这一期聚焦 Agent 最核心的两项能力——工具调用和规划。这两项测不准,Agent 就是个嘴强王者。
01 为什么要专项测
通用评测(答得好不好)测不出这两类问题:
- 用户问"帮我订机票",Agent 只会说"请提供日期",不会调用 flight_search 工具。
- 任务拆成 5 步,Agent 直接跳步或顺序乱了,最后结果错。
这些问题,看最终回答看不出来,必须拆开测"过程"。
02 工具调用能力:测什么
工具调用能力要拆成四个子能力:
2.1 该不该调(Select)
测法:构造一组"该调"和"不该调"的用例,看 Agent 选不选工具、选对没有。
2.2 调什么(Name)
测法:断言调用的工具名集合。
2.3 调得对(Args)
这是最容易出问题的地方。看:
测法:把实际参数和期望参数做对比,每个字段单独打分。
2.4 调了之后怎么处理(Post-call)
测法:模拟工具返回不同状态(成功/失败/空/超时),看 Agent 行为。
03 工具调用评测的用例设计
不要只测 happy path。按"错误类型"设计:
每类至少 5-10 条用例。
04 规划能力:测什么
规划(Planning)是 Agent 把复杂任务拆成步骤的能力。测四个维度:
4.1 拆得对(Decomposition)
复杂任务能不能拆成合理的子任务?
- "帮我安排下周去上海出差"→ 查机票 + 订酒店 + 安排会议 + 提醒。
4.2 顺序对(Ordering)
4.3 会调整(Adaptation)
4.4 边界感(Guardrails)
- 任务超出能力范围,会不会明确说做不了,而不是硬编?
05 规划能力怎么测
5.1 离线:给任务,看 plan
- 让 Agent 先输出计划(或记录它的内部推理链)。
5.2 模拟:在沙箱里跑
5.3 在线:看长任务成功率
- 步数冗余率(调了 10 次工具,其实 3 次就够)。
06 工具调用 & 规划的指标
建议单独出一张表:
07 三个常见坑
- 坑一:只看最终结果。过程错了但结果蒙对,你不知道它过程有多烂。
- 坑二:不测失败路径。全 happy path 测完一上线就崩,因为没处理过工具报错。
- 坑三:mock 太简单。mock 工具总是秒回正确结果,和线上真实情况差太远。
08 最小落地
- 第一周:把现有业务任务拆成"单工具调用"和"多步规划"两类用例。
- 第二周:搭 mock 工具沙箱,测正常/失败/超时三种返回。
- 第三周:出工具调用四维度指标 + 规划四维度指标。
09 结语
Agent 和聊天机器人的差距,全在工具调用和规划这两件事上。
这两项不专项测,你以为 Agent 很聪明,其实是蒙的。专项评测一做,问题立刻现形。
下一期我们讲:Agent 评测高频踩坑:分数好看,线上体验很差。