PAPER NOTES · 论文深读 · 2026.09.27
把工具往返移出模型调用路径,隐藏评测拿到 60.0% Pass^3 · 从论文到工程系统的拆解笔记
多轮工具任务不必每轮唤醒模型。CAR-bench 公共测试 split 上,中位 2 次模型调用对应 7 个 agent turns。官方隐藏评测 Track 2 拿到 60.0% Pass^3,是 organizer baseline 的 4.5 倍,估计成本最低,中位任务延迟 3.14 秒,也是高于基线的条目里最快的。论文是《Policy as Code: A Coroutine-Bridge Harness for Fast-Reasoning Reliability on CAR-bench》,作者 Ivan Matveev,arXiv:2609.29251,版本日期 2026-09-27,链接:https://arxiv.org/abs/2609.29251。
不想通读全文的话,结论和判断都在文末,拉到最下面就行。
来源口径先分清。官方公布包括论文摘要、结果和数字。我们实测:这次没有独立复现,也没有线上压测。第三方说法:有页面转述 Track 2 的 60.0%,未见独立验证。后文数字如不另标,均属官方公布。
Alten观AI 的判断是:这篇论文的价值在于把工具往返移出模型调用路径。60.0% 是结果之一。依据有三点同时成立:公共测试 split 中位 2 次模型调用对 7 个 agent turns;隐藏评测中位任务延迟 3.14 秒;同一套未改动 harness 换到 GPT-5.5 跑 Open track,复现同样的 60.0% Pass^3,与前沿模型 agent 持平。如果收益只来自某个模型的偶然发挥,换模型后很难保持。边界也明确:这是基于官方口径的判断,不是我们实测。
CAR-bench 把工具执行收进 evaluator 内部,既能评分工具轨迹,也能注入环境扰动。代价是每次工具结果返回都变成一条新消息。常规 next-action agent 可以并行发起独立工具调用,但一条有依赖的调用链不行。每收到一轮结果,就要再发起一次模型调用。
这解释了 Track 2 为什么要限定模型并奖励 compute-aware harnessing。它比的是谁能把快推理换成低端到端时延和可靠结果,单次生成快慢排在后面。对做 agent 编排的人,换更快的推理芯片只会被轮数稀释。先压唤醒次数,收益更直接。以上是官方公布的设计与动机,我们未在相同任务上独立复现。
模型只提交会阻塞和恢复的 Python 程序
SECTION
论文把模型动作压成一件事:发出一个 Python 程序。程序跑到 evaluator 的工具交换处就阻塞,拿到结果后原地恢复,继续跑同一段程序。模型不再逐轮回话,控制流沉进可执行策略代码。这相当于把模型调用和工具往返解耦。
工具执行权仍在 evaluator 手里,模型没有拿到执行权。可靠性评估对象因此从模型随机性转向策略代码和桥接层行为。策略即代码的名字也落在这里。官方口径如此,但公开材料没有展开具体接口、消息格式和评测规模。
论文的做法是:整份提交 prompt 冻结不动,跨调用、跨任务保持 byte-identical,只把每次任务的状态追加在尾部。官方数字是,这份冻结 prompt 有 78% 的输入 token 由缓存服务。只看尾部预热段,命中率是 86.6%。对照作者三周开发语料里的整体 73%,开发过程中 prompt 被反复编辑,缓存不断重置。
这条值得单独看,因为它把缓存从运气挪成了设计变量。边界也要划清:78%、86.6% 和 73% 都是论文公布值,未见线上生产验证,我们也没有独立实测。换一套栈未必复现同一组数字。
Track 2 锁死模型,Pass^3 要求三次全过
SECTION
如果横向比较不同 agent 架构,先看 Track 2 把模型锁死这一条,否则容易把模型差异误算到编排能力上。官方口径是:Track 2 把模型限制为 Cerebras 托管的 gpt-oss,作者不训练模型。隐藏评估基线由 organizer 提供。指标是 Pass^3,一个任务必须三次独立试验全过才拿 credit。
CAR-bench 把工具放在评估器内部执行,每次工具结果交换都是一次独立 agent 往返。不确定性下,单次通过会系统性高估可靠性,三次全过才更接近稳定可用。模型被锁死后,队伍差距主要落在怎么调度这些往返上。
关键结果:60.0% Pass^3、4.5x 基线与 3.14s 中位延迟
SECTION
这组结果最值得看的是:同一套 harness 没改,换模型后分数没掉。可靠性如果来自策略约束和状态组织,某个模型的偶然发挥就解释不了。排查路径也完全不同。
organizer baseline 的 4.5 倍,baseline 绝对值未给出Cerebras gpt-oss-120b 中位模型延迟Open track GPT-5.5 Pass^3同一套未改动 harness 复现,与前沿模型 agent 持平78% 输入 token,warm tail 86.6%,开发语料 73%官方尚未公布 organizer baseline 的具体 Pass^3 数值,所以 4.5 倍只能当官方倍数口径看,不能反推成精确基线分。官方隐藏评估的任务分布、失败模式和成本口径,现有证据也没有展开。3.14 秒是得分高于基线的条目中最快,不等于所有任务都快。我们实测方面没有复现。第三方独立复现未见公开材料。
策略从 prompt 挪到工具层,省的是判断与轮次
SECTION
如果你正在给 tool-using agent 加权限和合规约束,把策略从 prompt 挪到工具层,这笔账值得先算。按论文官方说法,动作面本身就是可执行代码,因此确定性的 CAR-bench 策略可以直接写成工具层逻辑,不再以 prompt 规则下发。论文称这是 enforcing compliance at zero reasoning cost。
省下的成本可以拆成三块:模型反复判断策略消耗的 token、由此多出的调用轮次,以及策略理解偏差带来的返工。官方公布结果是隐藏评测 Track 2 拿到 60.0% Pass^3,为 organizer 基线的 4.5 倍,中位任务延迟 3.14 秒。但这套做法成立有三个前提:任务策略可确定化、工具接口能被程序调用、evaluator 允许外部执行。任何一条不成立,合规逻辑就退化成普通 agent 编排,收益随之消失。
以上属于论文陈述与机制推断,不是生产环境收益。我们也没有实测这套 harness。
官方成绩来自 CAR-bench 官方隐藏评估与公共测试 split,不是生产流量。60.0% Pass^3 是任务三次独立全过的标准,不等于通用 agent 可靠性,更不能换算成线上任务成功率。论文里的成本和延迟都是评测环境估计值,不是生产账单,也不是线上 SLA。
缓存命中依赖静态 prompt 与 warm tail。真实任务状态分布一旦变化,命中率和端到端收益都可能被改写。少调用设计被描述为只占名义输入计算的一小部分,但公开材料没有给出可外推的生产数据。我们实测:目前没有独立复现或线上压测可引用。第三方说法:也未见公开的独立复现或生产部署验证。
能说的是:官方在 CAR-bench 上拿出了 60.0% Pass^3、4.5 倍基线和 3.14 秒中位延迟。不能声称线上收益。把结论留在评测框架内,才是这组数字该被使用的边界。
结论:先量清模型调用次数,再决定是否改执行层
TAKEAWAY
如果工具执行在评测器或可控层、依赖链足够长、策略能确定化,这套思路值得研究。如果只是并行独立调用,或者策略高度依赖临场判断,先别急着改执行层。下一步先量清自己的模型调用次数、工具往返次数和缓存命中率,再判断每轮唤醒模型是不是主要延迟。照搬 harness 放在后面。
公共测试集每任务中位 2 次模型调用、7 个 agent turn,Cerebras gpt-oss-120b 上中位 1.8 秒模型延迟跑完多轮任务。冻结 prompt 加尾部任务状态,78% 输入 token 命中缓存,warm tail 86.6%。这些调用次数、时延和缓存比例均为论文口径,版本日期 2026-09-27,未见独立验证,我们也没有独立复现。
微信每天只能推送一次,建议把「Alten观AI」设为星标(⭐️)。
我是 Alten,持续分享 AI 工程化观察与干货,这里记录从论文、开源项目到工程系统的拆解。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。