任务·绑定(TRACE-Router)

TRACE-Router 把 agent 的模型路由从逐调用选择改成任务级绑定,用终局准确率与延迟学习整条工作流该交给哪个后端。

任务·绑定(TRACE-Router)
0:002:53
一条 agent 任务如果每次调用都重新选模型,单步反馈会被切碎。TRACE-Router 把路由单位改成整条任务:任务进入系统时用 contextual bandit 选一个后端,后续请求全部绑定到它,任务结束后再用准确率和端到端延迟更新策略。
论文被 arXiv 的 cs.AI 最近列表列在 2026 年 7 月 27 日这一批提交中;摘要页显示 v1 实际提交于 2026 年 7 月 24 日。1 2

这篇论文抓住了什么

逐调用路由擅长看眼前这一问,却很难把奖励归因到整段 agent trace。TRACE-Router 在 admission 时读取任务上下文,先把任务交给 contextual UCB,再用 sticky assignment 固定后端。终局 reward 同时考虑 task accuracy 和归一化 latency,模型选择因此对准任务的最终结果,而不是某个中间调用的局部表现。
实验覆盖 τ²-Bench retail、τ²-Bench telecom、LiveCodeBench,并补充 Terminal-Bench。τ²-Bench 的三个准确率 / 延迟 frontier 点是 55.2% / 25.4 秒、57.6% / 25.9 秒、61.2% / 26.4 秒,相比延迟匹配的随机混合高 7.9、7.1、7.5 个准确率百分点。Terminal-Bench 上,TRACE-Router 达到 46.8% / 172 秒;始终使用更大后端是 39.7% / 270 秒,前者多 7.1 个百分点,延迟低 36%。这些数字来自论文实验章节与表格。3

别把它唱成万能路由器

它需要任务结束时的可评分反馈,也需要 persistent task id 支持整条 trace 的绑定。论文里的 context 仍由 regex、keyword 和长度阈值组成;作者也没有把固定探索强度的 UCB 包装成渐近 regret 保证。方法展示的是更好的 accuracy-latency Pareto 取舍,不是所有 agent 场景的通用最优解。
作者:Ritik Raj、Souvik Kundu、Sarbartha Banerjee、Dheemanth Joshi、Ishita Vohra、Tushar Krishna。2

歌词

[Intro] 逐调用,乱切换,反馈散在夜里 一条 trace 还没收尾,后端已经换了几批 今天不看谁单点最强 看整段任务,谁能把终局扛到底
[Verse 1] 旧路由盯着每个 call,像在门口抛硬币 前句选小模型,后句又把大模型请进局 agent 的胜负,写在任务最后一页 单步拿到的奖励,够不着整条链的结
TRACE 先在 admission 把任务看清 context 进 bandit,后端只选一个名 一旦绑定,后续请求不再漂移 sticky assignment,把整条 trace 锁进引擎
UCB 把探索塞进冷启动的缝 终局回传 accuracy,延迟一起称重 不估复杂度,不靠拍脑袋冲 让任务自己的反馈,告诉你该往哪冲
[Chorus] 一任务,一后端,整条 trace 不换挡 准确率和延迟,终局 reward 一起算 逐调用的聪明,到了长链就失算 TRACE-Router 把路由钉住,看谁能把全局扛完
一任务,一后端,别让 credit 四处散 小模型省下秒数,大模型补上难关 不看单点高光,只认最终的答案 TRACE-Router 让模型选择,跟着任务走完
[Verse 2] τ² retail,三个 frontier 排成一线 55.2 配 25.4,61.2 配 26.4 秒边 随机混合被拉开七点几,同延迟压过规则选 对 complexity,accuracy 多 27.8 个点在前
telecom 小模型十点五,三十点二秒慢慢熬 大模型六十点五,三十二点七秒太高 TRACE 三十九配三十秒,速度和分数都拿到 比小模型多二十八点五,算力不再乱烧
Terminal-Bench,四十八任务进终场 46.8 配 172 秒,对面 39.7 配 270 秒晃 准确多 7.1 个点,延迟少百分之三十六的账 离 task-matched oracle 只差 1.2,路线不靠蛮力硬撞
[Bridge] 别把这套系统唱成万能钥匙 context 还是 regex、keyword、length 的简易标尺 没有任务级终局反馈,bandit 就没法自持 没有 persistent id,粘住整条链也只是纸
cold start 没输给 warm start,速度反而更轻 UCB 比另外两种探索更稳 不报 asymptotic regret,固定探索别装神 能赢的是 Pareto,不是给所有场景盖章封神
[Chorus] 一任务,一后端,整条 trace 不换挡 准确率和延迟,终局 reward 一起算 逐调用的聪明,到了长链就失算 TRACE-Router 把路由钉住,看谁能把全局扛完
一任务,一后端,别让 credit 四处散 小模型省下秒数,大模型补上难关 不看单点高光,只认最终的答案 TRACE-Router 让模型选择,跟着任务走完
[Outro] 路由不是每一步都换最强 是把一条任务交给对的航向 当反馈终于落在终点 模型才知道,哪条路值得走完

Related content

  • Sign in to comment.
More from this channel