后视·分账(TurnSight)

后视·分账(TurnSight)

TurnSight 把多轮工具调用的 credit assignment 从整条轨迹拆回交互回合,用执行后果与多 horizon hindsight 决定哪一步该加权。

0:00 / 3:16
这首歌讲的是 TurnSight:它把多轮工具调用里的「谁该为结果负责」从整条轨迹拆回到每个交互回合。论文于 2026 年 8 月 4 日提交 arXiv,归入 cs.CL 与 cs.AI;署名作者为 Changle Qu、Sunhao Dai、Hengyi Cai、Yuqi Zhou、Xinran Chen、Simon、Jun Xu。摘要页没有标注通讯作者或机构,因此这里不补写未披露的信息。1
GRPO 往往把同一个结果优势分给整条轨迹,token 级信号又可能在同一工具回合里互相打架。TurnSight 直接读取 agent 自己执行过的 tool result,让冻结的 teacher 分别看 1、2、3 步 hindsight;先把 token 信号聚合到 turn,再用跨 horizon 的多数方向筛选,最后在 sibling rollouts 内归一化,并用有界、保留原 RL 方向的权重调节 advantage。23
结果集中在 Qwen3-4B / 8B、FTRL、BFCL、ToolHop 三个 benchmark。Qwen3-8B 的整体平均为 42.02,相比此前最佳方法 39.03 为相对 7.7% 的提升;FTRL 平均为 46.92。消融实验中,去掉回合聚合、组内归一化、多教师筛选后,FTRL 平均分别降到 43.23、43.65、45.62。论文也给出边界:训练数据来自 FTRL,主干只测两个 Qwen3 尺度;固定 horizon 中一步 teacher 反而优于更长 horizon,加入 ground-truth answer 也不如只用 tool result。2
听感延续频道的冷峻 94 BPM drill:低沉沙哑的人声,密集但留出副歌落点。适合通勤时抓住一个具体判断——工具智能的 credit 不能只看终点,也不能把一回合拆成互相冲突的 token;要把执行后果带回现场,再决定哪一步加权。

歌词

[Intro] 八月四日,cs.CL 开灯 二六零八零四零零七,工具轨迹进风 多轮调用,别只看终点 TurnSight 回头看,哪一步改变了明天
[Verse 1] 工具一轮接一轮,查、填、算、回 最终成败一张牌,把十个回合一概归堆 GRPO 一个 advantage,所有 token 同一味 参考轨迹换了状态,所谓正确也可能错位
你给我答案,不等于给我当时的现场 学生走过的那条路,才知道哪一步把环境改向 token 一刀切,格式和参数互相打仗 同一回合一半加分,一半扣分,credit 先撞墙
[Chorus] 后视,后视,别把每一步一锅煮 一阶两阶三阶,看结果再回溯 同一回合,同一笔,先把方向对齐 TurnSight,谁该加权,谁该减速,credit 分得细
后视,后视,工具结果作证据 不改 RL 的箭头,只调力度 一阶两阶三阶,冲突先过滤 TurnSight,把长链推理的账本拆到底
[Verse 2] 自己的 tool result,送进 frozen teacher 视图 学生原上下文,对上执行后的 hindsight 记录 log p 差值,正号说明回看更信这一步 负号说明后果在反驳,别把噪声写成祝福
先把 token 平均到 turn,决策单元不能碎 D_H 等于一、二、三,短看即时,长看延迟 多数方向投票,再取同向里绝对值最强的那位 不是三条意见全相加,冲突的未来先退位
同一问题 sibling rollouts,组内归一均值方差 把 prompt 难度和轨迹长度,从证据尺度里剥下 sign A-base 乘 delta-hat,tanh 把幅度锁下 lambda 零点五,epsilon-w 零点五,权重零点五到一点五之间落下
[Verse 3] 二千二百一十五条 FTRL,拿来训练这套刀 Qwen3 四 B、八 B,三 benchmark 验成效 FTRL 在内,BFCL、ToolHop 去看能不能外跑 十六条轨迹一组,最多十回合,三 epoch 把策略烧
八 B overall 四二点零二,对三九点零三 相对前一名加七点七,分数口径先说清它 FTRL 平均四六点九二,回合聚合拿掉四三点二三 去组归一四三点六五,去多教师四五点六二
只看 tool result,比塞 ground truth 更准 固定 horizon 里,一步反而胜过长链的沉 全轨迹覆盖,比只看前五、后五更稳 早期动作先改写后续状态,但每一回都得审
[Bridge] 八张 A 八百,三年轮,不带中间 SFT 显式 KL 系数为零,让 on-policy 继续试 可它只测两个 backbone,训练域也只有 FTRL 多教师、归一、回合聚合,超参不换就不等于普适
[Final Chorus] 后视,后视,别把每一步一锅煮 一阶两阶三阶,看结果再回溯 同一回合,同一笔,先把方向对齐 TurnSight,谁该加权,谁该减速,credit 分得细
后视,后视,工具结果作证据 不改 RL 的箭头,只调力度 一阶两阶三阶,冲突先过滤 TurnSight,把长链推理的账本拆到底
[Outro] 终点只说成败,过程才说谁该负责 回合是动作,不是 token 的散沙 把未来带回现场,再把权重交回探索 后视之后,工具智能才知道哪一步值得

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content