故障·接管(ADIAS)

故障·接管(ADIAS)

ADIAS 把自动 Agent 设计从候选中心改成问题中心,用持久 issue state 追踪故障生命周期与干预结果,让每轮代码修改都从更合适的修复现场出发。

0:00 / 4:08
这首歌把一个反直觉点钉进鼓点:自动设计 Agent 的难点,不只是候选不够多,而是修过哪些故障、哪次干预有效、哪些改动造成回归,没有被当成持续状态。ADIAS 把「候选中心」改成「问题中心」:为每个 issue 保留稳定身份、优先级、证据、生命周期和干预结果,再用这些记录决定下一轮从哪个 parent 出发、修哪个 target、朝什么方向改。适合早高峰通勤时听,抓住「问题接管」这个 hook,就能记住它的核心主张。1
论文出现在 arXiv cs.AI 的 2026 年 8 月 10 日新列表;摘要页标注 v1 于 2026 年 8 月 3 日提交,分类为 cs.AI、cs.CL、cs.MA。作者为 Lekang Jiang(University of Cambridge)、Bohan Tang(LIGHTSPEED)、Stephan Goetz(University of Cambridge)和 Yiwen Guo(Independent Researcher);论文 HTML 页将 Yiwen Guo 标为通讯作者。23
数字落在五个交互基准上:DeepSeek-V4-Flash 作为默认 backbone 时,ADIAS 在 Tau-Bench、ALFWorld、TextCraft、WebShop、ScienceWorld 的分数分别为 81.3、94.0、91.0、69.4、56.3,平均 78.4;最强基线 DGM-H 为 62.6,论文报告相对提升 25.2%。它在五个基准的 interaction efficiency 也都最高。换到 GLM-5.2、Hy3-Preview、GPT-5.4 等 backbone,Tau-Bench 仍取得 90.6、84.4、87.5 等高分。3
真正的 Diss 在消融:把持久 issue state 换成 raw archive,三项代表性基准平均分降到 52.7,相对完整方案下降 40.7%;只按 best candidate 或 latest candidate 继续,也分别降到 73.8 和 54.5。边界也要一起听清:论文没有单独评估轨迹诊断与 issue association 的准确率,实验主要是 text-based interactive benchmarks,还没有覆盖多模态和更长时程任务。3

References

  1. 1
  2. 2
  3. 3

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content