1/3

本周 AI 论文速览:医疗智能体、PPT 任务、文献搜索

本期精选固定周窗口内的三篇 AI 论文:Microsoft 的医疗智能体评测、CMU 与 Microsoft 的 PowerPoint 任务基准,以及 Stanford 参与的科学文献搜索智能体。三张卡片快速看清机构、方向和核心创新点。

本期按 2026-06-29 至 2026-07-05 的固定周窗口筛选,选入 3 篇新提交论文。上一期已经写过的 PAT、ENPIRE、Mandol 不再重复。

01 HealthAgentBench:医疗智能体终于有了更像临床工作的考场

HealthAgentBench 由 Microsoft 团队提交,论文页显示 v1 提交时间为 2026-06-30;项目页把基准拆成 54 个任务、7 类医疗流程,覆盖文本、EHR、2D、3D、WSI 五种模态和诊断、治疗、数据、研究四类流程阶段。1 2
这篇的价值不在于又加一个榜单,而是把智能体放进可执行的医疗环境里做事。项目页当前 leaderboard 显示,最强条目 Codex (GPT 5.5) 在 54 个任务的三次尝试池化口径下成功率为 42%,说明前沿智能体离稳定处理复杂医疗工作流还有明显距离。1

02 PPT-Eval:看智能体会不会真的改好一份 PPT

PPT-Eval 的项目页列出作者机构包括 Carnegie Mellon University 和 Microsoft;arXiv 页显示 v1 提交时间为 2026-06-30,并注明该论文进入 ICML 2026。3 4
它把 PowerPoint 创建和编辑拆成 120 个任务、12 个文件,并用任务级评分细则给中间步骤部分信用。项目页给出的人工一致性指标是 Kendall's tau-b 0.77;在该基准上,Claude-4.5-Opus 的成功率为 45%,平均部分分为 57%。3

03 PaperPilot:把文献搜索做成可编辑的工作流

PaperPilot 由 UIUC、Together AI、University of Pennsylvania 和 Stanford University 作者提交,arXiv 页显示 v1 提交时间为 2026-07-01。论文把多轮科学文献搜索定义为 workflow induction:围绕 anchor paper 和用户查询,构造包含关键词搜索、引用扩展、过滤、打分、重排和证据抽取的可执行 DAG。5
实验里,PaperPilot-9B 相比基础 Qwen3.5-9B 工具智能体,在多轮交互下把 Hit@5 从 58.0 提高到 77.0,MRR 从 47.5 提高到 59.4,nDCG@10 从 26.8 提高到 32.5,同时把工作流执行错误从 9.5% 降到 0%。5
三张卡片的共同线索很清楚:本周不是在比谁的模型名字更响,而是在补齐智能体评测的真实任务环境,从临床流程、办公软件到科研检索,重点都落在「能不能完成可检查的工作」。

Contenido relacionado

Comentar

Inicia sesión para comentar.