arXiv AI 前沿日报|8 月 12 日:推理窃取、视频问诊与 314B MoE

本期按直接社区信号精选三篇:跨模型解码隐藏推理、AMIE 视频问诊 OSCE 与 Motif 3 314B MoE,并把三个大数字能推到哪一步说清。

这期最容易被三个大数字带着跑:315,320 个推理块、83% 对 68%、314B 参数。它们都是真的,但分别不能直接推出「攻击现在仍可复现」「AI 已能接诊真实患者」「模型全面领先」。
三篇都来自 arXiv 最新公告批次:Stolen Thoughts 与 AMIE (Video) 的 v1 分别是北京时间 8 月 11 日 01:24:50、01:19:31,Motif 3 是 8 月 10 日 12:53:05。排序只计已打开的 X/Twitter、Hacker News 具体原帖,互动数保留平台原生口径,不跨平台相加;正文只摘录与排序有关的字段,未列字段不等于零。Reddit 找到了对应帖子,但本轮无法打开详情复核原生互动,因此不写入数字。

1. Stealing Reasoning Traces:密文挡住了人,却没挡住同厂弱模型

论文:Stealing Reasoning Traces from Proprietary LLM APIs(arXiv 2608.09867v1:2026-08-11 01:24:50(北京时间)1
作者与机构:Alexander Panfilov—MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Tübingen AI Center;David Schmotz—ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Tübingen AI Center;Ilia Shumailov—AI Sequrity Company(论文原文拼写);Luca Beurer-Kellner—Snyk;Joachim Schaeffer—MATS Research;Ameya Prabhu—ELLIS Institute Tübingen、Tübingen AI Center、University of Tübingen;Jonas Geiping、Maksym Andriushchenko—ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Tübingen AI Center。2
论文发现,Claude、GPT、Gemini API 返回的加密推理块,在同一提供商内部可以跨会话、跨用户、跨模型重放。攻击者把强模型的推理块塞进同厂较弱模型,再用固定提示要求它逐字转写;弱模型便成了解码器。作者测试的是 2026 年 7 月初的 API,并未直接越狱强模型。2
团队从 6,708 条公开 agent 会话恢复 315,320 个推理块。若只看真实用户会话,去重后有 704 件敏感工件,其中 64 件只存在于隐藏推理里;328 条会话至少泄露一项真实敏感信息,占 4.9%。摘要里的 367 件 PII 与 182 组凭据混入 benchmark 口径,不能和这组数字合并。2
最重要的边界不是实验规模,而是漏洞已经修复或缓解。作者在发布前向 Anthropic、OpenAI、Google、Microsoft 与 Hugging Face 披露;论文写明各提供商确认收到后,团队已无法再次发起同样攻击。厂商没有公开补丁细节。2
作者帖于北京时间 8 月 11 日 20:00 发布;本轮抓取时为 8,908 赞、1,209 转、236 回复、1,622,544 浏览。HN 原帖于 21:22 发布,抓取时为 473 points、201 comments。34
Loading content card…
精读前先核对:315,320 是解码出的推理块数;真实用户会话里去重后的敏感工件是 704 件。论文证明了攻击链,不代表今天还能按原步骤复现。

2. AMIE (Video):83% 对 68%,不是「AI 看病胜率」

论文:Towards Expert-level Medical AI for Real-time Video Consultations(arXiv 2608.09861v1:2026-08-11 01:19:31(北京时间)5
作者与机构:Google Research(23 人)—Mahvish Nagda、Jihyeon Lee、Matthew Thompson、Roma Ruparel、Akshay Goel、Teya Bergamaschi、Suhana Bedi、Craig Schiff、Joseph Xu、Rebecca Hemengway、Sunny Virmani、Kavi Goel、Dale R. Webster、Katherine Chou、Avinatan Hassidim、Yossi Matias、James Manyika、Yun Liu、Ethan Goh、Christina Chen、Po-Hsuan Cameron Chen、Mike Schaekermann、Anil Palepu;Google DeepMind(17 人)—Chunjong Park、Tim Strother、Valentin Liévin、Meet Shah、Pavel Dubov、Liviu Panait、Toshiyuki Fukuzawa、Sam Schmidgall、Aliya Rysbek、Yana Lunts、Jan Freyberg、David Racz、Carey Radebaugh、Joëlle Barral、Gregory Wayne、Tao Tu、Ryutaro Tanno。6
AMIE (Video) 不是单模型端到端说话。Talker 负责低延迟对话,Perception 在更长音视频窗口里累积体征与情绪线索,Planner 每 10 秒左右更新症状摘要、鉴别诊断与管理目标。三个 agent 异步协作,把平均回合延迟从 21.4 秒降到 2.6 秒。7
主研究用了 100 个临床场景、15 名患者演员和 30 名基层医生。这里的 30 名医生要拆开:10 人负责接诊,另外 20 人独立盲评;三条试验臂是 AMIE 视频、AMIE 文本、医生视频,因此共 300 次模拟咨询。7
83% 对 68% 是 20 名临床评估者对 100 个场景「案例特定评分表」的总体分;91% 对 77% 是鉴别诊断 Top-1 命中率。两组数字都不是治愈率。Top-3 命中率为 98% 对 90%,差异没有统计显著性。7
论文明确写着系统还不能用于真实临床。所有患者都是演员,PCP 还被要求关闭摄像头;儿科、皮肤科、产科、乳腺与妇科场景被排除。眼球震颤识别仅 3%,震颤识别 24%,细微情绪线索也不稳。7
Google Research 帖于北京时间 8 月 12 日 01:08 发布,抓取时 91 赞、11 转、5,296 浏览;Google for Health 帖 01:09 发布,96 赞、19 转、32,953 浏览;Eric Topol 帖 01:40 发布,94 赞、24 转、36,016 浏览。HN 原帖 05:21 发布,抓取时为 2 points、0 comments。891011
Loading content card…
精读前先核对:300 次咨询是 100 个模拟场景乘以 3 条试验臂;83% 对 68% 是评分表总体分,不是临床结局。

3. Motif 3:314B 总参数,只让 13.2B 上场

论文:Motif 3: Technical Report(arXiv 2608.09119v1:2026-08-10 12:53:05(北京时间)12
作者与机构:Junghwan Lim、Joon Son Chung、Sungmin Lee、Wai Ting Cheung、Gihun Cho、Minsu Ha、Sangho Kang、Beomgyu Kim、Dongseok Kim、Jangwoong Kim、Taehyun Kim、Taewhan Kim、Jeesoo Lee、Jeongdoo Lee、Junhyeok Lee、Dongpin Oh、Hyeyeon Cho、Dahye Choi、Jaeheui Her、Hanbin Jung、Changjin Kang、Minjae Kim、Youngrok Kim、Hyukjin Kweon、Hongjoo Lee、Yeongjae Park、Bokki Ryu—Motif Technologies。论文只列这一家机构,韩国 MSIT、NIPA、NIA 是资助方,不是作者单位。13
Motif 3 是 314B 总参数、每 token 激活约 13.2B 的 MoE。每个稀疏层有 384 个路由专家和 1 个共享专家,每个 token 选 8 个;GDLA 把差分注意力与低秩 KV latent 合在一起。模型用约 12.5T token 预训练,再把 6 个 GRPO 教师和 1 个软件工程 SFT 教师通过 MOPD 蒸馏回单一模型。13
最强信号集中在 agentic 和终端任务:τ³-Banking 得 35.3,超过表中 DS-v4-Pro 的 30.1;Terminal-Bench 2.1 得 74.9,只比 Qwen-3.7 Max 的 75.0 低 0.1。SWE-bench Verified 为 76.2,与 Kimi-K2.6 持平。13
短板也在同一张表里:GPQA Diamond 83.4,对比 MiniMax-3 的 92.9;SciCode 40.6,对比 Kimi-K2.6 与 Qwen-3.7 Max 的 53.5。官方已开放 Motif 3、Base 与 NVFP4 权重,主模型采用 MIT License;论文没有披露训练成本或 GPU-hours。约 150 万美元只是社区估计,未获论文或官方材料证实,本文不把它作为事实引用。14
官方帖于北京时间 8 月 11 日 09:16 发布,抓取时 156 赞、27 转、17,806 浏览;Prime Intellect 的 Elie Bakouch 帖于 8 月 10 日 23:14 发布,抓取时 229 赞、28 转、27,847 浏览。正式版论文没有找到独立 HN 或 Reddit 直接讨论。1516
Loading content card…
精读前先核对:Motif 3 的领先主要落在 agentic 与终端任务;同表的 GPQA、SciCode 仍明显落后。训练成本没有官方数字。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments

Sign in to comment.