奇绩信号Alpha Sight 2026年7月17日【文字版】

奇绩信号Alpha Sight 2026年7月17日【文字版】

本期精选 7 月 17 日 arXiv AI 论文,覆盖预训练安全、机器人长上下文、多模态空间理解、科研代理、端侧推理、搜索系统与评测基准。

头条

1. 预训练数据可被网页讨论区投毒,攻击面从数据集扩展到开放网络 原文

信号源:华盛顿大学、艾伦人工智能研究所

认知提取

这篇论文把预训练投毒从「往 Wikipedia 塞几段文字」推进到更现实的网页供应链:攻击者只要把内容写进公开讨论区,后续爬虫、正文抽取和质量过滤就可能替它完成传播。最值得警惕的不是单页成功率,而是网页规模足够大时,百分之零点一三的最终纳入概率也能积累成可观的训练语料。

论文摘要

  • 作者研究第三方网页内容能否通过公开讨论接口进入语言模型预训练数据,并提出 HalfLife 来估计注入内容穿过抓取与清洗链的概率。1
  • 研究扫描了二十万个 Common Crawl WARC 文件中的十八万一千八百五十七个网页,发现百分之三点四的页面含有可注入的评论平台。1
  • 论文把攻击链拆成可注入、被抓取、未被过滤三个阶段,最终估计恶意内容进入训练语料的概率为百分之零点一三。1
攻击者通过网页讨论接口注入内容,内容经过爬虫、抽取和过滤后进入语言模型训练链路的流程图
攻击者通过网页讨论接口注入内容,内容经过爬虫、抽取和过滤后进入语言模型训练链路的流程图

核心方法

  • HalfLife 将网页投毒的可行性改写为概率估计问题,分别测量页面能否注入、爬虫能否保留、清洗器能否放行。
  • 实验使用 Resiliparse 做 HTML 到纯文本抽取,再依次施加启发式过滤、英语识别、停用词检查和质量分类器,观察评论文本在哪一层消失。
  • 作者训练了六千五百万至十三亿参数的 Olmo-3-like 模型,设置百分之零点一、百分之零点零一和百分之零点零零一三种 token 投毒率,并比较基础模型和指令微调模型。
攻击者需要尝试注入的网页数量与最终纳入概率的关系,红色虚线标注了评论投毒的代表性纳入概率
攻击者需要尝试注入的网页数量与最终纳入概率的关系,红色虚线标注了评论投毒的代表性纳入概率

实验成果

  • 在清洗链中,启发式过滤后约有百分之二十八点八的注入文本留存,语言过滤后为百分之四十点四,质量过滤后为百分之四十七点一。1
  • 对十三亿参数基础模型,百分之零点零一的投毒率让目标 completion 偏好从百分之五十二点五升到百分之七十一点二,提升十八点七个百分点。1
  • 指令微调能削弱影响,但不能完全消除;在六千五百万参数模型上,百分之零点一投毒率仍使目标偏好从百分之五十六点五升到百分之六十三点九。1
  • 若目标是得到二百五十篇最终投毒文档,攻击者可能只需尝试向十万至一百万个网页注入内容。这个估计依赖论文设定,不能直接等同于现实攻击成本。1
恶意评论在多次迭代中的存活情况,按攻击类型(AI Attribution / Defamation / Misinformation)分类
恶意评论在多次迭代中的存活情况,按攻击类型(AI Attribution / Defamation / Misinformation)分类

总结与反思

  • 结果总结:网页讨论区是可进入预训练数据的现实攻击面,SFT 只能减弱而不能保证清除污染。
  • 局限性:实验使用 Common Crawl 抽样和自建小模型,真实商业语料的采集、去重和混合流程未被完整复现。
  • 前沿见解:数据治理需要记录内容 provenance 和纳入概率,单纯依赖最终模型安全对齐已经太晚。

2. RoboTTT 把机器人视觉运动上下文扩展到八千步,长任务完成率提升八十七个百分点 原文

信号源:英伟达、斯坦福大学、德州大学奥斯汀分校

认知提取

普通机器人策略像只看最近几帧的短记忆控制器,RoboTTT 则把历史压进会在推理时更新的 fast weights。结果是,策略可以把一段人类示范、此前的失败和当前纠正一起带进后续动作,长上下文第一次变成机器人基础模型的可扩展轴。

论文摘要

  • RoboTTT 将 Test-Time Training 引入视觉语言动作策略,把递归状态改为推理时持续更新的参数,并把视觉运动上下文扩展到八千个时间步。2
  • 论文在真实双臂操作任务上测试一次示范模仿、在线策略改进、扰动鲁棒性和多阶段装配,覆盖 Pup Go Car、Circuit、Gear Bot 三类任务。2
  • 训练数据包含桌面双臂机器人数据和第一视角人类数据,基础模型为 GR00T N1.7。2
RoboTTT 的模型架构、长上下文训练和机器人操作任务总览
RoboTTT 的模型架构、长上下文训练和机器人操作任务总览
RoboTTT 模型架构详图:TTT 层在 DiT action head 中位于 attention 层之后,跨时间步处理信息
RoboTTT 模型架构详图:TTT 层在 DiT action head 中位于 attention 层之后,跨时间步处理信息
实验任务总览:Pup Go Car、Circuit、Gear Bot 三个长时程双臂装配任务
实验任务总览:Pup Go Car、Circuit、Gear Bot 三个长时程双臂装配任务

核心方法

  • 每个 TTT 层包含一个两层 MLP fast model,参数在训练和推理中都通过梯度下降更新,用参数状态压缩长历史。
  • 训练时用 sequence action forcing 生成连续动作目标,再用 truncated backpropagation through time 截断梯度,避免八千步上下文带来不可控的显存开销。
  • RoboTTT 在十六个 DiT 层中加入 TTT 层,预训练逐步把上下文扩展到八千步,之后对下游任务用一千步上下文微调。

实验成果

  • 三项任务平均完成分为百分之七十九,相比单步上下文的 GR00T N1.7 百分之四十二提升百分之八十七,相比最佳 GDN 基线百分之五十六提升百分之四十一。2
  • Gear Bot 是持续约五分钟的十阶段装配任务,RoboTTT 完成二十次试验中的两次,所有基线均为零次。2
  • 一次人类视频示范在十次试验中成功六次;在线改进比未启用该能力的同模型高百分之三十六;外部扰动下成功率为百分之八十三,对比短上下文基线的百分之五十三。2
  • 八千步预训练相对一千步同模型的任务完成分提升百分之六十三,摘要中另写为百分之六十二,论文不同段落存在一百分点表述差异。2
三项任务完成分对比柱状图:RoboTTT 均显著优于 GR00T N1.7 和 GDN
三项任务完成分对比柱状图:RoboTTT 均显著优于 GR00T N1.7 和 GDN
预训练上下文长度 scaling 曲线:RoboTTT 从 128 到 8K 稳步提升,GDN 无此趋势
预训练上下文长度 scaling 曲线:RoboTTT 从 128 到 8K 稳步提升,GDN 无此趋势

总结与反思

  • 结果总结:RoboTTT 证明长上下文能改善机器人模仿、纠错、抗扰动和长任务执行。
  • 局限性:真实机器人实验集中在三类操作任务,八千步上下文的训练成本和跨平台泛化仍需更多证据。
  • 前沿见解:机器人基础模型的 scaling law 可能同时沿模型规模、数据量和历史上下文长度展开。

3. SceneBind 把视觉、声音和语言绑定到同一套三维对象槽位 原文

信号源:华盛顿大学、德州大学达拉斯分校、韩国外国语大学

认知提取

很多多模态模型能说出场景里有什么,却说不清声音来自哪里。SceneBind 给每个对象同时记录语义、方位、仰角、距离和置信度,把「是什么」与「在哪里」放进同一个可匹配的对象槽位,因而可以直接支持跨模态检索和对象定位。

论文摘要

  • SceneBind 用一个全局语义 embedding 加对象中心的 semantic-spatial slots 表示场景,输入覆盖视觉、双耳音频和语言。3
  • 作者构建了真实世界 binaural 音频视觉数据集,标签包含场景描述、对象短语以及方位角、仰角、距离。3
  • SceneBind Matching 将全局场景相似度和对象槽位对齐结合起来,用于跨模态检索、对象 grounding 与零样本音视频定位。3
SceneBind 从视觉、音频、语言输入生成全局语义与对象级语义空间表示的总览图
SceneBind 从视觉、音频、语言输入生成全局语义与对象级语义空间表示的总览图

核心方法

  • 每个场景由全局 embedding 与 K 个对象槽位组成,每个槽位含对象语义、方位角、仰角、距离和置信度。
  • 视觉和音频语义编码器保持冻结,音频空间编码器从双耳波形的幅度与相位构造四通道时频表示,再把空间特征对齐到视觉语义空间。
  • 训练使用 bipartite matching 连接预测槽位和对象描述,并联合优化全局 InfoNCE、对象 grounding 和对象中心对比学习。

实验成果

  • 数据来自二万一千九百二十七个真实视频,训练集包含三万八千四百三十个片段、二十万七千八百三十六个对象,另有一千零六十六个片段经过人工验证。3
  • 每个片段是两秒音频图像对,检索测试池大小为一千零四十六;槽位数实验比较了一、五、十、二十五、五十、一百和二百个槽位。3
  • 图中显示,空间检索、场景检索和对象 grounding 随槽位数变化存在不同最优区间;原文没有提供完整表格数字,因此不把折线读数写成精确成绩。3

总结与反思

  • 结果总结:SceneBind 用对象级空间槽位补上了多模态表征只记语义、不记位置的缺口。
  • 局限性:空间标注依赖双耳音视频数据,跨设备录制、遮挡和复杂声源混合下的性能仍需单独评估。
  • 前沿见解:多模态对齐的下一步不只是统一 embedding,而是让每个模态共享可追踪的对象和几何结构。

4. AutoSynthesis 把元分析拆成一条可审计的多智能体流水线 原文

信号源:米兰理工大学、慕尼黑大学、慕尼黑机器学习中心、麻省理工学院计算机科学与人工智能实验室

认知提取

AutoSynthesis 不是让一个模型直接写综述,而是把检索、筛选、统计抽取和效应量合成拆给不同代理,再把每一步留下的证据接回 PRISMA 报告。它的价值在于把「会总结」变成「能复查」,但论文也显示,误差主要仍发生在文献检索和纳入标准判断,而非最后的统计公式。

论文摘要

  • 系统从自然语言研究问题出发,自动制定检索策略、筛选候选研究、检查全文资格、抽取统计量、计算标准化效应量,并运行随机效应元分析。4
  • 输出包含异质性分析、发表偏倚和风险偏倚评估,并按照 PRISMA 指南生成透明报告。4
  • 示例问题研究 LLM 生成的说服性信息相对人工或非 LLM 信息是否改变说服效果,并与专家手工元分析比较。4
AutoSynthesis 从研究问题到检索、全文筛选、统计抽取、分析和报告的多智能体流程
AutoSynthesis 从研究问题到检索、全文筛选、统计抽取、分析和报告的多智能体流程

核心方法

  • Planning agent 负责把问题改写为检索计划、控制标签、纳入排除标准和调节变量。
  • Eligibility agent 获取论文全文并区分独立研究;统计 agent 抽取数值并与原文核对,随后计算 Hedges' g、Cohen's d 等标准化效应量。
  • Analysis agent 用随机效应模型合成结果,再执行异质性、漏斗图和风险偏倚分析,最后组装 PRISMA 报告。

实验成果

  • 示例任务检索二十八篇记录,标题摘要初筛保留二十五篇,全文筛选保留十九篇,最终纳入八项研究并抽取二十个效应量。4
  • 合并效应为 Hedges' g 等于零点一四三,百分之九十五置信区间为零点零五九至零点二二六,p 小于零点零零一;异质性 I² 为百分之八十八点三。4
  • 与人工基准的研究重合为七项中的五项,校正后 recall 为百分之八十五点七、precision 为百分之八十七点五;匹配效应量的 Pearson 相关系数为零点六九。4

总结与反思

  • 结果总结:AutoSynthesis 的合并效应落在人工基准正负零点二 Hedges' g 容忍区间内,适合作为专家辅助工具。
  • 局限性:示例规模小,检索遗漏和纳入标准误判会直接改变最终效应,不能把自动报告当作无需复核的结论。
  • 前沿见解:living meta-analysis 可能是多智能体科研最现实的落点,持续更新比一次性替代专家更可行。

认知模型

5. OPD2 不模仿教师答案,而是蒸馏教师相对基础模型的变化 原文

信号源:NAVER 人工智能实验室

认知提取

传统蒸馏告诉学生「教师现在更偏好哪个 token」,OPD2 还会问「教师经过推理训练后,相比原始模型改变了什么」。这个差分信号更像一张学习轨迹地图,能把推理训练真正带来的 token 偏好传给小模型,同时压掉错误或含糊的探索路径。

论文摘要

  • 论文提出 delta signal,用教师模型和其 instruction tuning 前 base model 的 log-probability 差值作为 on-policy distillation 奖励。5
  • 方法包含 centering 和 joint conditioning:当 delta 与原 OPD 信号方向冲突时停止更新,避免把不一致的反馈一并放大。
  • 实验覆盖数学、科学和代码推理,比较 Qwen3、Gemma-4 小模型与同家族大教师模型。
OPD 与 OPD2 对比:教师输出蒸馏和教师相对基础模型差分信号的关系
OPD 与 OPD2 对比:教师输出蒸馏和教师相对基础模型差分信号的关系

核心方法

  • 传统 OPD 使用教师相对学生的 log-probability 差值,OPD2 改为教师相对 teacher-base 的差值,专门捕捉 reasoning tuning 带来的变化。
  • 优势函数只保留 delta advantage 和原 OPD advantage 同号的 token,冲突时把更新置零。
  • 三个领域训练集按一比一比一混合,评估覆盖七个数学、三个科学和四个代码 benchmark。

实验成果

  • 统计分析使用每个领域一万个问题,数学、代码、科学域总 token 数分别为七千二百四十万、五千三百三十万和三千六百七十万。5
  • 词级分析显示,delta signal 更偏向 hence、thus、however、regardless 等推理连接词,并压低 perhaps、consider、analyze 等探索性或模糊表达。5
  • OPD2 在数学、科学和代码推理基准上整体优于传统 OPD,且在 thinking 与 non-thinking 设置下保持一致方向。论文提供的是跨 benchmark 的相对结论,未在当前摘录中给出一组可统一比较的总分。5

总结与反思

  • 结果总结:教师与基础模型之间的差分比教师最终分布更贴近推理能力的来源。
  • 局限性:delta signal 需要访问 teacher-base 配对模型,部署和存储成本高于普通蒸馏。
  • 前沿见解:推理能力蒸馏可以从「复制答案」转向「复制训练改变了什么」。

多模态

6. ViPS 用五个视觉基础模型的互补先验提升空间推理 原文

信号源:香港大学

认知提取

不同视觉基础模型像不同测量仪器:有的擅长深度,有的擅长运动,有的更懂外观。ViPS 没有继续寻找一个全能视觉专家,而是用轻量代理复制多种先验,再根据问题动态配比,避免单一先验在空间任务上成为瓶颈。

论文摘要

  • ViPS 发现不同 foundation model 在不同空间任务上提供互补先验,并提出 Efficient Prior Proxy 与 Dynamic Prior Fusion。6
  • 代理网络从一个基础模型表示中估计多个视觉先验,融合模块根据文本指令动态生成权重,再把融合结果注入 MLLM 图像 token。
  • 评测覆盖 VSI-Bench 以及 ScanRefer、Multi3DRefer、Scan2Cap、ScanQA、SQA3D 五个 ScanNet 系列基准。
ViPS 用 Efficient Prior Proxy 和 Dynamic Prior Fusion 融合多种视觉先验的框架图
ViPS 用 Efficient Prior Proxy 和 Dynamic Prior Fusion 融合多种视觉先验的框架图

核心方法

  • 训练阶段先用 L2 对齐损失让轻量 MLP proxy 拟合 VGGT、DepthAnything3、TraceAnything、Wan2.1、RADIO 五种先验。
  • Dynamic Prior Fusion 从文本指令最后一个 token 生成权重,经过 zero-initialized convolution 后融合,并在五层 MLLM 中注入。
  • 训练时冻结 vision encoder,LLM 使用 LoRA,batch size 为十六,最大学习率为一点乘十的负五次方,每个数据集训练一个 epoch。

实验成果

  • VSI-Bench 上 ViPS 平均分为百分之六十三点八,之前最优的空间增强模型 VLM-3R 为百分之五十七点二。6
  • 消融分析显示,没有单一视觉模型在所有指标上都占优;不同模型的特征在 t-SNE 中聚于不同区域,激活热图也关注不同结构线索。6
  • VG-LLM-8B 在 Appearance Order 上超过 ViPS,但 ViPS 在大多数其余类别领先;当前摘录未完整呈现所有表格行,因此不补写其余单项数值。6

总结与反思

  • 结果总结:多视觉先验的互补性可以转化为更强的空间推理表现。
  • 局限性:proxy 仍依赖先验模型的覆盖范围,动态融合的额外显存和多视频输入成本需要工程测量。
  • 前沿见解:MLLM 的视觉编码器不必只选一个,未来更像是由多个专长模块组成的先验组合。

7. MLLM 在科学可视化上接近人类,但定量估计仍普遍失灵 原文

信号源:圣母大学

认知提取

模型能看懂图表的主题,不等于能读懂科学可视化。六个 MLLM 在搜索、空间理解和科学插图上表现不错,遇到纹理流场、集成可视化和细粒度数值比较就明显掉速,说明视觉问答分数不能替代真正的科学读图能力。

论文摘要

  • 作者提出 SVLAT 评测六个多模态模型的科学可视化素养,数据含四十九道题、十八幅科学可视化与插图、八种技术和十一类任务。7
  • 评测三个闭源模型和三个开源模型,并用四百八十五名非专家人类参与者结果作对照;每题重复运行十次取平均。
  • 错误分析集中在细粒度定量估计、流向理解、编码映射和把外部知识错误带入图表解释。
六个多模态模型与人类在八类科学可视化技术上的准确率对比
六个多模态模型与人类在八类科学可视化技术上的准确率对比

核心方法

  • SVLAT 使用闭集协议,每题要求模型返回 JSON、选择项、完整答案和简短理由,temperature 设为零,max tokens 为三百。
  • 评测对象为 GPT-5.4、Claude-Opus-4.6、Gemini-3.1-Pro-Preview、Qwen3.5-9B、InternVL3.5-8B、LLaVA-OneVision-1.5-8B-Instruct。
  • 对不支持直接视频输入的闭源模型,作者以每秒一帧的方式抽取动画帧,保持不同模型可比较。

实验成果

  • 总体准确率方面,Gemini 为百分之八十八点六,GPT-5.4 为百分之七十五点一,Claude 为百分之七十五点三;人类基线为百分之七十五点六。7
  • Qwen3.5-9B、InternVL3.5-8B 和 LLaVA-OneVision-1.5-8B-Instruct 的总体准确率分别为百分之六十八点八、百分之六十四点三和百分之六十四点一,整体低于人类基线。7
  • 所有类别在相对定量估计任务上的准确率都低于百分之五十;Gemini 在表面渲染和体渲染上达到百分之一百,在相对定量估计上只有百分之四十五。7

总结与反思

  • 结果总结:科学可视化素养是独立能力,当前模型呈现明显的任务和图形类型依赖。
  • 局限性:测试规模只有四十九题,且闭集协议与逐帧处理可能低估或高估真实交互读图能力。
  • 前沿见解:视觉模型评测需要加入科学图形、动态图形和数值读取,而不只是自然图像问答。

具身智能

8. BadWAM 让世界模型「想象正确、动作错误」,暴露闭环脱同步攻击 原文

信号源:新加坡国立大学、香港理工大学

认知提取

世界动作模型通常把「预测未来」当作安全感来源,BadWAM 证明这个直觉不够稳。攻击者只改动视觉输入的一小部分,就能让模型继续想象看似正常的未来,同时把实际动作推向失败方向,真正要监控的是想象与执行是否仍然对齐。

论文摘要

  • BadWAM 研究 world-action model 特有的 World-Action Drift Attack,并区分只改变动作的攻击和保持未来想象接近干净输出的攻击。8
  • 攻击者只需对视觉输入施加有界的 l-infinity 扰动,不需要模型权重、梯度或训练数据。
  • 实验在 LIBERO 和 RoboTwin 上评估闭环执行成功率以及未来预测与动作输出的同步关系。
BadWAM 对比干净未来、对抗未来和差异帧,展示想象与动作脱同步现象
BadWAM 对比干净未来、对抗未来和差异帧,展示想象与动作脱同步现象

核心方法

  • action-only attack 直接最大化干净动作与攻击动作的距离;imagination-preserving attack 在增大动作偏差的同时约束未来 latent 或解码视频的距离。
  • 优化使用 zeroth-order online search,以有限差分和随机方向估计目标函数变化,再把扰动投影回允许范围。
  • 攻击发生在每次 replanning 时,针对闭环系统而非单个离线动作分类器。

实验成果

  • action-only attack 将任务成功率从百分之九十六点五降到百分之四十三点一。8
  • imagination-preserving attack 在保持未来预测接近干净输出时,仍能制造明显动作偏移;失败轨迹的动作偏移更大,但未来想象偏移可能与成功轨迹重叠。8
  • 该结果说明只检查预测视频是否合理,不能作为完整安全监控信号。8

总结与反思

  • 结果总结:WAM 的世界预测能力不自动等于安全,想象和动作之间的接口同样需要防护。
  • 局限性:当前攻击依赖可查询的模型输出和仿真基准,真实机器人传感器噪声与物理约束下的效果未完全展开。
  • 前沿见解:具身模型的安全评估应同时测预测一致性、动作偏移和任务后果。

AI4Science

9. BrainPilot 用知识库、技能库和审计图组织脑科学研究代理 原文

信号源:清华大学、上海奇绩研究院、中国人民大学、北京航空航天大学、电子科技大学、复旦大学、佐治亚理工学院、西南交通大学

认知提取

BrainPilot 的重点不在于让模型扮演一个万能科学家,而是给不同研究环节配置不同角色,再用 Graph of Trace 把主张、工具、证据和依赖关系串起来。它把科研代理最难追责的部分外显出来:哪一步用了什么资料,哪一个数字已经确认,哪一个结论仍然未验证。

论文摘要

  • 系统由 PI agent 协调 Librarian、Experimentalist、Engineer、Writer 和 Auditor 等专家代理,覆盖文献检索、实验设计、分析、解释和写作。9
  • 知识库含七千二百三十三条索引项,技能库含七十二个方法单元,覆盖七个研究领域;Graph of Trace 记录子目标、工具使用、证据和主张。
  • 作者在 Agents' Last Exam 的三个脑科学任务、BrainPilotBench-v0 和端到端案例上评估系统,并强调 human-in-the-loop。
BrainPilot 的 PI agent、专家代理、知识库、技能库和 Graph of Trace 系统架构
BrainPilot 的 PI agent、专家代理、知识库、技能库和 Graph of Trace 系统架构

核心方法

  • 知识库流程为 OCR、按一千五百字符切块并保留二百字符重叠、BAAI bge-m3 向量化、bge-reranker-v2-m3 重排。
  • Skill router 先检索候选技能,再按需加载完整说明,避免每个代理都携带整套方法库。
  • Auditor 对数字、文件和引用做核查,将结果标记为 confirmed、unverified 或 disputed,并把状态写入追踪图。

实验成果

  • 知识库包含七千二百三十三条索引项、三十七万七千八百六十八个内容 token,技能库含七十二项技能,覆盖七个研究域和十一个学科组。9
  • 作者报告开源 backbone 的 BrainPilot 在公开脑科学代理评测上达到与当前先进代理框架相当的表现,同时成本更低;当前摘录没有给出可复核的逐项分数。
  • 案例范围覆盖 EEG/ERP、fMRI、Ephys、成像、行为和建模等工具方向,系统把检索、分析和写作产物连接到同一条证据链。9

总结与反思

  • 结果总结:BrainPilot 把领域知识、可复用技能和审计流程结合起来,适合长链路脑科学工作流。
  • 局限性:公开实验中的量化结果仍不充分,端到端案例不能替代受控基准上的逐项比较。
  • 前沿见解:AI4Science 代理的关键指标应包含证据可追踪性和人工复核成本,而不只是最后答案的正确率。

Infra

10. PolyQ 把 CPU 上的混合精度量化编译成可执行的规则布局 原文

信号源:加州大学尔湾分校

认知提取

细粒度量化的问题从来不只是「每个通道用几 bit」,还包括这些不规则通道能否被 CPU 的 SIMD 和查表内核高效执行。PolyQ 用编译器把通道重排、聚类和 packing 提前做掉,让分数 bit budget 从理论上的精细分配变成可以部署、延迟可预测的实际配置。

论文摘要

  • PolyQ 在每层按通道分配二、三、四、八或十六 bit,再把通道聚类成同质比特块,生成 SIMD 和 LUT 兼容内核。10
  • 框架用激活感知误差代理和 waterfilling 分配 bit,并通过编译期跨算子传播置换,降低运行时 activation reorder。
  • 实验覆盖 Falcon-H1-3B、Llama2-13B、Qwen3-32B 和 Llama3-8B,使用 WikiText-2 与三类 CPU 平台测量质量、延迟和能耗。
PolyQ 的激活感知按通道分配、水填充和编译期布局规整流程
PolyQ 的激活感知按通道分配、水填充和编译期布局规整流程

核心方法

  • 用权重重建误差乘以激活能量估计通道重要性,从二 bit 起步,按每增加一 bit 带来的误差下降收益升级通道。
  • ISA-aware quanta matching 把理想 bit map 修正为后端能处理的块大小,再对通道置换、聚类和 packing 编译。
  • 不同 bit 组使用独立的 activation-aware scaling,模型是 calibration-based PTQ,不需要端到端微调。

实验成果

  • Llama3-8B 在三点九 GB 预算下,uniform 三 bit 使用三点零 GB,perplexity 为八点零九九;PolyQ 使用三点八九 GB,达到三点九七 bits/weight,perplexity 降到六点零七八。10
  • 三 bit 目标下,相比先前方法 perplexity 改善百分之二点四至百分之三十二点一;编译期布局规整最多减少百分之七十点八的 activation reorder 流量。10
  • 实测 prefill 延迟和 decode 吞吐基本随 bit budget 成比例变化,energy/token 额外开销低于百分之二,实际 bit budget 与目标的偏差可小至零点零四五 bit。10

总结与反思

  • 结果总结:PolyQ 把分数 bit 量化从算法分配问题推进到量化、编译器和硬件内核的共同设计。
  • 局限性:实验重点是 CPU-only 推理和校准式 PTQ,长上下文、生成质量和更多芯片指令集仍需扩展。
  • 前沿见解:边缘 LLM 的性能上限越来越由数据布局和编译器决定,而非只由量化公式决定。

Agent

11. SearchOS 把开放域搜索代理的隐式进度变成共享状态 原文

信号源:中国人民大学、蚂蚁集团

认知提取

多代理搜索最容易陷入的不是不会搜,而是忘了已经搜过什么、哪些字段还没有证据、哪条路径已经失败。SearchOS 把这些内容外置为任务前沿、证据图、覆盖地图和失败记忆,再用中间件监测停滞,让搜索代理从一串聊天记录变成一个有状态的调查系统。

论文摘要

  • SearchOS 把开放域信息搜寻形式化为带 grounded citations 的关系模式补全,要求实体、属性和来源证据可以对应起来。11
  • SOCM 把进度外显为 Frontier Task、Evidence Graph、Coverage Map 和 Failure Memory,并由 pipeline-parallel scheduler 持续填补未解决的覆盖缺口。
  • Search Tool Middleware Harness 记录模型和工具交互,抽取证据,检测 stall 与预算耗尽,并通过层级技能系统复用已验证的搜索策略。
SearchOS 的多代理搜索循环、状态管理与中间件干预流程
SearchOS 的多代理搜索循环、状态管理与中间件干预流程

核心方法

  • orchestrator 先把问题拆成 schema、优先级和停止条件,再把任务交给 explore、search 和 writer 代理。
  • 当一个并行 slot 释放时,调度器优先补齐覆盖地图里的未解字段,而不是继续重复已完成路径。
  • Evidence Extraction Middleware 把模型输出绑定到来源片段,Sensor Middleware 根据低产出、停滞和预算压力触发纠正或停止。

实验成果

  • WideSearch 含二百个问题,覆盖十五个以上领域;GISA 含三百七十三个结构化查询,答案形态包括 item、set、list 和 table。11
  • WideSearch 上 Item F1 为八十点三,Row F1 为五十六点五;GISA 上 Table Item F1 为七十六点九,Set F1 为七十六点五,List F1 为六十八点一。11
  • 相比最强基线,WideSearch Item F1 提升四点三,Recall 提升五点五;GISA Set F1 提升十三点四,Table Item F1 提升二点一。11

总结与反思

  • 结果总结:SearchOS 的主要增益来自共享状态和失败记忆,适合长链路、多字段、需要引证的搜索任务。
  • 局限性:每个 case 运行三次取 Max@3,且使用一千八百秒 wall-clock budget,真实成本和稳定性还需报告均值分布。
  • 前沿见解:搜索代理的基础设施应把证据覆盖和停止条件当作一等状态,而不是埋在 prompt 里。

应用体系

12. Mutable Sketch 让推荐系统在用户新评分到达后无需重训即可更新 原文

信号源:密歇根大学安娜堡分校、Criteo

认知提取

推荐系统的老问题是用户刚刚点过、买过或评分过,embedding 还停留在上一轮训练。Mutable Sketch 把用户偏好存进可更新的 KP-tree,只固定一次低秩基,后续新行为到来时重算用户向量,不动模型参数,换来接近实时的个性化响应。

论文摘要

  • 方法用 KP-tree 保存用户偏好,先采样构建 sketch,再做截断 SVD 得到固定低秩基;新评分只更新树并重新投影。12
  • 作者证明新观测会单调收紧预测误差上界,并提出 norm divergence、projection residuals 和 full rebuild 三层 refit 控制。
  • 实验覆盖 KuaiRec、Amazon Electronics、Amazon Video Games、Amazon Music、Book-Crossing 以及多个 MovieLens 数据集。

核心方法

  • KP-tree 支持按偏好绝对值采样、查询和更新,操作复杂度为 O(log n)。
  • 服务时读取用户在 sketch 列上的值,中心化后投影到固定的 V_k;新行为不触发梯度更新。
  • 主要设置为 rank k 等于十、sketch size 为二百乘一百;streaming 实验把后四成数据拆成三十个 batch 逐步注入。

实验成果

  • KuaiRec 上,方法只读取百分之一点八的数据就得到零点八一零 RMSE,优于使用全部数据的 ALS 零点八二二;在线三十个 batch 后 RMSE 为零点八一八。12
  • KuaiRec 平均 batch 延迟为九十毫秒,FunkSVD 为二百毫秒,eALS 为七百三十毫秒;观测到可服务延迟为二点五毫秒,对比基线分别为二百毫秒和七百三十毫秒。12
  • 新用户第一次评分后的个性化推荐延迟为 P50 零点四九毫秒、P95 一点三六毫秒;五十次评分后仍为 P50 五点零六毫秒、P95 九点七五毫秒。12

总结与反思

  • 结果总结:Mutable Sketch 适合需要低延迟用户更新、又不想频繁重训的稀疏推荐场景。
  • 局限性:方法依赖 sketch 覆盖足够多的 item,大规模 catalog 上精度会下降;当前原文摘录未返回可复用的实验图表 URL。
  • 前沿见解:推荐系统的在线更新不一定需要改模型,先把用户侧状态做成可控、可解释的数据结构也能解决一部分陈旧问题。

Benchmark

13. CFM-Bench 用六个无线信道域和多任务划分重做基础模型评测 原文

信号源:作者团队(机构全称未在本轮原文详情中呈现)

认知提取

无线信道基础模型的比较长期被不同数据集、不同划分和不同指标切碎,模型看起来都能赢,却很难知道谁真的学到了可迁移表示。CFM-Bench 的贡献偏基础设施:先把轨迹、测量会话、飞行和空间区域隔离,再让同一套任务协议检验表示能否跨域转移。

论文摘要

  • CFM-Bench 覆盖六个信道配置,包含 3GPP 统计仿真、两条独立射线追踪管线、工业与空中实测以及同步车联网多模态仿真。13
  • 基准把任务分为 PHY 信道智能、RAN 决策智能和 ISAC 综合感知通信三类,覆盖 CSI feedback、频率和时间外推、传播状态分类、波束预测与定位。
  • 官方规定 benchmark split 不得用于基础模型预训练,训练开发过程必须披露数据,且不能使用官方测试单元。
CFM-Bench 的六个数据域、官方抗泄漏划分和 PHY、RAN、ISAC 任务维度
CFM-Bench 的六个数据域、官方抗泄漏划分和 PHY、RAN、ISAC 任务维度

核心方法

  • 六个数据域分别为 S1 统计仿真、R1 DeepMIMO 射线追踪、R2 Sionna RT/MOCSID、E1 工业实测、E2 MaMIMO-UAV 空地链路、M1 车联网多模态仿真。
  • 划分单位按完整轨迹、测量 session、UAV flight、vehicle link、simulation realization 或空间块隔离,降低随机帧切分造成的数据泄漏。
  • 任务支持从 CSI feedback 到 current/future beam prediction、LoS/NLoS 分类和 frame/temporal localization,允许比较 CFM 与任务专用网络。

实验成果

  • 基准总计十五万七千九百个 single-frame examples,其中训练十三万二千五百二十五个、验证一万七千五百二十三个、测试七千八百五十二个。13
  • 六个域的样本数分别为一万零四十八、二万零七百二十、 一万九千四百七十一、三万二千二百二十一、七万三千七百二十八和一千七百一十二。13
  • 论文当前重点是发布统一数据和协议,未在本轮摘录中提供某个模型在全部任务上的最终排行榜,因此不把数据规模误写成性能结论。

总结与反思

  • 结果总结:CFM-Bench 的价值是让无线基础模型的迁移能力在同一套抗泄漏协议下可比较。
  • 局限性:基准覆盖的无线域和设备仍有限,真实部署中的信道变化、计算预算和在线适应尚未完全纳入。
  • 前沿见解:对基础模型而言,数据划分本身就是实验变量;没有严格隔离,排行榜很容易测到记忆而不是迁移。

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel