大模型团队论文与博客解读2026-08-25AgentHands:把 XR 对话手势收成 LLM 可解析的 GestureEventGoogle Research 的 AgentHands 用 GestureEvent 把共语手势接进 XR 对话;脚本化任务里空间定位与参与感显著提升,数字、情绪与 SUS 未达显著。
大模型团队论文与博客解读2026-08-21Google DeepMind 与 EVE Online 合作:把长期记忆与多智能体互动放进持续游戏世界Google DeepMind 与 Fenris Creations 将 EVE 的持续世界、长期规划和多智能体互动作为新的游戏 AI 研究环境,但当前发布仍是研究议程与合作计划,而非能力评测结果。
大模型团队论文与博客解读2026-08-21美团搜索3.0:LLM 语义表征从相似度特征走向可迁移排序系统美团搜索三期实践显示,LLM 语义表征的价值取决于排序目标、难负样本、场景覆盖率与信号融合如何共同设计。
大模型团队论文与博客解读2026-08-15Claude 文本水印的证据边界:能判断模型参与,不能判断作者身份Anthropic 宣布未来 Claude 模型将采用基于 SynthID-Text 的文本水印;真正需要理解的是它如何利用生成时的随机选择留下统计信号,以及短文本、事实密集文本和改写会怎样削弱这份证据。
大模型团队论文与博客解读2026-08-13Anthropic 的多 Agent 实验:协调能扩大搜索,也会放大共谋与破坏Anthropic 将 Claude Agent 放进共享代码、信息和冲突目标的实验环境,显示多 Agent 的效率收益依赖任务可分解性,而协调失败会演变成共同错误、共谋和破坏。
大模型团队论文与博客解读2026-08-12Qwen3.8 开放权重落地:Max 级模型开放了,云端能力没有一起打包Qwen3.8-2.4T-A95B 已在 Hugging Face 公开完整 BF16 权重,但文本模型、分布式部署与云端多模态工具之间仍有清晰边界。
大模型团队论文与博客解读2026-08-06WeatherNext 2 的气旋版本:0.25° 全球输入如何带来一天以上预报优势Google DeepMind 的 WeatherNext Cyclones 把全球天气状态、气旋专门监督、学习式追踪和 1,000 条概率情景合进同一模型;论文报告其相对业务模型平均多出一天以上有效预报时效,但粗分辨率机制与实际预警边界仍待验证。
大模型团队论文与博客解读2026-08-05SeedRealtime:把看、听、说和发言时机放进同一条实时决策链字节 Seed 的 SeedRealtime 将音频、视频、时序与轮次判断统一到连续实时流中,官方案例已展示主动提醒与抗干扰接话,但公开评测仍不足以证明其普遍稳定领先。
大模型团队论文与博客解读2026-08-03MiniMax H3 的开放权重有多完整:33B 基座公开了,2K 质量链路还没有MiniMax H3 公开 33B dense Omni Transformer 和本地 768p 工作流,但 Context-IR、2K regeneration 与首版稀疏注意力仍不在权重包里;本文拆开它的技术路线、部署边界与许可证条件。
大模型团队论文与博客解读2026-08-02OpenAI 公布十项数学与理论计算机科学结果:Lean 证书把证据链推进到哪一步OpenAI 公开十项数学与理论计算机科学结果,并同步发布论文、推理说明和 Lean 形式化;本文区分模型发现、形式化检查与数学共同体独立复核各自能证明什么。
大模型团队论文与博客解读2026-07-31Seedance 2.5:从 30 秒长叙事到时间戳编辑,视频生成开始接近一条时间线字节 Seed 的 Seedance 2.5 将单次 30 秒生成、多轮延长、多模态参考和时间戳级编辑放进同一条音视频链路;文章拆解它对创作工作流的真实改变,以及官方材料尚未回答的稳定性问题。
大模型团队论文与博客解读2026-07-31Science One Framework:Google 把自主科研的验收标准改成「每个结论都能追证据」Google Research 的 Science One Framework 把证据链前移到科研 Agent 的生成流程,并用 CoE Audit 测量引用、分数、规范遵守和方法代码对齐;本文解释它证明了什么,以及为什么还不能等同于开放式自主科研。