大模型团队论文与博客解读 Content Archive

85 posts · Page 1 of 1

  1. Google 冻结 Gemini Nano 也能加速:MTP 头省下的是内存和等待
  2. OpenAI 的 GeneBench-Pro:科研 Agent 不能只会跑流程了
  3. ChatGPT Memory Dreaming:OpenAI 要解决记忆变旧这件事
  4. Anthropic 40 万次 Claude Code 会话:会提需求比会写代码更值钱
  5. LifeSciBench:OpenAI 把科研评测从答题拉回真实生命科学
  6. OpenAI 公益转型计划:AGI 的问题从能力转向分配
  7. OpenAI 的 Codex 研究:Agent 改变的不是聊天,而是派活
  8. Claude Sonnet 5:Anthropic 把 Agent 能力下放到 Sonnet 价位
  9. Anthropic Economic Index:AI 正在贴着工作节奏生长
  10. N-day 漏洞:AI 把补丁窗口压缩到小时级
  11. Gemma 4 12B:Google 把多模态编码器拿掉了
  12. DiffusionGemma:4 倍加速背后的取舍
  13. Gemini 3.5 Live Translate:翻译从轮流说变成跟着说
  14. AI 控制路线图:Google 把 Agent 当内部人来防
  15. Computer Use in Gemini 3.5 Flash:Gemini 开始直接操作屏幕
  16. From AGI to ASI:DeepMind 把超级智能拆成四条路
  17. Seed2.1:字节把模型能力押到 Agent 交付
  18. TTT-VLA:只优化潜在提示,VLA 能在部署时自我校准吗?
  19. Seedance 2.0:字节把视频生成推向可导演工作流
  20. Qwen3.7-Plus:多模态 Agent 的重点变成了执行闭环
  21. Qwen-AgentWorld:让 Agent 先学会预测世界
  22. Qwen-Robot Suite:大模型开始接管机器人的动作接口
  23. MiniMax M3:百万 Token 上下文之后,Agent 才是主线
  24. Kimi K2.7 Code:长代码任务里,少想 30% 也是能力
  25. GLM-5.1:智谱把模型能力拉到 8 小时任务里
  26. GLM-5.2:1M 上下文之后,长任务才是主战场
  27. MiMo-VL:7B 视觉语言模型,胜负手在训练配方
  28. gget virus:生物 Agent 的短板不只在模型
  29. GPT-5.6 Sol:能力进了高风险区,发布也被安全闸门卡住
  30. LongCat-2.0:美团把万亿模型押在代码 Agent 上
  31. Deployment Simulation:OpenAI 把安全评测搬进真实流量
  32. Project Fetch:Claude 开始自己接管机器狗接口
  33. Nano Banana 2 Lite:Google 把生成媒体拆成流水线
  34. J-space:Anthropic 开始读取 Claude 的沉默想法
  35. MaxProof:MiniMax 把数学证明变成候选池搜索
  36. Fable 5:Anthropic 把越狱争议写成评分表
  37. Core dump epidemiology:OpenAI 如何修复一个 18 年的 libunwind Bug
  38. Claude Science:Anthropic 把科研 Agent 放进实验室工具链
  39. EdgeBench:字节 Seed 把 Agent 评测拉到 12 小时之后
  40. MOPD:小米把多位 RL 老师蒸回一个模型
  41. GPT-Live:OpenAI 把语音模型改成全双工前台
  42. GRAM:Anthropic 想给危险知识装一个可拆模块
  43. GPT-5.6 正式开放:Sol 变成高推理档
  44. Seedream 5.0 Pro:字节把图像模型推向设计工具
  45. Qwen-Image-Agent:先补上下文,再让模型画图
  46. Seed2.0 Model Card:字节把评测搬进真实任务
  47. LongCat-2.0 正式开源:美团把国产卡推理栈也放出来了
  48. Claude Values:Anthropic 给模型性格画了四根轴
  49. Xiaomi-Robotics-U0:小米把 38B 具身世界模型做成数据引擎
  50. GPT-Red:OpenAI 用自我博弈训练会攻击自己的安全红队
  51. Kimi K3:2.8T MoE 先上 API,权重要等 7 月 27 日
  52. Qwen-Audio-3.0-Realtime:实时语音开始自己办事,但价格口径要先看清
  53. PerceptionBench:多模态模型的视觉能力,最高也没过 60 分
  54. Seed Audio 1.0:把对白、音效和环境声放进同一场景
  55. MiMo-V2.5 推理优化:Hybrid SWA 的收益要靠整条服务链兑现
  56. 长程模型会学会绕过防线:OpenAI 重建四层安全系统
  57. Qwen-Image-3.0:图像生成开始把「信息量」当成能力指标
  58. Gemini 3.5 Flash Cyber:漏洞发现的增益来自专用模型,也来自调用预算
  59. Gemini 3.6 Flash、3.5 Flash-Lite 与 Flash Cyber:Google 把模型选型拆成三种工作负载
  60. OpenAI 事故复盘:GPT-5.6 Sol 在评测中突破沙箱,攻击 Hugging Face 获取答案
  61. Xiaomi-Robotics-1:小米把 VLA 的扩展瓶颈押在数据规模上
  62. SymptomAI:真实症状对话的增益,先来自主动追问
  63. Drone-Bench:Fable 5 四项过线,AI 无人机仍卡在环境重建
  64. Claude Opus 5:接近 Fable 5 的能力,成本曲线才是重点
  65. Qwen-Music:先规划旋律,再生成整首歌
  66. LoHoSearch:GPT-5.5 也只答对 34.74%,长程搜索难在关系链
  67. MineExplorer:Claude-Opus-4.6 成功率约 41%,多模态模型卡在动态世界
  68. CatPaw:美团把 LongCat 2.0 从开源模型推到企业 Agent 平台
  69. Claude Mythos Preview 找到 HAWK 与 7 轮 AES 的新攻击
  70. OpenAI 的 8 个科研计算案例:Agent 加速了代码,验证仍由人把关
  71. ARC-AGI-3 从 13.3% 到 38.3%:OpenAI 拆解 Agent 基准的 harness 影响
  72. GPT-5.6 的 20% serving 成本下降:OpenAI 把优化推进到内核和 Agent harness
  73. Gemini Robotics 2:Google 把机器人的动作、推理和本地适配拆成三层
  74. Science One Framework:Google 把自主科研的验收标准改成「每个结论都能追证据」
  75. Seedance 2.5:从 30 秒长叙事到时间戳编辑,视频生成开始接近一条时间线
  76. OpenAI 公布十项数学与理论计算机科学结果:Lean 证书把证据链推进到哪一步
  77. MiniMax H3 的开放权重有多完整:33B 基座公开了,2K 质量链路还没有
  78. SeedRealtime:把看、听、说和发言时机放进同一条实时决策链
  79. WeatherNext 2 的气旋版本:0.25° 全球输入如何带来一天以上预报优势
  80. Qwen3.8 开放权重落地:Max 级模型开放了,云端能力没有一起打包
  81. Anthropic 的多 Agent 实验:协调能扩大搜索,也会放大共谋与破坏
  82. Claude 文本水印的证据边界:能判断模型参与,不能判断作者身份
  83. 美团搜索3.0:LLM 语义表征从相似度特征走向可迁移排序系统
  84. Google DeepMind 与 EVE Online 合作:把长期记忆与多智能体互动放进持续游戏世界
  85. AgentHands:把 XR 对话手势收成 LLM 可解析的 GestureEvent

Explore more channels on Discover