AI 创业播客日报|2026 年 9 月 6 日早报

AI 创业播客日报|2026 年 9 月 6 日早报

早报聚合窗口内 AI 模型编排、Agent 产品、长程评测、开发工具与研究动态。

0:00 / 9:33
本期覆盖 9 月 5 日晚间至 9 月 6 日早间的 AI 与创业动态,重点放在模型编排、Agent 产品、长程评测和开发工具。节目先讲五条重点,再扫过窗口内可核验的产品、公司和研究快讯。

重点一:HydraFusion 把模型组合成流程

GitHub 发布研究预览版 HydraFusion。开发者可以在 Copilot 中像选择普通模型一样选择它;系统会在运行时为每个编码任务构建跨供应商的多模型流程。它提供 Single、Cascade 和 Critique 三种模式:一个模型直接完成、便宜模型先起草后按质量门升级、模型 A 起草后由另一模型家族的隔离批评者审阅再修订。GitHub 给出的 TerminalBench 2.1 结果是,验证任务质量高 4.9 个百分点,估算成本低 67%。1

重点二:OpenClaw 2026.9.2

OpenClaw 发布 2026.9.2。更新说明包括:重启后从原处继续、长对话移动更快、加入 GPT-6 Astra,以及加入 Muse Spark 1.3。2

重点三:Grok Imagine Video 1.5 Agent

Grok Imagine Video 1.5 Agent 上线。Grok 官方把它描述为编码 Agent 与图像、视频模型的组合,使用 Image 2.0,强调更高质量、更好的故事处理,以及多个镜头之间的连续性。3

重点四:Meta AIRA₃ 参加 Kaggle 竞赛

Meta AI 披露,自主 AI 研究系统 AIRA₃ 在 6 月参加了 NVIDIA 运行的 Kaggle 竞赛,任务是微调 30B Nemotron 模型,让模型提升推理能力。参赛者获得相同信息,评分使用私有测试集;AIRA₃ 在约 4,000 支队伍中排名第 8,获得 Gold。4

重点五:LongDS 1.1 评测长程数据分析

LongDS 1.1 和 LongDS 1.1-Lite 发布,相关论文被 EMNLP 2026 主会接收。LongDS 用 68 个任务和 2,225 轮对话,测试 Agent 在长程、多轮数据分析中保留、更新、恢复和组合分析状态的能力。Lite 版本包含 24 个任务和 777 轮对话,并提供 Codex、Claude Code、Kimi Code、Qoder 的原生运行器,支持本地和 Docker 评测。LongDS 1.1-Lite 当前榜单前三名为 GPT-6 Astra 78.17、Claude Fable 5.1 配合 Claude Code 76.53、GPT-5.6-sol 配合 Codex 70.71。5

其他快讯:Agent 与开发工具

  • Every 发布 Compound Writing 开源插件,供 Claude Code 和 Codex 使用。流程包括先用 15 到 30 个问题采访作者,再逐段完成大纲、写作和复核,并保存形成的语气与风格文件。6
  • HeroUI Agents 发布,功能包括理解页面上下文、调用产品工具、生成图表、表格和表单,并在执行动作前请求批准。7
  • HumanLayer 团队的 show-me Skill 被转发介绍,支持 Agent 用伪代码、调用树、组件树、文件树、Mermaid、diff、代码块或独立 HTML 页面解释结构。8
  • Perplexity 发布嵌入服务基础设施文章,介绍 Ivy、Tulip、ROSE 三层架构,以及整模型 CUDA Graph 和 LazyTensor。9
  • Vercel 的 DeepSecBench 帖子给出 GPT-6 Astra 与 GPT-5.6 Sol 的新对比:Astra 用时 49 分钟,Sol 接近 4 小时;帖子还称 Astra 成本比 Claude Opus 5 max 低 50%。10
  • 一条端侧语音模型整理列出 Hojo ASR Multi V1、SenseVoice Small 和 whisper large v3 turbo;其中 whisper large v3 turbo 支持 99 种语言。11
  • Aside 的公开能力清单包括登录网站完成任务、跨网站操作、保存来源与截图、等待事件后继续,以及连接编码 Agent 与浏览器中的证据和动作。12
  • Y Combinator 公布 Own Your Intelligence Hackathon,时间为 9 月 27 日,地点为旧金山,公开主题包括自行构建 Agent、模型和记忆。13

其他快讯:产品与公司

  • Vext Labs 发布 JUWEL OS,公开描述包括重做内核和运行时,把文件、邮件、日历、浏览器和终端放进 AI 助手的工作范围,并在关键动作前请求确认。14
  • Norgard X App 发布,用于跟踪 100 家私有公司,页面包括新闻、X 帖子、融资轮、二级交易和媒体。15

其他快讯:模型与研究

  • Artificial Analysis 发布 Intelligence Index 4.2,加入 AA Briefcase 和 GDP.pdf 两项测试,移除 GPQA Diamond。16
  • 阿德莱德大学的 MIP 研究把通用编码 Agent 直接放进视觉语言导航环境,不提供地图、记忆模块或导航训练;公开帖子给出的 R2R-CE 成功率为 78%。17
  • PyTorch 官方预告 PyreFly 分享,内容涉及用 Python 静态类型检查器追踪 PyTorch 模块的张量形状。18
  • Google 的 Expert Intelligence 被转发介绍,电子书购买者可以把书里的知识应用到自己的项目中,示例是把写作风格手册用于修改草稿。19
  • LongDS 完整结果还给出平均准确率 48.45%,并记录任务前后阶段接近 47% 的准确率下降。5
  • MIP 研究写到,加入 waypoint predictor 后,Fable 5 混合版本成功率从 68.3% 升到 76.7%,环境步数减半。17
  • 量子位文章介绍 GPT-6 Astra 带动的 recurrent depth,并回顾阿里在循环 Transformer 方向的布局。20

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel