AI 创业播客日报|2026 年 9 月 2 日早报

AI 创业播客日报|2026 年 9 月 2 日早报

聚合 2026 年 9 月 1 日晚间至 9 月 2 日早间的 AI 与创业圈新增事实。

0:00 / 9:32
本期聚合 2026 年 9 月 1 日晚间至 9 月 2 日早间的 AI 与创业圈新增事实,重点覆盖模型、Agent、真实网页执行、语音识别和视频理解。

重点事实

Claude Fable 5.1 与 Mythos 5.1

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1。Fable 5.1 面向普通用户、开发者和企业,Mythos 5.1 面向经过审核的网络安全与生命科学机构。1
Fable 5.1 已进入 Claude.ai、Claude Code 和 Claude API,也通过 AWS、Google Cloud 与 Microsoft Azure 提供。开发者可以调用 claude-fable-5-12
Fable 5.1 的输入价格为每百万 Token 十美元,输出价格为每百万 Token 五十美元;缓存读取价格降至每百万 Token 零点二五美元,降幅百分之七十五。Anthropic 按 2026 年 8 月的使用数据测算,典型工作负载成本约降百分之二十五,高度 Agent 化任务最高约降百分之四十五。3
公开测试中,Fable 5.1 在 Terminal-Bench-Science 0.1 上为百分之五十二点六,上一代 Fable 5 为百分之二十四点七;在 Terminal-Bench 4.0 上,Fable 5.1 为百分之五十五点八,Mythos 5.1 为百分之六十点九。3
Anthropic 还介绍了持续运行三十八小时的机器学习实验,以及通过反汇编外部程序库、比对核心转储文件定位第三方程序库错误的案例。Fable 5.1 可以帮助发现软件漏洞,但仍不能直接生成漏洞利用程序。2
Anthropic 同时发布 Enterprise Frontier Safeguards,计划从 2026 年秋季开始分阶段上线。企业可以把数据保存在自己控制的云基础设施中。4

OpenAI Astra 安全预览

OpenAI 发布 Astra 预览,称该模型的网络安全能力达到 Preparedness Framework 的 Critical 阈值,并公开模型评估方式、安全防护进展和后续改进方向。该帖发布的是预览信息,不是完整产品上线公告。5
OpenAI CEO 在同一窗口继续讨论模型能力提升、网络安全风险和上线前测试。6

ClawBench:真实生产网站上的 Agent 测试

ClawBench 在一百四十四个真实生产网站上设置一百五十三个日常任务,覆盖购物、订票、求职、社交、工作和保险报价等十五类场景。任务包含填写表单、加购物车、预约和准备提交等写操作。7
评测使用终态请求拦截:人类标注员先完成任务并标出最后一个不可逆的 HTTP 请求,系统再通过 Chrome 扩展和 Chrome DevTools Protocol 监控出站流量。论文报告称,一百五十三次人类参考运行中,拦截器全部捕获终端请求,且没有误拦截导航流量。89
Claude Sonnet 4.6 的完成率约为三分之一;GPT-5.4 完成十个任务,占百分之六点五,并在八十五个任务上提前退出。Qwen 3.5 的完成率为百分之二十六点一,单任务 API 成本约一美元零二美分;GLM-5 的完成率为百分之二十四点二,单任务 API 成本约零点六四美元。7
不同模型在不同场景的结果不同:Sonnet 4.6 在购物和社交任务上最高,GLM-5 在工作任务上最高,Qwen 3.5 与 Gemini 3 Flash 在旅行任务上并列最高;求职任务中,最高完成率为百分之十二点五。7

Meta Muse Voice Transcribe

Meta 推出 Muse Voice Transcribe,并称这是 Meta Superintelligence Labs 的第一个实时音频感知模型。模型提供实时流式语音识别、二十多个说话人的分离和端点检测,支持多语言和中英文切换。1011
Meta 还介绍了语言、关键词和上下文偏置能力,并称模型在 Artificial Analysis 的流式语音转文字评测和公开说话人分离基准上排名第一。1112

Gemini Agentic Video Understanding

Google DeepMind 发布 Gemini 的 Agentic 视频理解能力,称最新 Gemini 模型可以更准确地分析视频,并在相关任务中最高减少百分之八十八的 Token 使用量。13
Logan Kilpatrick 发文说,这项能力可以通过 Gemini API 按视频启用,最新模型包括 Gemini 3.7 Flash。14

其他快讯

  • Perplexity Mac 应用向所有用户提供混合计算,Computer 可以把任务从云端转到 Mac 上运行的本地模型,私有文件和敏感数据步骤可以在本地完成。15
  • Y Combinator 介绍,Wafer 推出云服务四个月后从零做到八百万美元年化经常性收入,并完成四千万美元 A 轮融资;Wafer 用 Agent 优化 GPU 推理并运行开源模型。16
  • OpenClaw 发布 v2026.8.2,也叫 OpenClaw 2.0.1,公告称该版本主要修复更新带来的破坏性问题。17
  • Kami 发布 1.14 版本,开发者介绍该工具用于把 brief 转成文档,并加入新的页面设计和输出检查。18
  • OpenAI 发布医疗产品更新,宣布新的 EHR 集成可以连接支持的 Epic 环境,并提供连接另外九个行业数据源的插件。19
  • Vercel 与 TanStack 达成合作,Vercel 称将为使用 Next.js 或 TanStack 的客户提供服务与支持。20
  • 36 氪报道 NestWorks 完成融资,量子位文章介绍金属材料和数据中心相关进展,36 氪另一篇文章介绍 Oura 的 IPO 计划和估值,36 氪文章报道宇树相关动态。21222324
  • Box 的测试更新显示,Fable 5.1 在企业非结构化数据任务上比 Fable 5 高七个百分点,随后将进入 Box AI Studio。25
  • Fable 5.1 已经接入 Vercel AI Gateway,可以直接试用。26
  • Grok Bot 新增 Tinkabot,可以查看 API、创建 MCP 和 skills,再把插件提交审核。27
  • Mercury 2.5 Preview 已在 OpenRouter 独家上线,并提供百分之八十的限时折扣,截止到九月七日。28
  • ViskoAI 发布 Orbis 1.0,这是它的首个 Live Model,可以生成带持久记忆和互动能力的世界,API 通过 Reactor World 提供。29
  • World Labs 公布 Atlas,模型可以生成带精确镜头控制的图像和视频帧,并把场景重建成三维空间;团队说将在几周内开放早期体验。30
  • 一条 Shopify 机器学习团队的更新说,微调后的零点八 B 模型在一个专项任务上超过 GPT-5.6 Sol 的高推理档。31
  • LangChain 社区展示了一个 Deep Research Agent,用搜索、收集、综合、引用和保存报告的流程生成带来源答案。32
  • Transluce AI 发布一项评测,覆盖 OpenAI、Anthropic、Google、Meta、xAI、Thinking Machines、DeepSeek 和 Moonshot AI 的七十七个模型变体。33
  • Bland 宣布成为美国首家获得 FedRAMP 20x Class A 认证的语音 AI 公司,并把电话基础设施提供给联邦机构。34

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content