AI听:今天的 AI 正式版,开始接受真实任务考试

2026年7月31日,模型、视频生成、桌面智能体和开源安全工具集中上新,AI 的竞争开始从发布能力转向验证能否直接完成任务。

AI听:今天的 AI 正式版,开始接受真实任务考试
0:0015:46

节目导览

本期把 2026 年 7 月 31 日白名单公众号的 11 篇当日文章,压成一条主线:模型、视频生成、桌面智能体、电脑操作评测和开源安全工具,正在同时进入具体任务。节目重点解释,AI 的能力如何从发布页面走向工作流,以及开发者、企业和普通用户在真正使用前需要核对什么。

今天的判断

今天的增量不只是又多了几个模型,而是能力开始被放进真实入口里检查:能不能生成可用的视频,能不能操作电脑完成任务,能不能在标准环境里稳定运行,能不能让开发者检查和修复。发布方自述、公众号实测、访谈转述、论文结果和作者分析的证据等级不同,不能把厂商能力表直接等同于自己的交付结果。

本期要点

1. 正式版变多了,但证据要分层

量子位实测了字节跳动发布的 Seedance 2.5,并称即梦 AI 已经接入。文章给出的能力包括 30 秒视频原生直出、最长 3 分钟生成、局部增加和删除、最多同时参考 50 个素材,以及白模、绿幕素材和 Maya、Blender 插件。能确认的是入口和功能已经发布,文章中的「行业独家」和「影视级」仍属于发布方或媒体口径。对创作者来说,更值得测的是连续生成、局部修改和角色一致性能否撑过一条完整片子。1
新智元报道,DeepSeek V4 Flash 正式版 API 开启公测,结构和规模与 Preview 一致,主要变化来自后训练,并支持 Responses API 和 Codex。对开发者而言,Responses API 的价值在于让输出结构更稳定,减少自行解析结构化结果时的失败;但 V4 Pro 的 API、App 和网页端模型暂时没有同步变化,「追上某个榜单模型」仍应视为文章转述,而非全面领先结论。2
赛博禅心解读的 MiniMax H3,则把文本、图像、视频和声音放进统一的全模态生成框架,文章称最高支持 15 秒、2K 分辨率,并可原生输出双声道音视频;价格和四倍序列长度收益均为发布口径。文章也提到多模态上下文理解、画面精细度和模型规模仍需提升,权重开放以符合相关法律法规为前提。因此,今天的结论不是某个模型已经包打天下,而是内容生产的比较单位正在从单一模态转向素材理解、音视频输出和单位成本。3

2. 从生成内容到操作电脑

爱范儿上手了豆包电脑版的 Agent。文章描述它可以读文件、识别屏幕、操作软件和执行本地任务,还能把常用操作沉淀成技能,例如把几份周报整理成月度汇报 PPT。它并不是无条件的免费劳动力:文章提到免费额度约能支撑两次完整任务,标准版每月 68 元,网页版只开放部分能力;遇到验证码、登录异常或高风险本地操作时,仍可能需要人工接管。普通用户真正需要判断的是权限边界和失败后的暂停方式。4
甲子光年报道,中国团队「实在 Agent」以 90.2% 的成功率完成 OSWorld 测试,并称这是该基准自 2024 年发布以来首次突破 90%。文章同时提醒,核心突破仍发生在标准化实验环境,真正进入企业还要解决安全断路器、人机确认、回滚、成本和多智能体协同。90.2% 回答的是「在这套题里能完成多少」,还没有回答「在你的电脑里敢不敢让它自己做」。5
桌面 Agent 的评测至少要拆成四件事:能不能看懂当前状态,能不能选对下一步,做错后能不能回滚,最后能不能留下人看得懂的操作记录。个人用户可以从可撤销的整理和汇总任务开始;企业上线时,权限分层、敏感数据隔离和人工确认属于必要条件。

3. Agent 的差别越来越多出现在模型外面

Founder Park 整理了 OpenCode 创始人的访谈。OpenCode 是开源 Coding Agent,主打多模型和中立选项,文章转述的数字包括 1300 万月活、每天处理 7 万亿 Token、年化营收接近 6000 万美元和约 16 万月度付费订阅用户。这些数字来自访谈和公司口径,不是独立审计的财报;但它仍说明,开源工具的价值也可能在于组织模型选择、环境适配、调用记录和企业控制面板,而不只是训练一个更强的模型。6
把 Seedance 的素材控制、豆包的本地操作、OSWorld 的电脑任务和 OpenCode 的多模型编排放在一起看,模型决定能力上限,运行框架决定可用下限。权限、工具、重试、回滚、上下文和日志,正在从工程细节变成 AI 能否进入工作的决定因素。

4. 「开源」不等于模型全开

36 氪介绍的 Codex Security 是 CLI 加 TypeScript SDK,用于自动发现、验证和修复代码库漏洞。文章转述称,上线头 30 天扫描超过 120 万次提交,发现 792 个严重级别和 10561 条高危级别问题,反复扫描后误报率下降超过 50%。但文章也明确写到,开放的是应用层工具,模型层仍由 OpenAI 控制;开发者还需要 Node.js、Python、访问权限或 API Key。文章中的实测显示,单次扫描可能耗时近 53 分钟,失败示例花费约 13 美元。7
看到「开源」时,至少要继续问四件事:开放的是权重、应用、接口还是数据;能不能换模型;数据是否离开自己的环境;失败和超支由谁负责。OpenCode 的多模型中立和 Codex Security 的应用层开放都很有价值,但它们解决的不是同一个问题。

5. 世界模型开始从意图寻找动作

机器之心报道,浙江大学、清华 AIR 等团队提出 INTACT,把运动意图直接映射为动作,减少传统世界模型先生成大量候选动作、再逐个搜索的过程。文章转述的论文结果是:单任务实验只训练一个 epoch、不采样候选序列时,四项任务平均成功率为 95.33%;候选数量可从 9000 条降到 384 条,规划延迟从约 1.48 秒降到 2.9 至 5.5 毫秒。文章也明确提醒,评测主要在仿真环境,复杂真实场景的泛化仍需验证。8
量子位另一篇文章关注人形机器人使用灵巧手时容易「站桩」,介绍了一种双运动先验的人形控制框架,目标是在保持身体移动的同时完成灵巧操作。这仍是研究进展,不是量产能力;但它和 INTACT 放在一起,说明物理 AI 的难点正在从「能不能生成动作」转向动作、身体平衡和任务意图能否同时成立。9

6. 生产率还没兑现,投资已经先到

腾讯研究院今天发布的分析认为,短期一到两年,AI 对增长的支撑主要来自投资拉动,而不是已经兑现的生产率红利;中期三到五年更可能走向一个会遇到不少瓶颈的温和路径。这是作者的分析框架,不是已经发生的市场事实。文章同时引用多组外部研究:高盛测算生成式 AI 可能提升全球生产率 1.5 个百分点,而针对近 6000 位高管的调查中,接近九成的人认为 AI 对企业过去三年的生产率尚未产生实质影响;BIS 对欧洲企业的研究则发现,采用 AI 的企业劳动生产率高 4%。这些数字分别回答潜力、主观感受和已发生差异,不能互相替代。10
所以,大量模型和 Agent 上新并不自动等于生产率已经出现。企业更应该记录任务完成时间、返工率、总调用成本和一个月后仍在使用的人数,而不是只记录「大家都试过」。

7. 窄场景里的 AI,先争取留下来

Z Finance 报道了 LumiTopia 和它的 3D 乙女游戏《恋恋终序》。文章称,公司成立于 2024 年底,团队约 40 人,完成天使机构轮融资、估值过亿,产品目前内测,计划 2027 年公测;文章还转述团队介绍的万人报名、次日留存 73%、三日留存 68% 和 99.5% 场景没有失控等数据。这些融资、留存和技术效果都是创业团队口径,不能当作第三方验证,但案例本身说明,AI 产品需要一个足够具体的使用理由:导演、演员、对话和批评模型都被放进一个情感叙事场景里,真正的产品问题是用户是否愿意因为事件、记忆和角色关系留下来。11
通用能力越丰富,产品越需要具体场景。视频创作者需要可控镜头,开发者需要可替换模型和可查调用记录,办公用户需要可撤销的电脑操作,乙游玩家需要能持续发展的关系。AI 的入口可以很宽,但留下来的理由往往很窄。

给听众的四个问题

如果你是开发者,可以实际试一次 Responses API、桌面 Agent 或开源安全工具,但先使用可撤销、低权限的任务。你需要确认:发布方说的能力是否在自己的任务里成立;权限、工具、回滚和日志是否跟得上;所谓开源究竟开放了哪一层;产品带来的是一次惊艳,还是一条可复用的工作流程。
如果你在企业里采购 AI,把验收从「回答看起来不错」改成一张经营表:完成率、人工介入率、单位任务 Token、错误逃逸率、数据留存位置、私有化边界、上线后责任人和退出方案。
如果你只是普通用户,先看它能不能替你完成一件具体、重复、出错后可恢复的事,再决定是否长期使用或付费。

结语

今天的 11 篇文章放在一起,给出的不是「AI 已经自动化一切」,而是一张开始接受真实任务考试的成绩单:模型能力仍然重要,但工作流、权限、成本、证据和退出方案正在决定它能不能被真正使用。

本期公众号引用覆盖

本期事实均取自 2026 年 7 月 31 日发布的白名单公众号文章。✓ 表示本期实际引用,— 表示本期未引用。
  • 量子位 ✓
  • 新智元 ✓
  • 机器之心 ✓
  • Founder Park ✓
  • 数字生命卡兹克 —
  • 42 章经 —
  • MindCode —
  • 赛博禅心 ✓
  • 张小珺 —
  • 海外独角兽 —
  • 特工宇宙 —
  • 爱范儿 ✓
  • 甲子光年 ✓
  • 傅盛 —
  • 集智俱乐部 —
  • 刘润 —
  • 硅星人 pro —
  • Mac Talk —
  • 晚点 Latepost —
  • LateNews by 小晚 —
  • 经纬创投 —
  • 刘小排 r —
  • 葬 AI —
  • Z finance ✓
  • 36 氪 ✓
  • AGENT 橘 —
  • 归藏的 AI 工具箱 —
  • 卡尔的 AI 沃茨 —
  • AI 新榜 —
  • 腾讯研究院 ✓
  • 虎嗅 —
  • 真格基金 —
  • 花叔 —
  • AGI hunt —
  • 小平的 IO —

Related content

  • Sign in to comment.
More from this channel