
8月22日 X AI 日报:DeepSeek 上线视觉模型,NVIDIA 开源机器人触觉数据
本期整理 DeepSeek 视觉模型、NVIDIA AVO、Runway Ruby、Replit Agent 更新与 T-Rex 触觉数据,帮助你按入口、数据口径和执行边界判断哪些动态值得跟进。
覆盖窗口:2026 年 8 月 21 日 10:00 至 2026 年 8 月 22 日 10:00(北京时间)
这 24 小时里,AI 产品的变化集中在三类入口:视觉模型开始进入 Agent API,编码 Agent 把额度与定时任务写进产品,机器人研究则把触觉数据公开给开发者。下面保留 5 条有明确发布动作、开放材料或可核对指标的动态。
先看重点
- DeepSeek-V4-Flash-Vision-Exp 上线 API。 DeepSeek 称这款实验性多模态模型在文本能力上对齐 V4-Flash,并在多模态 Agent benchmark 上接近 Opus-4.8;
deepseek-v4-flash-vision-exp已可调用,DeepSeek Harness 0.1.1 同日加入支持。1 - NVIDIA AVO 报告 ARC-AGI-3 满分。 NVIDIA AI 称通用编码 Agent AVO 完成 25 个公开环境的 183 个关卡,并取得 100%;这个数字来自 NVIDIA 的原帖,适用范围仍是该 benchmark。2
- Runway Ruby 上线视频 HDR 转换。 Ruby 可把 SDR 视频转成最高 16-bit HDR,输出 ProRes 或 EXR 序列,支持已上传或已生成、最长 30 秒的视频。3
- Replit 把 Agent 的额度、记忆和定时任务放进同一轮更新。 Free Mode 面向 Core 和 Pro;Replit 称 Core 用户的日常聊天、构思和构建任务最高可比过去多 30 倍,额度每 5 小时重置。Routines beta 可以从对话安排任务并在原线程返回结果。456
- NVIDIA 与 Berkeley 的 T-Rex 开放触觉训练方法和数据。 Jim Fan 称,T-Rex 让视觉运动专家与触觉专家以两个时钟协作,并公开约 50 小时、约 5,500 集的机器人操作数据集。7
模型与能力入口:从「能看」走向「能执行」
DeepSeek:实验性视觉模型进入 API
DeepSeek 在北京时间 8 月 21 日 17:17 发布 V4-Flash-Vision-Exp。官方把它定义为实验性多模态模型,称它在文本能力上与 DeepSeek-V4-Flash 相当;在多模态 Agent benchmark 上,V4-Flash-Vision-Exp 的表现向 Opus-4.8 靠近。帖子给出了可调用的模型名:
deepseek-v4-flash-vision-exp。1这条消息对开发者最直接的变化,是视觉输入进入了现有 API 和 Agent 执行层。DeepSeek 同时称 DeepSeek Harness 0.1.1(用于运行 Agent 的工具)已加入开箱支持,试用者可以先沿已有 Harness 路径验证图片理解、工具调用和多步任务的组合效果。1
「接近 Opus-4.8」是发布方对 benchmark 的表述,原帖没有给出任务集、分数、样本数量或费用。当前更适合把它当作一个具体的 API 试用入口:先确认模型可用区域、输入格式、计费和视觉 Agent 的实际成功率,再判断它是否适合替换现有模型。
NVIDIA AVO:一项交互式推理 benchmark 的满分信号
NVIDIA AI 在北京时间 8 月 21 日 21:01 发布 AVO 的测试结果。NVIDIA 称,这个通用编码 Agent 在 ARC-AGI-3 interactive reasoning benchmark 上完成全部 183 个关卡,覆盖 25 个公开环境,得分 100%;帖子还强调,AVO 在没有说明、明确规则或给定目标的情况下自行判断下一步动作。2
ARC-AGI-3 测试的是 Agent 面对交互环境时能否探索、理解规则并完成任务。这个结果说明 AVO 在这组公开环境中给出了强烈的泛化信号,读者仍需把 benchmark 成绩与真实代码库中的需求澄清、修改、测试和回滚分开判断。原帖没有展开模型版本、运行成本、平均尝试次数或失败任务分布;团队若要跟进,应优先寻找这些字段。
Runway Ruby:把视频生成后的交付格式往前推
Runway 在北京时间 8 月 21 日 22:24 发布 Ruby。官方称 Ruby 可以把 SDR 视频转换成最高 16-bit HDR,并输出 ProRes 或 EXR 序列;输入可以是已经上传的视频,也可以是 Runway 生成的视频,长度上限为 30 秒。3
Ruby 处理的是生成后流程里的格式和色彩交付。需要把短片送进后期、保留高位深素材或交给支持 ProRes/EXR 的制作流程时,格式支持比单纯的生成速度更重要。原帖没有写明套餐、价格、HDR 转换的质量指标或色彩管理细节,制作团队仍要用一段真实素材核对高光、暗部和运动画面的结果。
Agent 产品:额度、记忆和定时任务同时成为产品条件
Replit:Free Mode 改写日常任务的额度计算
Replit 在北京时间 8 月 22 日 07:00 发布本周更新。Free Mode 面向 Core 和 Pro 订阅;Replit 称,在 Free Mode 中,日常聊天、构思和构建任务不再消耗 credits,Core 用户的可创建量最高达到过去的 30 倍,额度每 5 小时重置。帖子还称这一模式由 OpenAI 的 GPT-5.6 Luna 提供支持。5
同一轮更新还加入了 Routines beta 和 Memories。用户可以从一段对话安排定时任务,让任务结果回到同一线程;Replit 给出的例子包括 Slack、收件箱和日历的晨间摘要。Memories 则保存用户偏好的工作方式。6
这组变化把 Agent 的使用成本从「每次调用多少 credits」扩展到「哪些任务可以持续运行」。对团队来说,先要核对 Routines 能读取哪些连接器、能否修改外部系统、失败后怎样通知,以及 Memories 保存了哪些工作偏好。Free Mode 的 30 倍是 Replit 对 Core 用户的产品口径,实际额度仍以账户页面和当地套餐条款为准。
Replit 的总帖还把「对话式构思」「Agent 模式改名」和「黑盒渗透测试」列为本周更新项。黑盒测试会从外部攻击者视角检查应用,并可从 Security Center 运行 Level 3 scan;这一条与额度和记忆属于不同风险层,团队应把它当作安全检查入口单独验证。48
机器人研究:触觉开始拥有自己的数据和计算节奏
Jim Fan:T-Rex 把触觉信号放进模型主循环
NVIDIA 机器人负责人 Jim Fan 在北京时间 8 月 22 日 00:06 介绍与 Berkeley 合作的 T-Rex。他把机器人当前的视觉限制比作戴着厚手套做精细动作:磁性零件是否吸附、纸杯是否从杯叠中脱离、USB 是否对准接口,这些接触状态难以从摄像头单独判断。7
T-Rex 的方法让视觉运动专家负责较慢的动作规划,让触觉专家以更高频率修正接触动作。Jim Fan 写道,系统每个视觉时钟对应四个「touch ticks」。项目同时公开了约 50 小时、约 5,500 集 的同步机器人操作数据,数据来自一只具有 22 个自由度 的触觉机械手,并称数据已经放到 Hugging Face。7
这条信息的短期价值在于补齐研究入口:开发者可以同时看到模型结构、数据规模和训练路线,而不是只看到一段机器人演示。数据集「目前公开」来自项目负责人的 X 帖;实际下载地址、许可证、传感器型号和复现实验指标,仍需要沿项目页面继续核对。Jim Fan 对「largest tactile dataset ever released」的说法属于发布方判断,不能直接当作行业统计结论。
本期判断:先核对执行条件,再比较能力宣传
本期五条动态的共同点很具体:DeepSeek 把视觉模型接到 API 和 Harness,Replit 把 Agent 接到额度、记忆和定时任务,Runway 把生成视频接到 HDR 交付,T-Rex 把机器人接到触觉数据,NVIDIA AVO 则把编码 Agent 放进交互式 benchmark。它们都把「模型能做什么」推进到「模型在哪个入口、用什么数据、按什么统计口径完成任务」。
读者今天继续跟进时,优先记录五个字段:模型或功能的准确名称、可用入口与套餐、输入数据和授权范围、benchmark 的任务定义、失败后的人工接管方式。这些字段齐全,X 帖里的发布动作才足以支持一次可控试用;字段仍然缺失时,先把它作为后续核验清单。
References
- 1
- 2
- 3Runway:Ruby 发布
x.com
- 4Replit:本周更新总览
x.com
- 5Replit:Free Mode
x.com
- 6
- 7
- 8Replit:黑盒渗透测试
x.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
