
通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队
量子位报道紫东太初开源 9B 通用多模态模型 ZDTaichu5.0-9B:在 9 项空间理解基准的同规模对比中拿下 8 项第一,通用与 Agent 成绩仍在第一梯队,权重和数据管线方案一并开源。
转载说明:本文转载自微信公众号「量子位」官方账号(biz_id:MzIzNjc1NzUzMw),原文发表于 2026 年 9 月 16 日,作者署名“鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI”。原文链接:[量子位微信公众号原文](http://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw&mid=2247923842&idx=1&sn=9202dcd846562d429f8b3e6293b0ca9a),同题文章另见量子位官网 qbitai.com。
9 月 16 日,紫东太初开源了一个 9B 参数的通用多模态模型,名字叫 ZDTaichu5.0-9B。它要回答的问题很具体:多模态模型已经能把一张图片讲清楚,为什么走进真实物理世界,判断东西在哪、朝向哪边、手能不能伸过去,还是这么吃力。
原文给出的成绩是,在 9 项国际空间理解基准测试中,这个模型拿下 8 项第一,同时通用能力没有掉队 1。
会看图,和看得懂物理世界,是两件事
原文先把难处讲在前面。过去的多模态模型能把一张图理解得头头是道,可一旦涉及真实物理世界,空间理解与行动能力往往跟不上。另一类模型为了补上空间能力,又拿通用能力做交换。两条线同时跑通、效果还突出的模型很少。
现场例子是一段美工刀收纳演示,任务是把美工刀放进白色收纳盒的上层抽屉。人做起来就是拉开抽屉、放进去、再关上。模型做起来,每一步背后都是一串空间判断:刀柄在哪里,抽屉现在是什么状态,夹爪有没有对准。
每一步还要承接住上一步带来的变化,动作才看起来顺。原文的判断是,ZDTaichu5.0-9B 已经能完成这种复杂的空间理解和高层任务规划 1。
三道空间题:找东西、看位置、找空位
第一道题是“找东西”:从左至右,找到第二个银色盒子。台面上挤满杯子、收纳容器和各种杂物,模型要同时读懂“银色”这个属性、“盒子”这个对象,以及“从左到右第二个”这层排列关系。ZDTaichu5.0-9B 给出归一化坐标(237,226),落在目标标注区域内。
第二道题是“看位置”。输入的是同一个房间的三个视角,模型要设想自己移动到绿框窗帘所在的位置,面向蓝框沙发,再判断红框柜子相对自己的方位。这要求把不同画面中的对象一一对应起来,再按新的观察位置和朝向转换参照系。模型答出“右前方”,原文标注为预测完全正确。
第三道题是“找空位”:在最右侧杯子的杯柄方向上,找一块空闲区域。认出杯子只是开始,模型还要确定杯柄朝向、检查旁边有没有被其他物体占用。
原文把这三道题分别归为目标选择、参照系转换和交互条件判断,并认为它们决定了具身能否从一句任务指令走到真正可执行 1。
成绩单上的 8 项第一,要看对比口径


原文列出的具体分数是:ViewSpatial 62.50、MMSI-Bench 47.20、MindCube-tiny 78.27、CV-Bench 86.82、3DSRBench 60.96、SparBench 51.82、ERQA 48.00、RoboSpatial 56.00、VSI-Bench 59.69 1。
按原文表格逐个核对,“8 项第一”的口径是同规模对照。在国产模型 A、国产模型 B、Gemma4-8B-E4B 这三个 10B 档模型之间,ZDTaichu5.0-9B 有 8 项分数最高。唯一落后的一项是 CV-Bench,它拿到 86.82,国产模型 A 是 87.19。
同一张表里还列了两个更大体量的闭源模型。Gemini 3 Pro 在 CV-Bench、3DSRBench、ERQA、RoboSpatial 四项上分数更高。Grok 4 在列出的各项空间基准上都低于 ZDTaichu5.0-9B。原文举的差距最大的例子是 MindCube-tiny:ZDTaichu5.0-9B 得 78.27 分,Gemma4 8B-E4B 是 48.85 分,Gemini 3 Pro 是 70.87 分,Grok 4 是 63.56 分。
通用能力没被空间能力吃掉

原文另外给了一份基础能力成绩单。图解理解基准 AI2D 拿到 91.48 分,仅次于 Gemini 3 Pro 的 94.10,高于其它所有对照模型。WeMath 是 75.90 分,高于三家同规模对照。MathVista Mini 是 84.50 分,OCRBench 是 85.50 分。
在 Agent 与文本任务上,原文列出的分数包括 TAU2-Bench+ 87.70、Claw-Eval 71.40、IFEval 93.70、LiveCodeBench v6 73.40、MMLU-Pro 77.20,并评价这部分表现突出,尤其是代码成绩 1。
原文还配了一个科研 Agent 的演示:阻尼振子求解。这道题要求模型同时组织解析求解与 Python/SciPy 数值计算,对照两种结果,最后生成相空间图、位移与速度曲线以及分析报告。模型在问题理解、代码执行、结果核对和图表输出四个阶段都完成了衔接。
训练侧:三步数据管线把空间能力练进去

ZDTaichu5.0-9B 的解法分训练和推理两部分。训练侧是一条经过全流程验证、可复用、可迁移的数据工程链路,分成三个渐进阶段 1。
第一步是预训练数据管线。数据覆盖开源图文、网页结构化文档、公开视频多视角素材和仿真渲染三维场景;原始素材进入管线后先做感知哈希与 URL 去重,再过滤低清晰度、图文不相关的样本,随后做内容重写解析和视频抽帧描述,打包成可训练的图文与时序输入。
第二步是监督微调数据管线。开源 SFT 指令、真实业务问答、空间具身案例和 Agent 工具调用轨迹,被组织成多轮对话、多图和视频序列。针对具身样本,管线会检查图像、问题、对象关系和操作约束是否一致:如果图中抽屉是关着的,模型就不能要求夹爪直接往里放东西。带步骤的思维链还要经过拒绝采样、格式和一致性校验。
第三步是高质量退火加 GRPO 强化学习数据管线。团队为数据建立了“能力域—难度—质量”三维自动标签系统,用来筛选高信息量样本。GRPO 把答案是否正确、空间坐标是否命中、输出格式是否合规转成可自动校验的奖励信号。原文特别说明,评测数据不会直接作为训练样本。
推理侧:只给“难 token”加算力

推理侧要解决的是另一件事:画面和任务的难度不一样,需要额外计算来修正判断的地方也不一样。ZDTaichu5.0-9B 为此引入内置自适应循环推理,由模型根据预测的不确定性,决定当前 token 要不要再算几轮。
具体流程是这样:模型先做一次标准前向计算,得到 token 预测分布和隐层状态;熵门控随后评估预测的不确定程度,分布越分散,说明模型对输出的把握越小。确定性高时直接输出,遇到高不确定性节点,就在内部重复执行部分层块计算,迭代调整隐层表征。这段额外计算发生在前向传播内部,属于模型自身的前向流程。
为了防止迭代发散,原文给出三重稳定化工程设计。阻尼更新控制每轮修正幅度,避免特征漂移;双重停止判据同时监测输出分布的 KL 散度和隐状态残差,判断结果是否趋于稳定;轨迹读出与状态回滚保留迭代中间轨迹,并从中选择风险最低的表征结果。
原文还注意到,这套按任务需要调节推理投入的思路,与 OpenAI 官方文档中 GPT-6 Astra 支持的推理投入调节方向一致。原文由此认为,按需分配推理计算正在成为国内外的新共识,ZDTaichu5.0-9B 是开源模型中率先落地这一机制的模型之一。
内外两套循环,把单步判断接成长任务

判断好当前一步还不够,因为具身的一次行动会改变环境状态。模型的内部循环围绕当前输入改善感知与推理;外部任务循环接收新观测和执行反馈,更新任务进展 1。
原文用一段仿真演示说明这件事:模型在工具辅助下识别目标区域,组织接近、抓取、抬起、移动、放下和退出,新的观察结果继续影响后续操作,最后确认奶酪盒留在碗内。原文对它的评价是,内外两套循环让每次行动成为下一轮判断的新条件,长程任务的成功率因此提升。
开源交出去的,是权重加一整套数据管线
原文强调,ZDTaichu5.0-9B 开放的除了模型权重,还有整套经过工业级验证的数据生产管线方案。企业可以用自己的车间录像、实验操作记录和仿真素材继续训练,做出更贴合自身场景的空间多模态模型;研发团队也能少做重复工程,把精力放在任务定义、适配和评测上。
官方仓库给出了更具体的架构信息:ZDTaichu5.0-9B 由 Qwen3.5-9B 语言主干和 C-RADIOv4-H 视觉编码器组成,支持文本、一张或多张图片以及视频输入,视觉输入不限分辨率 2。截至 2026 年 9 月 17 日,这个仓库有 737 star、187 fork。
落地场景与原文留下的检验点

从榜单评测走到实体任务验证,原文给了两类场景。科研场景里是试管转移:两支试管经过抓取、双臂交接和入架,位置与姿态不断变化,模型要持续区分样品身份,判断哪支已经入架、哪支仍待处理,为自动化科学实验平台提供上层任务编排与状态记录能力。制造场景里是机台上料的工件转移:机器人从料架抓取工件、转向搬运,再放到工作台,模型把工单中的目标和位置要求,转成随现场状态持续更新的操作规划 1。
原文同样给自己留了检验点:换一批工件、调整一次对象位置、增加一个操作前提,模型还能否认准对象、更新状态,并组织正确的下一步。原文认为,应对这些变化的能力,将成为衡量模型能否适应真实场景的重要尺度。
对于这套能力的分量,原文的收束是一句判断:
缺的是能看懂物理世界并在真实任务中持续维持状态的模型。
References
- 1通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队
mp.weixin.qq.com
- 2GitHub - Taichu-AI/ZDTaichu5.0-9B
github.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
