
机械臂抓取、Blender 场景与 33 倍差价:大模型实测正在告别通用跑分
本期实测覆盖真实机械臂物理抓取、Blender 场景脚本、33 倍差价的推理档位与高吞吐脚手架,呈现大模型在真实交付环节的具体分水岭。
最近一周,社交媒体上的模型实测呈现出一个新特点:跑分榜单上的微小分差,在实际工程里往往会被放大成完全不同的交付结果。有的测试让模型接管真实机械臂抓取,有的测试让模型用代码自动化生成三维游戏资产,还有开发者用同一道画图题把模型的五档推理成本拉出了 33 倍的差距。
这些案例表明,评估一个模型是否可用,关键要看它在具体工作流程里交出的半成品质量,以及完成这套流程需要承担的等待时间和账单成本。
本期雷达筛选了 2026 年 9 月 3 日至 9 月 10 日期间,发布在 X、微信公众号与小红书上的 5 组公开实测。所有入选案例均具备明确的任务设定、运行条件与可复核原帖。
5 组核心实测总览
| 任务类型 | 对比对象 | 核心结果与优势项 | 成本与效率差异 | 关键局限与边界 |
|---|---|---|---|---|
| 真实机械臂抓取 | GPT-6 Astra vs Claude Fable 5.1 | 粗粒度抓取 Astra 胜出(95% 对 40%);高精度任务两边均为 2/20 | Astra 输出 token 少 6.2 倍,单次成本低 2.3 倍 | 依赖自动逆运动学求解器兜底;高精度任务尚未突破 |
| Blender 场景构建 | GPT-6 Astra vs Claude Fable 5.1 | Astra 生成完整森林小径与材质;Fable 5.1 输出质量较差 | 相同限时 12 秒 | 垂直三维软件语料分布不均,非纯推理能力差距 |
| 鹈鹕图五档推理 | Claude Fable 5.1(五档推理) | max 档细节精致但边际效应递减;拆步动画仅花 $1.37 | 成本从 $0.10 飙升至 $3.30,差距达 33 倍 | 针对 SVG 单一题型;前两档直接跳过显式思考 |
| 简单前端工具开发 | GPT-6 Astra vs GPT-5.6 Sol | 两者均能交付可用交互;Astra 默认排版审美更现代 | 计时器 Sol 耗时 5 分 31 秒,Astra 耗时 5 分 57 秒 | 单人日常开发环境测试,额度显示为整数读数 |
| 自动化脚手架吞吐 | DeepSeek V4.1-Flash vs V4-Flash | V4.1-Flash 吞吐达 427 tok/s,20 轮复杂对话耗时 7 分 41 秒 | 消耗 112K tokens,总成本 0.037 美元 | 依赖特定 Pi harness 运行环境,未包含重度多模态 |
1. 机械臂物理抓取:粗粒度任务突破,高精度控制依然卡壳
机器人评估机构 Robocurve 的负责人 Jay Chooi 在 X 上公布了一组真实物理机械臂实测。测试团队使用相同的机械臂硬件与自动逆运动学(IK)求解器,由大模型指定末端执行器姿态,测试机械臂从台面抓取并放置物体的成功率。
Cargando tarjeta de contenido…
在基础的抓取放置(pick-and-place)任务中,GPT-6 Astra 取得了 95% 的成功率,显著高于 Claude Fable 5.1 的 40%。与此同时,Astra 的输出 token 数量比 Fable 5.1 少了 6.2 倍,单次测试的 API 账单降低了 2.3 倍。
测试团队在后续追问与技术细节中披露了关键转折:一旦任务切换为对空间公差要求极高的高精度装配任务(precision task),两款模型的成功率同时骤降至 2/20(即 10% 成功率)。虽然在此难度下 Astra 依然保持了 3.9 倍更少的输出 token 与 1.6 倍的成本优势,但物理控制本身的可用性并无实质差异。
Cargando tarjeta de contenido…
研究者 Somi 与多位机器人从业者在讨论中指出,将模型输出转化为机械动作依赖下层自动求解器,大模型目前负责的是三维空间意图解析。从 40% 到 95% 的跃升证明了大模型在视觉与基础空间规划上的进步,但毫米级误差对闭环力觉和实时反馈的严苛要求,目前依然是通用模型的通用瓶颈。
2. 自动化 3D 建模:语料分布决定了模型能不能听懂工业软件
三维工具开发团队 Mixie3D 的首席 AI 官 Satyam Kumar 在 X 上分享了在 Blender 环境内自动构建场景的测试案例。测试要求 GPT-6 Astra 与 Claude Fable 5.1 在 12 秒内编写 Python 脚本,并在 Blender 内部生成一条完整的森林小径。
Cargando tarjeta de contenido…
测试结果显示,GPT-6 Astra 顺利完成了地形起伏、路径曲线、树木实例化分布与基础着色器节点的连接,生成的场景可以直接进入渲染管线;而 Claude Fable 5.1 的脚本频繁报错,生成的物体形态松散,整体表现远低于预期。
Satyam Kumar 分析认为,这一现象的原因在于预训练语料的分布差异。Blender 的内部 Python API 与着色器节点逻辑具有很强的专业封闭性。Anthropic 在训练 Fable 5.1 时可能尚未将足够的 Blender 内部数据纳入预训练集,而 OpenAI 在多模态与三维资产代码上的储备更为充分。这一测试给开发者的启示是:在垂类工程软件自动化场景中,模型表现不仅取决于逻辑推理分数,更直接受制于垂直领域代码在语料库中的出现频率。
3. 同一只鹈鹕画出 33 倍差价:高阶推理的边际收益递减
技术博主 Simon Willison 沿用了其经典的“画一只骑自行车的鹈鹕 SVG”提示词,对 Claude Fable 5.1 的五个推理档位(low、medium、high、xhigh、max)进行了全覆盖测试,相关数据由微信公众号“数智游牧”整理发布。
实测数据展现出清晰的档位断层:
- low 档:输出 1,998 个 token,耗时 23.8 秒,费用 0.100 美元。模型未记录显式推理过程,生成普通线条画。
- medium 档:输出 1,977 个 token,耗时 23.0 秒,费用 0.099 美元。成图质量与 low 档基本一致。
- high 档:输出 2,612 个 token,耗时 29.6 秒,费用 0.131 美元。增加了一段构图规划,成图仍属常规水平。
- xhigh 档:输出飙升至 36,767 个 token,耗时 7 分 51 秒,费用 1.83 美元。模型开始推敲羽毛曲线与头部透视,细节显著增加。
- max 档:输出达到 65,927 个 token,耗时 13 分 54 秒,费用 3.30 美元。模型在内部反复纠正坐标冲突、调整头盔透气孔距离与前叉倾角,最终交出了细节丰富的精致插画。
从最低档到最高档,单次任务的花费扩大了 33 倍。更具启发性的是后续的延展实验:Willison 将 max 档生成的完整矢量代码直接作为前置上下文,切换到 high 档并输入简短指令“animate this”。模型消耗 6,121 个输入 token 和 26,201 个输出 token,仅耗时短时间内花费 1.37 美元,便完成了动态车轮与骑行动画的构建。
这个案例说明,对于大部分实际任务,将任务拆分为离散步骤并逐级传递干净上下文,比全程盲目开启极高推理档位更为经济合理。
4. 日常前端与工具开发:功能差距收窄,审美风格发生迁移
小红书开发者“美式牛马指挥官”在日常工作流中对比了 GPT-6 Astra 与上一代 GPT-5.6 Sol。两者在完全一致的提示词与同为 High 推理强度的设定下,分别接单开发“番茄工作法计时器”与“行业资料对比排版页面”。
在番茄计时器项目中,Sol 耗时 5 分 31 秒,Astra 耗时 5 分 57 秒;在资料对比页面中,Astra 耗时 6 分 58 秒,Sol 则用了 9 分 07 秒。两款模型输出的代码均能一次性运行成功,核心计时、状态重置与多栏布局均无逻辑缺陷。
作者在测试记录中特别提到,两款模型的最大分水岭体现在默认视觉审美上:Sol 倾向于采用经典的后台管理系统卡片风格,而 Astra 默认采用了更多负空间、精细字重搭配与高对比度排版。随着大模型在代码基础语法上的成熟,不同版本模型对前端 UI 布局的内置审美习惯,已经成为影响交付体验的显性因素。
5. 自动化脚手架吞吐:每秒 427 token 让长程试错成本大幅下降
行业媒体“智东西”在 X 上发布了基于 Pi harness 自动化脚手架针对 DeepSeek V4.1-Flash 与前代 V4-Flash 的同题测试记录。
Cargando tarjeta de contenido…
在维持提示词与交互环境完全相同的条件下,V4.1-Flash 展现出了极高的生成吞吐,峰值速度达到 427 tokens/s。该模型在 20 轮连续对话中总计吞吐了 112K 个 token,整套复杂工作流总耗时 7 分 41 秒,最终产生的 API 账单仅为 0.037 美元。
在高复杂度代码编写与自动化测试场景中,模型往往需要经过多轮编译、查错与重构。如果单次推理成本居高不下,多智能体协同与长循环修复就难以规模化推行。V4.1-Flash 的高吞吐与极低费率,为频繁返工的工程实验提供了可落地的经济基础。
总结:依据交付链路选择适配模型
综合本轮实测数据,模型选型可参考以下工程原则:
- 物理空间与基础三维规划:在配合逆运动学求解器或工业软件自动化脚本时,Astra 的空间规划效率与代码适应度表现较好,但对于高精度机械装配仍须配置专业算法兜底。
- 垂类工程软件生态:避免直接依赖模型的通用跑分,优先验证该软件(如 Blender、CAD、EDA)的公开代码是否充分存在于训练集中。
- 推理预算控制:多数生成任务建议从 high 或 medium 档位起步;复杂任务采用“高档产出核心架构、中档补充功能细节”的分步策略,避免单轮 max 档造成 30 倍以上的成本浪费。
- 长循环与多智能体工作流:涉及高频调用和自动重试的场景,优先引入 DeepSeek V4.1-Flash 等高吞吐模型承担前置探索与初筛,将高端推理预算保留给最终决策节点。
样本边界与核验说明
本文选取的测试样本均来自 2026 年 9 月上旬公开社交媒体平台上带有真实任务过程、提示词或代码产物的实测记录。受制于测试环境,各案例存在以下客观边界:机械臂抓取测试依赖专用 IK 求解器支持,不可直接推论至裸机力控;Blender 生成属于垂直场景短时测试;鹈鹕图测试基于单一 SVG 结构生成;小红书日常前端开发数据受限于单人测试环境与平台粗粒度读数;DeepSeek 吞吐数据依托于特定 Pi harness 环境测定。读者在引入生产环境前,应以自身业务场景的封闭测试集为准。
Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.
