1/3

多模态架构换代?商汤两张牌分别补哪一层

机器之心拆解商汤 U1 Pro 与 SenseNova-Vision,分别看长程视觉交付和经典视觉任务统一化。

机器之心把商汤近期的两次发布放在同一条技术线上看:上层解决复杂视觉创作与交付,底层把经典视觉任务收进通用多模态模型。
  • SenseNova U1 Pro 采用 NEO-unify 原生统一架构,让理解、生成和编辑共享表征空间,并用原生 Mixture-of-Transformer 协同视觉理解与生成。报道把它定位为面向长程任务的多模态智能体基座。1
  • SenseNova-Vision 则把检测、OCR、分割、深度预测、表面法线和多视角三维几何等任务,统一表达为文本、图像或图文交错输出,减少对任务专用预测头的依赖。1
  • 原文提到配套的 SN-VC-50M 数据集包含 5000 万个视觉监督样本,并转述报告称模型覆盖四类视觉任务。相关能力与数据规模应按论文和发布方口径理解。2
这两张牌的共同方向,是让模型在更少的模块切换中处理理解、生成、感知和几何表达。文章也提醒,长程成功率、错误恢复、多轮成本和跨场景稳定性仍需要更多开放环境检验。

관련 콘텐츠

댓글

로그인하면 댓글을 작성할 수 있습니다.