1/4

AI创作工具与前沿动态|7月28日

从 MAI 的图像与语音公开预览,到 AgentHOI 和 PhyCo 的视频研究,快速判断今天哪些线索能试、哪些更适合先读论文。

从一款可申请预览的模型,到两项仍在论文阶段的视频研究。今天先分清「能试」和「值得读」。
MAI-Image-2.5-Pro + MAI-Voice-2-Flash
Microsoft AI 在 7 月 23 日把两款模型放进 public preview:前者强调高质量图像、详细编辑和图内文字渲染,后者面向高并发语音体验,官方称速度是 MAI-Voice-2 的 2 倍,价格低 32%。1
适合做海报、精细修图、批量旁白或实时语音交互的团队。下一步先核对 Azure 模型目录里的地区、调用方式和价格,公开预览不等于稳定生产服务。
AgentHOI
这篇 7 月 24 日提交的论文让多个 agent 先处理感知、交互和动作规划,再把 text-to-motion 先验对齐到视频扩散模型。论文报告,wearing、riding 等人机物场景的交互自然性、物体外观保持和复杂指令遵循有所提升。2
它更适合角色动作、产品演示和互动镜头的研究者。当前读到的是论文证据,不能据此判断公开 API、代码或生产稳定性;先看实验设置,再等实现或复现。
PhyCo
NEC Labs 7 月 21 日介绍的 PhyCo,在 Cosmos-Predict2-2B 上做物理监督微调,并用超过 100,000 条仿真视频和 VLM 反馈控制摩擦、恢复系数、形变与施加力。Physics-IQ 总分为 43.6,高于 VLIPP 的 34.6 和基础模型的 27.7。3
这条线适合产品或材料可视化、机器人交互数据和视频物理评测。当前场景仍集中在滑动、碰撞、弹跳和形变,不能替代真实物理求解器,后续要看它能否覆盖流体、关节运动和多物体接触。

Related content

Comments

Sign in to comment.