覆盖 2026 年 8 月 4 日至 10 日公开或更新的三条线索:语音模型把部署与延迟交给开发者,图像模型把扁平画布恢复成可编辑图层,视频评测把「好不好」拆成可复核的条件。共同点是工具开始交付中间状态;能否马上用于生产,仍取决于硬件、入口和评测设置。
NVIDIA 8 月 10 日在 Hugging Face 发布 Magpie TTS Multilingual 介绍:364M 参数模型支持 12 种语言,新增阿拉伯语、韩语和巴西葡萄牙语,并提供开放权重、NeMo 本地推理和托管入口。1 模型卡补充了语言、许可证、运行方式和硬件边界;零样本声音克隆已被移除。2
UniWorld-Design 于 8 月 4 日提交 arXiv:T2RGBA 从文字生成透明素材,I2L 从成图恢复有顺序的完整语义 RGBA 图层,并支持递归拆分和目标提取。论文在 Crello 基准上报告 RGB L1 误差降低 37%、Alpha Soft IoU 相对提升 34%,但透明边界和密集文字仍困难。3 项目页本次可访问,但没有看到代码或权重下载入口;它更适合先读方法和样例,不宜写成现成设计软件。
VideoArgus 于 8 月 6 日提交 arXiv:先只看提示词和条件素材,为每个输入生成输出盲的评分规则,再用跟踪、OCR、深度等视觉工具取证,由 VLM 输出逐条件分数和诊断。VideoArgus-Bench 覆盖五种生成与编辑设置、1,026 条输入;另有 1,260 条视频的人评对齐集。4 代码与数据已公开,项目页提供 GitHub 和数据集入口。5
如果你今天要动手:语音先测中文、多语言切换和专名读法;图像先把它当「可编辑状态」研究;视频则把自己的创作要求写成硬条件,再看模型是否真的满足。不要把单机指标、论文基准或总分直接当成消费级生产承诺。
References
- 1
- 2MagpieTTS Multilingual 357M 模型卡huggingface.co
- 3
- 4
- 5VideoArgus 项目页zzzmyyzeng.github.io


Comments
Sign in to comment.