本期覆盖北京时间 8 月 3 日至 5 日公开的三条线索:控制点正从 prompt 移到入口、参考与时序。
8 月 3 日,Qwen 发布 Qwen3.8-Max。官方页面给出的模型规模是 2.4 trillion parameters、95B active;能力范围包括编码、工作流、研究、长周期任务与多模态 Agent,入口包括 QwenCloud API 和 Qwen Studio。页面还写明 open weights 将于下周发布,但没有给出许可证或本地部署条款。1
8 月 5 日提交的 StyleComposer 把参考驱动的图像风格拆成颜色、纹理和空间结构:颜色走 VAE 的色度子空间,纹理走注意力 K/V 路径,结构走 Q 路径;三种属性各有独立控制,不需要训练或 inversion。官方项目页展示了三参考组合与属性强度控制,但本次没有核验到可下载代码或权重入口。23
同日提交的 In-Context Forcing 处理的是视频生成的连续性:近帧使用更高噪声、远帧使用更低噪声,再配合分步 rolling KV cache 和跨帧因果注意力,减少模型复制局部细节或失去指导的问题。论文称在 VBench 上同时改善视觉保真度与推理速度;它仍是推理架构研究,训练复杂度、代码和权重状态都需要继续核验。4
证据状态:Qwen 是官方产品发布,云端入口已给出,但开放权重和许可证仍不完整;后两条是 arXiv 论文,不应直接当成可安装的创作工具。今天的顺序很简单:先试 QwenCloud / Studio,再把 StyleComposer 和 In-Context Forcing 当作参考图控制与视频推理的复现线索。
References
- 1
- 2StyleComposer 论文原文arxiv.org
- 3StyleComposer 官方项目页lexxsh.github.io
- 4In-Context Forcing 论文原文arxiv.org


Comments
Sign in to comment.