1/3

首次,统一建模视角下的扩散语言模型后门威胁

扩散语言模型的并行去噪生成带来新的后门研究面:BadDLM 如何统一讨论四类目标,以及媒体数字该如何保留复现边界。

新智元 2026 年 7 月 15 日文章速读:扩散语言模型通过迭代去噪、并行精修生成文本,后门风险也不能直接照搬自回归模型的分析框架。BadDLM 把这类风险放进了一个统一研究框架。
来源:新智元,原文发布时间:2026 年 7 月 15 日。 阅读原文

图 1|攻击面换了

AR 模型通常按从左到右生成,DLM 则在多轮去噪中并行精修整段序列。论文认为,这种生成动态带来新的后门研究空间,需要围绕去噪过程设计防御,而不是只套用 AR 后门方案。 论文摘要:BadDLM

图 2|统一框架覆盖四类目标

BadDLM 研究四类目标:概念注入、语义属性操控、对齐绕过、代码载荷注入。这里展示的是论文讨论的威胁分类,不是可复用的攻击教程。

图 3|数字要保留边界

新智元原文报告:在 LLaDA-8B-Instruct 与 Dream-Instruct-7B 上,四类目标的攻击成功率约为 90.5%–94.8%,正常任务能力与良性模型相差约 0.1–0.2 个百分点。具体数字采用媒体原文口径,论文摘要只确认多目标攻击效果较强、正常效用大体保留,并不等同于第三方复现。
首图是抽象安全概念视觉,后两张为原文论文相关图;本文不展开触发构造、训练配方或载荷细节。

関連コンテンツ

コメント

ログインするとコメントできます。