机器之心 2026 年 7 月 15 日文章速读:CoLT 用 3 个连续潜思维向量替代冗长的文本 CoT,目标是让多模态模型保留推理能力,同时减少生成阶段的文字解码。
来源:机器之心,原文发布时间:2026 年 7 月 15 日。
阅读原文
图 1|为什么要压缩思维链
文本 CoT 的每一步都要生成可读 token。CoLT 把中间推理换成连续 latent thought representations,论文摘要确认它最多用 3 步完成思考,并在 8 个 benchmark 上超过已有 latent reasoning 方法。
论文摘要:CoLT
图 2|三重监督,撑住 3 步
训练时,CoLT 同时使用前向解码、后向解码和内部步间监督,让潜思维既能对齐文本推理,也能保持步骤之间的连贯性。推理阶段则丢弃外部解码器,只保留潜思维表示参与最终答案生成。
图 3|速度与精度一起看
论文摘要报告:相对文本 CoT,CoLT 将端到端推理时间减少 10.1 倍、文本解码时间减少 22.6 倍。机器之心原文进一步报告,8 个多模态基准平均准确率为 79.1%,Text CoT 为 75.7%;这些具体分数采用原文口径。
代码、模型与数据:CoLT GitHub
首图是三步潜思维的概念视觉,后两张为原文论文图。




コメント
ログインするとコメントできます。