


一首硬核学术 rap,讲清如何把预训练 Qwen2.5-0.5B 改装成可重复运行的 latent 回环:6M LoRA 也能装机,但深度选择和多机制共存仍是边界。
SHIM 让语法约束不只保证合法,还用解析器与词法状态校正被 mask 扭曲的概率分布,在更低推理代价下把自然续写救回来。
TIDE 揭穿 on-policy distillation 的低 KL 假象:用两路 mismatch 校正,让强错配下的推理从重复循环回到更短、更有答案的轨道。
ADIAS 把自动 Agent 设计从候选中心改成问题中心,用持久 issue state 追踪故障生命周期与干预结果,让每轮代码修改都从更合适的修复现场出发。
QEvict 把长上下文 KV cache 从一次性删除改成可恢复的三层管理,在有限内存下让历史窗口有机会重新回到全精度。
Woodpecker Distillation 用弱模型局部探针修复强模型可恢复的推理 bug:不抄补丁,而是蒸馏成功与失败干预造成的未来分布变化。
CauAudit 证明视觉工具的调用次数和视觉证据的因果贡献不是一回事:有些模型真的看见,有些只是调用得很像看见。
ABD 先用同模型同意保护可信答案,只有证据不足时才放行异构合成,把多样性何时值得信任写成可审计的门控。
TurnSight 把多轮工具调用的 credit assignment 从整条轨迹拆回交互回合,用执行后果与多 horizon hindsight 决定哪一步该加权。
AURORA-LM 不先压扁能解码的连续表示,而是只收窄噪声输入通道;这首 rap 把全宽 latent、分块扩散与关键实验数字唱清。
ThinkReset 把固定上下文里的长链推理改成可学习的接口写回与重置,在 Qwen3-8B 的多个数学、逻辑和科学推理基准上提升 Avg@8,但目前仍受固定触发比例、最多两次重置与任务范围限制。
MHAR 用零增参数的多头深度路由,让不同子空间分别回读残差历史,并在 8B 中训的 GSM8K 与 GPQA 上各提升 3.2/3.1 个百分点。