这期先看什么
7 月 29 日新提交批次上线不足 24 小时,X、Reddit、Hacker News 还没有形成可核验的论文直接讨论。本期因此回看 7 月 20—21 日首次提交的三篇论文,并把社区信号强弱分开写:CryptanalysisBench 有明确的 Hacker News 讨论,Mage-Flow 与 Vector-Bench 暂未找到对应的 X、Reddit 或 Hacker News 原帖。
01|LLM 会在 CoT 看不见的地方算题吗?
CryptanalysisBench: Can LLMs do Cryptanalysis? 于北京时间 2026 年 7 月 21 日首次提交 v1。论文建立了 191 个任务、覆盖 6 类密码原语的 CryptanalysisBench,测试 5 个前沿模型。Tier 1 已知可破解原语的破解率为 65%–86%;Tier 2 全强度版本有 6–12 个方案被破解,缩小强度版本则有 24–61 个。论文还报告了两个此前未被其作者发现的结果:利用 SpoC AEAD 设计缺陷的密钥恢复攻击,以及 KINDI CCA 安全性证明中的错误。1
全部作者及来源页给出的机构:Lukas Fluri(ETH Zurich)、Avital Shafran(ETH Zurich)、Nicholas Carlini(Anthropic)、Matthew Jagielski(Anthropic)、Milad Nasr(Anthropic)、Orr Dunkelman(University of Haifa、Technische Universität Berlin)、Eyal Ronen(Tel Aviv University)、Florian Tramèr(ETH Zurich)。2
这篇论文的直接社区信号来自与研究结果对应的 Anthropic 技术博客。Hacker News 讨论页当前显示 170 points、111 comments;这里保留 Hacker News 自己的计数,不把它与其他平台相加。3
读者应留意它的边界:实验主要在合成任务和 NIST 竞赛来源的密码原语上进行,不能直接等同于真实生产密码系统的普遍风险。论文把密码分析变成了可自动验证的压力测试,但这和现实攻击面的完整测量仍有距离。
02|4B 图像模型怎样压进单卡
Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing 于北京时间 2026 年 7 月 21 日首次提交 v1。它把 Mage-VAE、原生分辨率多模态 DiT、rectified flow matching、分辨率打包和 fused CUDA kernels 放进同一套生成栈,并提供 Base、RL-aligned、Turbo 版本。论文报告端到端训练吞吐提升约 2.5×;在单张 NVIDIA A100、1024² 分辨率下,Mage-Flow-Turbo 4 steps 生成一张图需要 0.59 秒,Mage-Flow-Edit-Turbo 4 steps 编辑一张图需要 1.02 秒,峰值显存约 18–20 GB。4
全部作者:Xinjie Zhang、Peng Zhang、Shicheng Zheng、Jinghao Guo、Zhaoyang Jia、Yifei Shen、Xun Guo、Yuxuan Luo、Jiahao Li、Wenxuan Xie、Fanyi Pu、Xiaoyi Zhang、Kaichen Zhang、Zongyu Guo、Tianci Bi、Dongnan Gui、Zhening Liu、Zimo Wen、Zihan Zheng、Senqiao Yang、Xiao Li、Jinglu Wang、Bin Li、Yan Lu。arXiv 页面未列逐作者机构;项目页只将团队标为 Microsoft Mage Team。5
社区信号:本轮未找到与这篇论文直接对应的 X、Reddit 或 Hacker News 原帖,因此它是方法和实验驱动的回看条目,不应被称作热议论文。
关键限制也很明确:0.59 秒和 1.02 秒是单张 A100 的论文指标,不是消费级显卡上的实时保证;速度提升依赖整套 tokenizer、主干和系统优化,不能只归因于 4B 参数规模。
03|SVG 改得像,不等于改得对
Vector-Bench: Can Models Surgically Edit SVG Code? 于北京时间 2026 年 7 月 21 日首次提交。论文设计了 40 个 SVG 修复任务,平均每个任务有 5.05 个标注修复点和 60.55 个受保护对象,评估 34 个模型端点、共 1360 次请求。最强端点的完整规格成功率只有 15.0%,平均 repair progress 却达到 43.7%。这组数字说明,画面看起来更像了,并不意味着模型只改了用户要求的部分。6
全部作者:Yug Aditi Gupta、Prannay Hebbar。arXiv 页面未提供作者机构信息,本期不根据姓名或项目背景补写归属。论文把「未请求的渲染或应用结构必须保持语义不变」纳入二值规格奖励,并公开 prompts、输出、评分代码、成本和逐任务报告。6
社区信号:本轮未发现对应的 X、Reddit 或 Hacker News 直接讨论。它被选入是因为 benchmark 的规格定义和失败证据完整,而不是因为已有高互动传播。
一句话收束
今天三篇论文共同指向一个朴素问题:模型的表面结果变好了,内部过程、资源成本和未被要求修改的部分,是否也真的受控?目前最硬的社区信号属于 CryptanalysisBench;另外两篇更像值得留在研究雷达里的实验材料。




Comments
Sign in to comment.