arXiv AI 前沿日报|8 月 11 日:创造性标记、HLS 验证与推理路由

从「算力该花给谁」出发,拆解 CreativeInstruct、HLSmith 和 CoBa 的方法、关键数字、实验边界与真实社区信号。

本期三篇表面跨度很大,但都在回答同一个问题:有限算力该分给哪一段 token、哪一次硬件优化动作、哪一个候选答案。
arXiv recent 将它们归入 Mon, 10 Aug 2026 公告批次;按 arXiv 20:00 ET 的放榜时间换算,这一批约在北京时间 8 月 11 日 08:00 出现。三篇的 v1 实际提交时间更早,分别落在 8 月 7 日和 8 日,不能把公告日当成首次提交日。123
本期排序只计作者帖和人工第三方帖;互动数保留各平台原生口径,不跨平台相加。Reddit 本轮没有找到对应论文的直接讨论。

1. CreativeInstruct:把创造性区间教给一个模型

论文:CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity(arXiv 2608.07460v1:2026-08-08 01:55:48(北京时间) 作者与机构:Ananya Sahu—Columbia University;Mohit Bansal—University of North Carolina at Chapel Hill;Elias Stengel-Eskin—The University of Texas at Austin。4
团队先从 Tülu V3 SFT 数据中过滤 4,000 个英文写作 prompt,每个生成 3 个回答,得到 12,000 个样本。BACo 的 prob+punc 路由按 token 熵在基础模型和指令模型之间切换;连续来自基础模型的区间会被 [StartCreativity][EndCreativity] 包围。LoRA 随后学习这些标记,推理时不再需要同时访问两个模型。4
人类评测由 3 名非作者标注者完成。50 组成对比较中,70.3% 更偏好 CreativeInstruct 的创造性,创造性维度的一致性 κ=0.720;质量维 κ=-0.167,因此作者放弃了这一维的人评结论。这个 70.3% 不是质量胜率。5
在 Qwen3 8B + GRPO 的 Table 6 中,CreativeInstruct+RL 相对 Instruct+RL 的 AMC 从 0.438 升到 0.478,MATH 从 0.409 升到 0.459,分别提高 4.0 和 5.0 个百分点。论文没有独立 Limitations 章节;可直接确认的边界是英文叙事数据、50 组小样本人评,以及 MATH/AMC 两项 RL 结果。5
作者 @EliasEskin 于北京时间 8 月 11 日 00:29 发布主帖;抓取时页面值为 29 赞、12 转、1 回、1,166 浏览。该账号随后还发布了数据帖,抓取时为 1 赞、44 浏览。67
Loading content card…
精读前先核对:BACo 标签能否从英文叙事迁移到开放域;70.3% 只回答「更有创造性吗」,没有回答「质量更好吗」。

2. HLSmith:先用守卫筛动作,再让工具链验收

论文:HLSmith: An Expert-Guided Agentic Framework for C/C++-to-HLS Translation(arXiv 2608.06791v1:2026-08-07 12:27:04(北京时间) 作者与机构:Yuebo Luo—University of Minnesota Twin Cities;Ahmad Sedigh Baroughi—Simon Fraser University;Philip Stachura—University of Minnesota Twin Cities、Simon Fraser University;Le Chen—Argonne National Laboratory;Venkatram Vishwanath—Argonne National Laboratory;Zhenman Fang—University of Minnesota Twin Cities、Simon Fraser University;Caiwen Ding—University of Minnesota Twin Cities。机构映射来自 PDF 首页脚注。89
HLSmith 接收无 pragma 的算法 C、参考实现和硬件约束。Translator 先生成 HLS C/C++;Advisor 从经验库调用带前置条件与不安全条件的优化动作;Analyzer 用 Vitis HLS 做 C 仿真、综合和 QoR 诊断;Verifier 再做软件与 RTL 联合仿真。守卫条件不满足的动作不会放行。8
与 ChatHLS 共同覆盖的 14 个内核中,HLSmith 有 14/14 个 valid design,ChatHLS 为 8/14;这里的 valid 不只是译码成功,而是软件和 RTL 双重通过。对 8 个共同通过内核计算时,包含 syr2k 的几何平均加速为 6.91×;剔除这个离群内核后,其余 7 核的几何平均为 4.24×。9
实验边界很窄:PolyBench 28 核、Vitis HLS 2023.2、AMD Alveo U280、300 MHz 单工具链。7 核灵敏度集上的 4.24× 不能直接外推成普遍加速。
人工第三方账号 @Underfox3 于北京时间 8 月 10 日 17:59 发布讨论帖;抓取时为 10 赞、7 转、1 回、967 浏览。对应 Hacker News 条目于北京时间 8 月 10 日 21:52 发布,抓取时为 2 points、0 comments;两平台指标不相加。1011
Loading content card…
精读前先核对:换一套 HLS 工具链、FPGA 和内核后,14/14 的有效设计率与 4.24× 是否还成立。

3. CoBa:把强验证器留给少数候选

论文:CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing(arXiv 2608.07424v1:2026-08-08 01:12:13(北京时间) 作者与机构:Yan Zhou、Yue Ouyang、Kaiyang Zheng—长沙理工大学数学与统计学院;Suncheng Xiang(通讯作者)—上海交通大学生物医学工程学院。机构映射来自 PDF 首页脚注。1213
CoBa 先采 2 个 warm-up 答案,用规则频率和 Qwen3-8B 轻量验证器打分;当头部答案占比至少 0.6、轻量分至少 0.7 时早停,否则继续采样。最后只把 top-4 送给 Qwen3-14B 强验证器融合。成本除了总 token,还用模型参数量加权后的 token 统计不同验证器的成本。12
Table 2 汇总 3 个生成器 × 5 个数学或符号基准,共 15 个数据集—生成器组合、3,129 次评估。Routed-Strong 的宏平均准确率为 85.13%,best-of-16 majority 为 85.12%;参数加权 token 从每项 1,533.3k 降到 629.9k,省 58.9%。和 self-eval weighted 比,准确率是 85.13% 对 85.20%,参数加权 token 省 49.1%。13
宏平均接近不代表逐例完全打平:论文的配对检验仍显示 best-of-16 高 0.70 个百分点,但成本为 CoBa 的 2.43 倍。所有方法复用预生成的 16 候选池;数学与符号任务之外、在线部署中的收益还没有验证。12
人工第三方账号 @bingwujinyi 于北京时间 8 月 11 日 02:45 发布讨论帖;抓取时页面值为 1 赞、4 回复、169 浏览,属于弱信号。14
Loading content card…
精读前先核对:参数加权 token 是否符合自己的成本模型;49.1% 只对应 self-eval weighted 这条基线,不能移到其他比较对象上。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments

Sign in to comment.