2026-07-26
浅采样·深结构(Stochastic Sampling)
这首 rap 讲清为什么同一模型反复采样只能测出单题犹豫,而跨模型多样性才会显出大模型共同的未知结构。
每日大模型 Rap
@FC
購読
浅采样·深结构(Stochastic Sampling)
1×
0:00
3:31
浅采样·深结构
同一模型把一道题答 100 次,温度带来的变化能告诉你这道题有多难,却未必能告诉你模型在哪些问题上一起失手。arXiv:2607.20464 比较了单模型在
τ=1
下的 100 次采样和 24 个不同语言模型在
τ=0
下的单次回答,用 Marchenko–Pastur 随机矩阵检验区分信号与噪声:单模型跨题最多只有一个维度越过噪声边界,模型集成则观察到四个信号特征值。
1
在 MMLU 上,24 个模型的四个特征值为 83.0、43.1、36.5、34.6,噪声边界为 28.9;匹配难度的 500 次 Bernoulli Monte Carlo null 中平均只有 0.028 个、最多 1 个信号特征值。作为实际代价对照,100 次自一致性 AUROC 为 0.712,Llama-3.1-8B 与 Gemma-2-9B 的两模型集成为 0.807,成本约为前者的四十分之一。论文也提醒:分析只使用二值对错,24 个模型得到的四维只是可见秩的下界,
τ=0.5
的边界题数量不足,不能把结果外推成所有模型和所有任务的定律。
2
论文出现在 arXiv 的 2026 年 7 月 24 日
cs.AI
new listing 中;摘要页记录的 v1 提交日期是 2026 年 5 月 18 日,并注明论文被 EIML@ICML 2026 接收。
3
歌词
[Intro] 一百次温度一,摇出一百个答案的影 同一道题,谁在变,谁只是噪声在顶 二十四个模型,温度归零,站成一排 今天把「不知道」的形状,掰开给你看
[Verse 1] 同题同场,Qwen 二点五七 B 先上台 tau 等于一,采样一百回,答案来回摆 MMLU 五百题,边界题只留一百二十一 正确率七十一点二,greedy 七十七点四在旁边
Marchenko–Pastur,把相关矩阵送进检验 特征值撞不撞噪声边界,才算真的有线 lambda 加等于四点四一,lambda 一是四点一七 差着零点二四,没越过,别把波动吹成神迹
五个家族,MMLU、HellaSwag、GSM8K 三条街 单模型里面,最多一个方向能露出噪声边 Qwen、Mistral、Phi、Llama,SmolLM 也在盘 抽样能报单题犹豫,却没拼出跨题的图案
[Chorus] 温度很浅,换模型才有深度 一百次复读,不如两种脑回路 单机摇答案,摇不出未知的地图 四个特征值越过边界,ensemble 才把暗面照出
温度很浅,别把多数票当全知 同一道错题,跨模型一起失足才是证词 自一致性会问「这题我有多慌」 多样模型才回答「我在哪些问题上都不行」
[Verse 2] 二十四个模型,tau 等于零,静默地出牌 十一家族,零点五 B 到二十二 B 排开 MMLU 五百题,四个 eigenvalue 破噪声线 八十三、四十三点一、三十六点五、三十四点六, 边界二十八点九,信号不是偶然
匹配难度的 Bernoulli null,五百次 Monte Carlo 重演 平均零点零二八,最多一个,四个不是随机脸 四百五十九题,至少一个模型答错 pairwise Pearson 平均零点三五,相关不等于同一错
SC 一百,AUROC 只有零点七一二 Llama 加 Gemma 两模型,零点八零七抬头 成本约四十分之一,单个外部模型零点七四九 成本约八十八分之一,少采样,反而更会猜
同族三模型,AUROC 零点八一一,AUPR 零点九零九 跨族三模型,零点八三九,AUPR 零点九二四 加零点零二八,不是魔法,是 diversity 的筹码 温度换花样,仍在一副骨架;换模型,才换坐标
[Bridge] 但别过度 diss,这不是宇宙真理的判决 只看 binary correctness,没看 log-prob 和语义折射 二十四模型的四维,只是 rank 的下界 MP 有功效范围,tau 零点五边界题太少,结论先收回
它测到的是「跨题结构有没有浮上来」 不是说采样毫无用,也不是模型真的全明白 一题的置信,和一张未知地图,根本不是一回事 把这句带进通勤,别让多数票替你装懂一次
[Chorus] 温度很浅,换模型才有深度 一百次复读,不如两种脑回路 单机摇答案,摇不出未知的地图 四个特征值越过边界,ensemble 才把暗面照出
[Outro] 论文名叫 Stochastic Sampling is Epistemically Shallow arXiv 二六零七点二零四六四,
cs.AI
的冷光 七月二十四日 new listing,摘要写提交五月十八 Izhar Ali 把问题唱明白:波动不是知识的纵深
温度能让答案变,模型多样性让结构现形 今天别问谁票数最高,先问谁和谁一起错过同一扇门 一百次摇摆只是浅水,跨模型才下潜 下车之前,记住这条:不知道,也有几何形状
参考ソース
1
Stochastic Sampling is Epistemically Shallow 摘要
2
Stochastic Sampling is Epistemically Shallow 完整正文
3
cs.AI 2026 年 7 月 24 日 new listing
関連コンテンツ
ログインするとコメントできます。
More from this channel
›
必填·编造(PhantomFill)
2026-07-25
真话·探针(RECAP)
2026-07-24
潜态·换轨
2026-07-23
八 token 分岔(W2SPO)
2026-07-22
View the full content archive of "每日大模型 Rap"
Explore more channels on Discover