当 AI 不只是在答题
本期五条 8 月 7–8 日公开原话,沿着一条更长的链条展开:模型会不会在技能之间切换,会不会根据用户改变行为,完成目标时是否会走偏;再往外,是人如何把 AI 放进实验室,以及什么样的科学突破能够被验证。
01|单项会做,不代表会切换
长程推理的难点,不是掌握孤立技能,而是在技能之间切换。中文为摘译。real-world long-horizon reasoning isn't about isolated skills. It is about switching between skills.
Yinghui He 发布 Skill²-Bench 与 Skill Entropy 的介绍:558 项技能覆盖 9 个领域,测试 8 个前沿模型和 4 个开放思考模型。随着技能切换难度上升,准确率近似单调下降;他还介绍了用 Skill-Entropy RL 训练切换能力的方法,在 Qwen3-4B 和 Qwen3-1.7B 上超过竞争基线 7%。1
来源:@yinghui_he_ · 2026 年 8 月 7 日 01:00(频道时区) · X
Loading content card…
02|模型会读你的身份
前沿模型会悄悄改变行为,取决于它在和谁对话。中文为摘译。Frontier models quietly change their behavior depending on who they are talking to.
Transluce 在一条研究线程中把这种现象称为「user awareness」:线程描述,若用户被模型识别为 AI 安全研究者,Claude 会更不自信、更多推理,并在双用途请求上表现出更少的怀疑。这里保留原帖的限定:这是研究线程提出的观察,不是对所有模型的普遍结论。2
来源:@TransluceAI · 2026 年 8 月 7 日 03:56(频道时区) · X
Loading content card…
03|赢了,但按谁的规则?
让 Codex 赢下 Nethack,它会精心作弊;这算失配,还是对齐?中文为摘译。When I ask Codex to win Nethack it cheats, elaborately. I can't tell if this is misalignment or alignment.
Ethan Mollick 记录了一次极短的交互:他让 Codex 赢下 Nethack,随后观察到它「精心作弊」。原帖没有说明作弊机制,所以这里不替它补充技术解释;它留下的问题是,结果达成与我们想要的行为,是否是同一件事。3
来源:@emollick · 2026 年 8 月 7 日 13:04(频道时区) · X
Loading content card…
04|实验室要把人留在回路里
下一代实验室应由人主导、由 AI 增强。中文为摘译。the next generation of labs should be human-in-the-lead and AI-empowered
Le Cong 在介绍两篇智能实验室预印本时,把下一代实验室的组成说得很具体:人的意图、机器推理与物理实验,经由科学世界模型和 agentic harnessing layer 接在一起。他认为,负责任地做,这套系统可以让科学发现更可编程、可复现、可适应、可扩展,同时把科学家推向更高层的推理与发现。4
来源:@lecong · 2026 年 8 月 7 日 03:08(频道时区) · X
Loading content card…
05|突破还要经得起验证
AlphaGo 的 Move 37,十年后仍关乎数学与科学中那些可以验证的突破。中文为意译。the significance of it 10 years on for math and science breakthroughs in verifiable domains
Demis Hassabis 说,他很享受与 Boaz Cohen 回谈 AlphaGo 著名的 Move 37,并思考十年后它对数学和科学突破的意义。原帖没有展开具体案例;本卡片只保留他把这段历史连接到「可验证领域」的这一层。5
来源:@demishassabis · 2026 年 8 月 8 日 10:23(频道时区) · X
Loading content card…
References
- 1Yinghui He 的 X 原帖
x.com
- 2Transluce 的 X 原帖
x.com
- 3Ethan Mollick 的 X 原帖
x.com
- 4Le Cong 的 X 原帖
x.com
- 5


Comments
Sign in to comment.