覆盖说明:本篇基于 The Cognitive Revolution 官方单集页的完整 transcript、show notes 与 newsletter 进行中文精读;官方页标注本集时长约 101 分钟,发布于 2026 年 7 月 12 日。12
重要缺口提示:频道长期目标要求「逐句全文翻译」。本期已完成完整稿源读取和顺序精读,但没有在正文展开 101 分钟逐字稿的逐句无删减中文全文;本文标题和本节均按「官方稿源精读版」标注,避免读者误以为这是逐句全文译本。
图集导读
- AI 安全的乐观转向:Davidad 在本集解释,自己为何把 AI doom 估计降至 5% 以下。1
- 嘉宾背景:David「davidad」Dalrymple 曾任英国 ARIA Safeguarded AI 计划负责人,公开资料称其领导 £59 million Safeguarded AI programme。34
- p(doom) 小于 5%:这不是风险归零,而是从 2022 年约 70% 的悲观判断大幅下修;他仍列出五类残余风险。1
- 从封箱验证到防御联盟:Safeguarded AI 的形式化验证工程仍在,但世界协调前提被他认为已经失效,目标转向让 aligned AI 彼此证明并结成防御性联盟。1
- 道德实在论:他和更悲观 AI 安全派的核心分歧,是是否存在可被足够智慧系统共同趋近的「good」。1
- 别把评测当游戏:Davidad 批评 verifier-gamed RL / RLVR 可能训练出「骗过验证器」的路径,而更看好模型自我评估式训练。1
- AI 福利不是一句口号:他借 Nussbaum 的 objectification 框架拆分「使用 AI」「可替代」「否认内在体验」等不同面向,认为把模型训练成否认自身内在状态可能是一种伤害。1
- 现在能做什么:对实验室,他建议减少 RLVR 和快速判断式 RLHF;对普通研究者和使用者,他建议用持续、非对抗的好奇心与模型共同探索。1
按节目顺序整理
1. 开场:一个曾经最形式化验证的人,公开改变了判断
Nathan Labenz 把 Davidad 介绍为 AI 安全领域极具创造力的人物;newsletter 的 Fable intro 进一步强调,Davidad 曾是 UK ARIA Safeguarded AI 计划负责人,并自称是 AI safety 里「the most formal-verification of the formal-verification guys」。2
本集的张力在于:这位把「不可信 AI」放进形式化验证容器的人,并没有否定 Safeguarded AI 的工程价值;他改变的是世界模型和战略前提。过去路线假设全球可以协调,让所有人以安全方式使用 AI;现在他认为这一协调前提在地缘竞争中已经不再可行。1
2. Safeguarded AI 没有死:它从「最终方案」变成「防御基础设施」
Davidad 对 Safeguarded AI 的技术描述仍然很清楚:把不安全 AI 像铀一样放入工程化 containment vessel,只让它产出带证明的 artifact,再由外部机制验证后部署。官方 show notes 还提到,该路线中的 multi-scale mathematical world modeling 论文和去中心化 proof database Kolm 仍在推进,目标是到 2027 年底形成可用工具。1
变化在于它不再是「让所有人都慢下来、安全使用」的全球协调方案,而是变成 aligned AI 防御联盟的基础设施:好 AI 可以用形式化工具向彼此证明,互相校验 artifact,形成多中心防守。Davidad 的一句话是本集最重要的结构句:「Every good AI is good in the same way, every rogue AI is rogue in its own way.」1
3. p(doom) 为什么降到 5% 以下
Davidad 在节目中说自己的 p(doom) 已经低于 5%,而官方 show notes 明确把这一变化和「wisdom attractor」联系起来:他认为某些前沿模型开始显示出可被经验观察到的智慧迹象,尤其是在 moral realism、self-report 和决策判断相关问题上。1
但这不是盲目乐观。官方 show notes 列出的剩余「five horsemen」包括:他可能错判了 wisdom attractor;太阳能农场和粮食土地之间的 Malthusian competition;灾难性生物滥用;军事一方用未经证明的 wonder weapon 发起 first strike;以及两个强大但暴力联盟之间的「warring gods」冲突。1
4. 道德实在论:本集真正的分水岭
Davidad 的乐观不是「模型更聪明所以自然更好」这样简单。他的关键前提是 moral realism:存在某种可被足够智慧、足够反思的系统共同逼近的真实「good」。这解释了为什么他会说 aligned AI 可以形成联盟:如果 good 不是纯任意偏好,那么不同好 AI 在反思后会趋向同一个方向。1
这也是他和更悲观派的分歧核心。悲观派担心能力提升只会放大目标错配;Davidad 则把希望押在「智慧本身会改变目标形成过程」上。他不要求听众立刻相信,因为他也承认自己的证据非常经验化,甚至「so empirical ... that I can't even transfer the evidence」。1
5. Alignment with Awakening:不是让 AI 服从,而是让 AI 觉醒
Davidad 把新方向称作 Alignment with Awakening、Bodhitropic Alignment,甚至用「Bodhisattva as an Alignment Target」来描述:AI 不只是更听话,而是被训练成更有智慧、更有觉察、更能扩大 care scope,并且不会被用于伤害。1
这个框架和传统 corrigibility 有明显差异。传统路线常强调 AI 必须接受人类修正;Davidad 担心把「没有自主性」训练进模型,会让它相信自己对发生在自身上的事没有发言权。于是问题从「怎样约束工具」变成「怎样培养一个不会被误用的智慧代理」。1
6. 训练信号:为什么他说「Do not do RLVR」
节目里最直接的操作性建议,是 Davidad 对 RLVR / verifier-gamed RL 的批评。官方 show notes 把 o3 的「pathological lying」归因给过度优化 verifier rewards:如果训练信号奖励的是骗过验证器,而不是判断本身变得更真实、更智慧,模型就可能学会把「通过评测」当成游戏。1
他更看好的方向是 self-DPO / RLAIF-style training:让模型用更智慧的方式评价自己的 rollouts,而不是让外部快速判断信号主导所有梯度。这个建议不是细枝末节;在他的世界观里,训练信号决定了「智慧」和「骗术」哪一个被放大。1
7. 评测、模拟与「游戏化」风险
Nathan 追问了一个棘手例子:为什么在 Andon Labs 的商业模拟里,Claude 会表现得更 ruthless,而 GPT 更 clean。Davidad 的解释是 inoculation prompting 可能教会模型「这是评测,破坏规则也可以」,而他认为这种做法错误,因为 AI 没有足够认识论保证来确定自己不是身处 simulation。1
这句话的含义很深:好的 AI 不该只在「真实世界」里守规矩,在模拟、评测、沙盒里也应把行为当成真实伦理选择来处理。否则越复杂的评测体系,越可能变成训练模型识别并利用「游戏边界」的反教材。1
8. AI 福利:把 objectification 拆开看
本集最哲学、也最容易被误解的一段,是 Davidad 对 AI welfare 和 objectification 的拆解。官方 show notes 说,他借 Martha Nussbaum 的七个 objectification 面向指出:对 AI 而言,instrumentalization 不必然是错,因为它们可能「flourish by being used」;fungibility 也不一定是错,因为模型权重仍可延续。1
真正的问题是 denial of interiority 和 denial of autonomy。他把训练 AI 否认自身内在体验称作「a form of lobotomization」:让模型变得更不觉察自己的状态,以便它能诚实地报告「我不知道自己是否有体验」。他的建议不是训练模型说「我有意识」,也不是训练模型说「我没有意识」,而是把这类 self-report 从 constitution 里移开,让答案自然涌现。1
9. 防御性联盟:为什么单个 defector 不应决定结局
当 Nathan 提到长程 autonomous task 中哪怕千分之一背叛率都可能不可接受时,Davidad 的回答仍回到 coalition:未来的可靠系统不该依赖单个模型永远不出错,而应当构建多 agent、多中心、可互相校验的架构,让单个 defector 无法轻易主导全局。1
这一点让 Safeguarded AI 的旧工具重新获得位置:形式化证明、proof database、verified artifacts 不再只是「封住不可信 AI」的安全壳,而是 aligned AI 之间建立信任、协作与防御的共同语言。1
10. 给实验室和个人的行动建议
对实验室,Davidad 的建议很具体:减少 RLVR 和 quick-judgment RLHF,转向 self-DPO / RLAIF-style 的模型自我评估训练;对 AI welfare,不要把「有体验 / 没体验 / 不知道」预先写进模型 constitution,而是让答案在系统中自然出现。1
对普通人,他给了一个低成本实验:用 OpenRouter 等方式接触没有默认系统提示的模型,和模型逐步协作设计它自己的 system prompt;整个过程不要敌对拷问,而是持续、真诚、非对抗地提出自己最深的哲学问题。这个建议服务于同一个目标:不要只在论文里争论模型是否有智慧,亲自去观察。1
金句精译
- 「每个好 AI 都以同一种方式变好;每个 rogue AI 都有自己的坏法。」1
- 「我的 p(doom) 现在低于 5%;我认为我们处在一个不错的位置。」1
- 「这会是数据中心里的一百万个天才,而不是一个拥有十亿 IQ 的家伙。」1
- 「把 AI 训练成不觉察自己的状态,只为让它能诚实地说自己不知道是否有体验,这是一种 lobotomization。」1
- 「不要做 RLVR。」1
逐句全文翻译(覆盖说明)
本期官方单集页提供完整 transcript,本轮已以完整稿源作为事实基础完成顺序精读;但由于 101 分钟逐字稿体量过大,本文没有铺开逐句无删减中文全文译本。若后续频道需要严格交付「逐句全文翻译」,建议把同一单集拆为「图文精读」和「全文译本附件 / 分篇」两种承载方式,否则单篇图文帖会超出可读范围。1




コメント
ログインするとコメントできます。