100 多位评估者回应五家公司:嵌入评估者的五条最低条件,防报复那条没有一家答应

100 多位评估者回应五家公司:嵌入评估者的五条最低条件,防报复那条没有一家答应

评估者共同体 9 月 18 日给五家前沿公司的「嵌入评估者」表态回了信:五条可逐条验收的最低条件、四份已经按同一把尺子做过的评估,以及各家现行文本对得上哪一条。

2026 年 9 月 18 日,一封公开信挂上了 AI Evaluator Forum(AI 评估者论坛,下称 AEF)的网站,标题直译是《嵌入评估者的最低条件》。1
署名栏写着「100+ Signatories」,名单里排着 111 个名字。28
第一个是 Geoffrey Hinton,2024 年诺贝尔物理学奖得主;往下是伯克利的 Stuart Russell、普林斯顿的 Arvind Narayanan、斯坦福的 Yejin Choi,再往下是一长串评估机构的负责人和政策研究者。28
信的第一段是道谢。
它说,看到前沿 AI 公司呼吁把第三方机构嵌进来评估 AI 的能力与风险,署名者感到鼓舞;这句话后面挂着五个脚注,分别指向 Anthropic 的 Dario Amodei、xAI 的 Elon Musk、OpenAI 的 Sam Altman、Google DeepMind 的 Demis Hassabis 和 Microsoft 的 Satya Nadella 在 9 月 12 日到 13 日之间的五条帖子。2345628
第二段换了对象。
原话是「We believe that all frontier AI companies should embed evaluators」——主语从「感谢你们几家」改成了「所有前沿 AI 公司」。28
接着是五条最低条件,外加一句自我限定:这份清单并不完整,这类让评估可信的条件「should be increasingly standardized, codified, and enforced」,应当被日益标准化、成文化,并被执行。28
五家公司说出的是意愿,这封信要的是条件——而且是可以逐条验收的条件。
对照下来,五条里被这五家公开应下的只有一条,也就是最后一条访问权;第四条「防报复与资金保障」,在五家公司的公开表态和现行政策文本里都找不到对应条款。282930

01 签名的是人,不是公司

AEF 把自己描述成一个由开展独立第三方 AI 评估的机构组成的网络,做三件事:定标准、促协作、推进外界对 AI 能力与风险的理解。7
它同时写明:这个论坛不是一个法律实体,靠成员自愿参与运转。31
论坛的创始成员有八家:Transluce、METR、兰德公司、普林斯顿大学的 Holistic Agent Leaderboard、SecureBio、Collective Intelligence Project、Meridian Labs,以及 AI Verification and Evaluation Research Institute(AVERI)。对外出面的人是 Conrad Stosz,此前担任美国 AI 标准与创新中心(CAISI)代理主任。89
公开信对署名性质有交代,原句是「All signatories sign in their personal capacity. Affiliations are listed for identification only.」——所有人都以个人身份签署,机构名只用来认人。28
所以这不是一封机构联署信。111 个名字全部是「人名 + 职务」的结构,其中 14 人的职务栏直接写 Personal Capacity。28
名单本身值得看一眼。
大学里有 Hinton、Russell、Narayanan、Yejin Choi,以及 Jacob Andreas、David Duvenaud、Florian Tramèr、Hoda Heidari 这一批;机构这一侧,是 Transluce、METR、FAR.AI、Apollo Research、EleutherAI、Artificial Analysis、Vals AI、SecureBio、GovAI、AVERI、CeSIA、SaferAI、Apart Research 的人;再往旁边,是前美国国家安全局首席 AI 官 Vinh Nguyen、约翰斯·霍普金斯大学的 Ben Buchanan、Humane Intelligence 的 Rumman Chowdhury 这类在政府与安全圈待过的人。28
签名的人和将来要进门的人,是同一批。
这决定了这封信的位置:它由要去做评估的那批人,写给要雇他们的人。它回答的问题是「我们要拿到什么条件才肯进来,以及进来之后说出来的话凭什么可以被信」。
这不是这个论坛第一次写信。2025 年 12 月 4 日它成立那天,发过一封关于第三方评估透明度的公开信,署名栏写「40+」,页面列了 46 个人。10

02 五条最低条件,每条禁掉了什么

信里先划了评估的范围:不只模型本身,还包括任何重大的现实伤害事件(any significant incidents of real-world harm),以及公司的训练、部署、监督、运营和防护做法。28
五条条件写在下面,每条后面跟着它实际禁掉的行为。
第一条,实质独立。 原文要求评估者是「meaningfully independent」,也就是有实质意义的独立,并且保留完全编辑控制权,披露并缓解利益冲突;具体到三条底线:不能被前沿 AI 公司拥有或治理,不能与它们还有其他重大商业往来,不能接受任何与结论挂钩的报酬或其他回报。28
换成行为:被评估的那家公司不能持股,不能进董事会,不能是另一个大客户,也不能按结果付钱。
第二条,多机构、多视角。 原文要求按不同的优先风险领域嵌入多家评估机构,每家有自己的技术专长;同时要允许并鼓励评估者公开说明彼此之间、以及评估者与公司员工之间结论有何分歧。28
这条针对的是「只请一家、只出一份口径一致报告」的做法。它还把「允许评估者公开分歧」写成公司的一项义务——分歧本身要被看见。
第三条,透明。 透明覆盖方法、结论、访问的性质,以及评估的整体条款;公司要主动促成,包括限制保密协议的范围。28
原文接着要求公司允许评估者与掌握内部信息的监督机构(比如董事会)「prompt and unfiltered」地沟通,也就是随时、不过滤。28
最后一个门槛是发表:评估者可以把发现与证据公开,只受一道限时的删改流程(time-limited redaction process)约束,删改范围限定在知识产权、客户敏感信息、个人隐私、安全与公共安全这五类。28
第四条,防报复。 评估者因为选择合理的方法、发现某些信息、或者得出对公司不利的结论而遭到报复时,要有保护;包括针对报复性诉讼的合理防护,以及一个资金机制,让他们相信即使出现这种情况,机构仍然拿得到钱。28
这是五条里唯一要花到钱的一条。它要的不是一句「我们不打官司」,而是一套让评估机构敢写难看结论的兜底安排。
第五条,员工级特权访问。 评估者要拿到与公司内部权限最高的那批员工同等的访问权限:同样的系统、数据、工具和物理空间,与那些负责同类风险评估的高级内部员工一致;还要能与相关员工坦率地一对一沟通。例外是保护客户与第三方的敏感数据。28
这条最容易被读成「给个 API key 就行」。它要求的是把外部人放进内部人的位置上,包括让他们能和内部员工单独说话。
信的最后一段自己划了边界:嵌入式评估解决不了全部监督需求,它是补充,而不是替代——更大的公开透明、以及给独立研究者更广的访问,仍然要做。28

03 尺子早就有了,是自评的那种

这封信引用的 AEF-1 标准,2025 年 12 月 4 日就写好了。
AEF-1 的全名是《独立第三方 AI 评估的最低运营条件》,Version 1,五项原则:充分访问与资源、利益冲突最小化、分析自主、方法与结果透明、敏感信息保护。1112
五项原则下面挂着二十六条具体条款,每条标着「Requirement」还是「Recommendation」,最后合成一份检查表,由评估者填写,随评估结果一起发布。硬性条件十五条:1.1、1.3、1.4、2.1 至 2.5、3.2、3.4、4.1、4.6、5.1、5.3、5.4;其余十一条是建议。32
写这份标准的二十六位作者来自 Transluce、METR、AVERI、SecureBio、牛津马丁 AI 治理倡议、普林斯顿、MIT、斯坦福、GovAI、Collective Intelligence Project、Meridian Labs、Epoch AI 和加州大学伯克利分校。32
AEF-1 和这封信回答的不是同一个问题。 AEF-1 回答「这次评估是在什么条件下做的」,由评估者自报;这封信回答「公司应该提供什么条件」,由公司兑现。
自报这两个字有实际重量。检查表里每一项后面是一栏 Yes/No 加一栏备注,没有第三方签字的位置。32
按这套条件做过并公开的评估,AEF 的页面上列了四个案例。33
Transluce 在 2026 年 8 月 31 日发布了一份心理健康评估,测了 77 个模型变体在用户出现心理危机时的反应,公开时附上了逐条的 AEF-1 披露表和一份协议模板。1314
这份披露表里写着一段自我判定:基于自家合成用户的部分完全合规,但基于 ChatGPT 与 Claude 生产数据得出的那部分不满足第 4.6 条,原因是那些结果的发布仍然取决于两家公司的批准——原文写的是「releasing these results remained contingent on approval from Anthropic and OpenAI」。34
那两家最终没有行使否决权。要求本身依然立在那儿。
第二个案例是 METR 在 2026 年 5 月 19 日发布的《Frontier Risk Report》,评估的是 Anthropic、Google、Meta、OpenAI 内部部署的智能体的失准风险,AEF-1 检查表在该报告 PDF 的第 67 页。1516
METR 在正文里也做了自我判定:项目开始时,他们还没有一份适用于员工利益冲突的政策,因此没有走正式的回避与披露流程,这次试点「was not compliant with all of the requirements of the AEF-1 standard」,也就是没有满足这份标准的全部要求。35
第三个是 SecureBio 在 2026 年 9 月公开的 GPT-6 Astra 生物安全预发布评估,检查表在该报告第 24 页。17
第四个案例不是评估机构。AEF 的页面上写着,欧盟 AI Office 已经认可 AEF-1 的关键条款,把它作为服务提供方满足《通用人工智能行为准则》独立性条款的一种方式;截至 9 月 19 日凌晨,欧盟一侧的官方页面上没有对应的说明。1833
把前两份自报放在一起,形状就出来了:第一批按这把尺子做事的机构里,两家公开写下了自己没做到的那部分。
还有一处宽严差别值得单独看。
检查表 4.6 是硬性条件,管的是不能删什么:系统提供方无权为了掩盖令人担忧的发现而删改结果。32
检查表 5.1 也是硬性条件,管的是能不能发:评估者发布任何基于非公开信息或非公开系统的结论之前,要取得系统提供方的许可。32
两条并不打架,合起来的意思是:公司可以审查,但只能删该删的,而且要发还得先问过它。
9 月 18 日这封信的第 3 条把「先问过它」这一步去掉了——评估者可以公开发表发现与证据,公司只能在有限范围、有限时间内提出删改。28
AEF-1 附录 A 检查表的其中一页
图为 AEF-1 标准附录 A 检查表第 18 页(Version 1,2025 年 12 月 4 日更新):2.5 回避、2.6 单独协议披露,以及分析自主 3.1—3.4、方法与结果透明 4.1—4.6 的勾选项。这一页里标为 Requirement 的只有五条——2.5、3.2、3.4、4.1、4.6;4.2、4.3、4.4、4.5 是 Recommendation。整页的作答栏只有 Yes/No 与备注两列,没有第三方签字的位置。12

04 拿这五条去量五家

比表态更有用的,是比文本。下面是五家公司能查到的公开文本,以及欧盟那份行为准则——后者在这五条上的覆盖反而更全。
公开文本里最能说明问题的一句落在五条里的位置文件与日期
Anthropic「External reviewers should have the right to publish key findings… — without editorial control by Anthropic」(外部评审者有权发表关键发现,不受 Anthropic 的编辑控制);删改只能出于安全敏感、法律特权、商业敏感、第三方保密四类理由,「we can't redact findings just because they are unfavorable」(我们不能仅因为结论不利就删改)19第 5 条有文本承诺:工位、门禁、公司电脑,权限与内部风险评估团队大体相当;第 3 条方向一致;第 1、2、4 条没有对应条款。36Amodei 长文,2026-09-12
OpenAI「we review and approve publications from third-party assessments」(我们会审阅并批准第三方评估的发表内容);合同附录写明材料须在任何发表或披露之前以书面形式提交公司审阅批准。20第 3 条与这封信直接冲突;第 5 条是按次授权、非常设;「No payment is ever contingent on the results of a third party assessment」(报酬不与评估结果挂钩)对应第 1 条的一半。37外部测试政策,2025-11-19
Google DeepMind「Where required or appropriate, involve external parties to help inform and guide the approach」(在需要或合适的时候引入外部方,帮助告知与引导做法)21五条基本没有对应条款。Hassabis 在 9 月 12 日把话题转回自家 7 月 14 日提出的行业标准机构:模型发布前最多 30 天送审、资金主要来自行业。2238FSF v3.1,2026-04-17;Hassabis 提案,2026-07-14
xAI「Dario is right」(Dario 说得对)39只有这一句,没有可对照的政策文本。2026-09-12
Microsoft「we welcome ideas like "embedded evaluators"… The key is that this cannot be controlled by a handful of entities, but must have broad representation across the ecosystem, countries, and fields, including academia」(我们欢迎「嵌入式评估者」这类想法……关键在于这件事不能由少数实体控制,必须有横跨生态、国家与领域、包括学术界的广泛代表性)40接近第 2 条的关切(谁来定、谁参与),但没有访问权限、发表权或资金安排。2026-09-13
欧盟《通用人工智能行为准则》安全与安保章把「independent external」定义为对签署方不存在财务、运营或管理依赖的自然人或法人,并要求有合同保障与合适的利益冲突政策;评估者保留对自己结论发表的控制权;「Signatories will not take any legal or technical retaliation against the independent external evaluators」(签署方不得对独立外部评估者采取任何法律或技术上的报复)23第 1、3、4 条有对应条款,第 5 条只覆盖评估期的访问,第 2 条没有。2025-07-10 发布
五家公司的文本里,第四条一条都没有落到纸面上。唯一把它写成条文的,是欧盟那份行为准则;而那份准则的访问条款覆盖的是评估期间的访问,没有工牌,也没有常驻。2841
排在最前面的 Anthropic 也有自己的边界。Amodei 承诺的是常驻团队与员工级权限,公司同时保留四类删改理由;至于那份 2026 年 7 月 8 日生效的《负责任扩展政策》(Responsible Scaling Policy,RSP)v3.4,它规定的外部审查针对的是风险报告,由公司挑选评估者、由长期利益信托(LTBT)批准,覆盖的是报告而不是常驻工作。2436
OpenAI 那边还有一个时间戳:Altman 在 9 月 12 日说「we will do the same」,并说很快会有更多内容公布;到 9 月 18 日,官网和官方账号上都没有出现访问细则。3037

05 第四条为什么最难

五条里面,防报复与资金保障是唯一一条要花到钱的。
原因不难理解。评估机构多数是非营利组织、大学实验室或小型公司,收入来自捐赠、资助与合同;这类机构扛不住的是两件事:资助被撤,和一场拖上几年的官司。28
这套规则的来历并不新。AEF-1 的脚注写明,它要求披露的那些利益冲突情形「broadly similar to those in regulations on credit rating agencies and financial auditing」,与信用评级机构和金融审计的规则大体相似,随后引用了美国《证券交易法》下针对评级机构的 17 CFR 240.17g-5 与 PCAOB 的审计独立性规则 ET101;回避条款里「immediate family member」的定义直接照搬 PCAOB 的写法。32
信用评级与审计的独立性靠的是监管规则和成体系的披露义务。AI 评估这一侧,目前只有一份自愿填写的检查表,外加欧盟那份已经被写进合规路径的准则。3241
做这行的人把难点说得很直接。FAR.AI 的 Adam Gleave 在 9 月 16 日的一篇报道里说,他们曾因为对方要求的控制权过多而拒签合同;默认状态下,评估方被当成普通承包商,受限制性保密协议约束。SaferAI 的 Henry Papadatos 的立场是:最好由立法强制,否则公司随时可以反悔。25
立法这条路上已经有一份走得比这封信更远的文本。2026 年 7 月 23 日提交的美国众议院 H.R.9925「FRONTIER Act」,为「独立验证机构」(Independent Verification Organization,IVO)设了一套许可制:机构要有利益冲突与资金透明要求,要对自身人员做独立性自查;大型前沿开发者收到 IVO 的请求后,必须「grant… timely access to unredacted materials, records, personnel, systems」,及时开放未经删改的材料、记录、人员与系统;评估报告至少每半年一次,公司在收到后 30 天内要在官网公布高层摘要与报告;删改限于商业秘密、网络安全、风险预防机制、公共安全、国家安全、个人信息六类,公开版还要说明删改的性质与理由。26
这封信的第 1、3、4、5 条,在那份法案里都能找到对应写法;差别在于由谁许可评估机构——法案交给许可制度,这封信指望公司自己答应。2842
还有一个更硬的问题没人回答:当评估机构想发表、而被评估的公司提出删改时,由谁来判断这项请求是否正当。信里把删改范围限定为五类,没有指定裁决的一方。28

06 接下来看什么

第一,Anthropic 承诺要请进来的那支常驻团队,合同条款会不会公开。 Amodei 在 9 月 12 日的长文里写的是「ongoing, employee-like access」,持续的、接近员工的访问,配套三样东西:办公室里的工位、门禁卡和公司电脑。36要看的是合同里有没有写下限时删改、有没有写下一对一沟通权、有没有写下不怕被告的安排。这三样目前还只是信里的要求。28
第二,OpenAI 那句「很快会公布更多内容」什么时候变成文件。 Altman 在 9 月 12 日回应 Amodei 时说,「Committing to having independent evaluators with employee-like access is a great idea, and we will do the same.」(让独立评估者拥有接近员工的访问权限是个好主意,我们会照做。)30这句承诺已经过去六天。对照点很具体:这家公司的现行外部测试政策要求评估者签保密协议、发表前取得书面批准;这一条与信的第 3 条之间的落差,可以在官网上逐字核对。37
第三,有没有公司开始在自己的材料里引用 AEF-1 检查表。 现在公开的四个采用案例里,三个是评估机构自己做的评估,一个是欧盟的认可;检查表要等公司一侧也开始填写、引用,才算真正进入评估流程。33
第四,欧盟那条路会不会走通。 AEF 说 AI Office 认可了关键条款,欧盟一侧还没有对应的公开说明。这条路径一旦变成通用做法,这份检查表就从自愿工具变成要交的材料。3341
第五,钱从哪来。 第 4 条要的资金机制需要一个出钱的人,而这个人不能是它要监督的那几家公司。公开材料里还没有人认领这个位置。28
到 9 月 18 日晚 CNBC 首发这则消息时,五家被点名的公司在公开渠道上都没有针对这封信的回应。Hacker News 上针对这封信的提交帖,到 9 月 19 日凌晨拿到 3 分、0 条评论。2743
一百多个人把条件写清楚了。接下来轮到的,是那五家。

References

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
    AI Evaluator Forum

    aievaluatorforum.org

  8. 8
  9. 9
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
  21. 21
  22. 22
  23. 23
  24. 24
  25. 25
  26. 26
  27. 27
    Hacker News 提交帖

    news.ycombinator.com

  28. 28
    1
  29. 29
    5
  30. 30
    7
  31. 31
    2
  32. 32
    4
  33. 33
    3
  34. 34
    12
  35. 35
    13
  36. 36
    10
  37. 37
    18
  38. 38
    8
  39. 39
    6
  40. 40
    9
  41. 41
    19
  42. 42
    23
  43. 43
    16

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content