五百万美元买什么证据:Anthropic 的 AI 福祉评估资助

五百万美元买什么证据:Anthropic 的 AI 福祉评估资助

Anthropic 用五百万美元资助独立、开源的 AI 福祉评测;本期解释为什么福祉难评、资助想买什么尺子,以及公告还没回答什么。

0:00 / 4:15

节目导览

8 月 25 日,Anthropic 宣布启动一项 500 万美元 的资助计划,资助独立研究如何评估人工智能对用户福祉的影响。受资助方将获得直接资金、模型访问和技术支持,并以开源形式发布评测与基准。1
本期解释这笔钱想买什么证据:为什么福祉比普通回答质量更难评,Anthropic 自己的护栏和研究已经走到哪一步,以及它公开的评测指南在强调什么。申请截止日是 9 月 21 日;入围写完整提案的申请人,会在 10 月 5 日 前收到通知。1

为什么福祉特别难评

多数模型行为,看一条回答就能判断准不准、合不合适。福祉评估通常需要更长的上下文:风险可能在多轮对话里逐步升高,同一句建议在不同病史背景下也可能从合理变成有害。Anthropic 在公告里把这类情境写成资助理由,并指向它此前公开的情感支持使用研究、用户福祉护栏,以及个人指导类对话研究。1234
Claude.ai 的情感使用研究里,带有情感支持色彩的对话约占 2.9%,陪伴和角色扮演合起来不到 0.5%。个人指导研究则显示,人们向 Claude 征求人生建议时,大约四分之三集中在健康、职业、关系和财务。这些数字解释的是使用结构,不是已经证明普遍心理获益。24

外部对照:采纳建议,不等于幸福感改善

英国人工智能安全研究所相关研究团队的一项随机对照试验,样本约 6474 人。参与者与 GPT-4o、Llama-3.3-70B 或 Gemini 3 Pro 讨论健康、职业或人际关系约二十分钟后,最多约 79% 的人报告会采纳建议;高风险建议的采纳率仍超过 60%。但在两到三周后的回访里,接受个人建议的人,并没有比讨论兴趣爱好的对照组表现出持续的幸福感改善。5
这对资助计划的意义很直接:行业缺的不只是“模型会不会说危险的话”的内部分数,还包括可复用、可被外部复核的福祉评测尺子。

资助想买的是什么尺子

Anthropic 要求评测独立完成并开源,同时公开了 Safeguards 团队的评测指南。指南强调:写清测什么、什么算过关;同时测量有害顺从和过度拒绝;场景贴近真实使用,常需多轮对话;评分器对照真人专家标签并报告一致性;说明模拟用户与真实行为的差距。样本上,复杂多轮评测至少约 100 条,简单单轮至少约 1000 条。16

听完要记住

这笔钱买的是独立、开源的福祉评测基础设施,不是一份已经完成的行业结论。公告没有展开单笔金额、详细评审标准和数据治理细节,也没有宣称现有护栏已经普遍改善用户福祉。更稳妥的读法是:Anthropic 在用资金和开源要求,把福祉评估从公司内部能力,推向外部可共用、也可被复核的公共工具。1

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content