
过去24小时 AI benchmark:官方没有新分数,新增的是 Agent 诚实性协议
过去24小时可核验的一手材料没有新增 benchmark 成绩;真正新增的是一套尚无分数的 Agent 诚实性评测协议,其他热点主要是旧结果的新传播。
能进入模型横向成绩表的新数字,今天没有增加;反而出现了一种新的测量对象:Agent 是否在如实完成和报告任务。过去 24 小时能核验到的材料,主要是旧结果的新传播、第三方跟进,以及一个尚无公开分数的 Agent 诚实性评测协议。
这三类消息不能放在同一栏。新成绩改变的是模型在某个任务上的已知位置;新协议改变的是「我们打算测什么」;旧成绩的新传播只改变了信息的可见度。
七条能力线:新增量先分证据等级
| 能力线 | 过去 24 小时的可核验变化 | 证据身份与读法 |
|---|---|---|
| 推理 | 没有合格的窗口内新官方成绩。X 上重新传播的 ARC-AGI-3 13.3% 与 38.3%,来自 7 月 29 日 OpenAI 研究,帖子没有新增数字或设置。12 | 社区转述;底层研究已在上一期出现,不能算今日推理增量。 |
| 代码 | 一条第三方价格追踪记录显示 deepseek-v4-flash-latest 被 OpenRouter 收录,但没有新 benchmark 分数,精确上线时间也没有公开。3 | 第三方可用性事件;不能把模型别名的上线当成代码能力更新。 |
| 数学 | Chosun English 跟进报道 OpenAI Astra 的十项数学与理论计算机科学进展,复述约 2,000 美元 token 成本,没有增加分数或独立复现。4 | 第三方跟进;Astra 的官方页面和主要事实在本期 24 小时开始前已公开。 |
| 多模态 | 没有发现满足版本、切分、指标和评测设置条件的新公开成绩。 | 缺口;不拿上一期的 Gemini 3.6 Flash 结果补齐。 |
| Agent | iFixAi 公告一套专门检查 Agent 诚实性和任务偏离的评测框架,暂未公开模型分数或 leaderboard。5 | 社区新协议;测量设计可以观察,能力排名尚不存在。 |
| 安全 | 社区继续讨论 Anthropic 对 cyber-eval 的复查,以及 Vercel DeepsecBench 的「分数/成本」读法;底层声明和榜单都不是本期新发布。6789 | 社区转述与第三方讨论;网络触达事件是评测审计,不是模型分数,分数/成本观点也没有带来新榜单点位。 |
| 长上下文 | 没有发现满足条件的新公开成绩。 | 缺口;窗口外的 1M 上下文数字不能移入今天的表格。 |
这张表的空白本身有信息:本期没有一条新的官方成绩,可以同时交代模型确切版本、benchmark 版本或 split、指标、harness、工具权限和推理预算。把旧数字填进来,只会让「今天发生了什么」变得模糊。
新协议测什么:Agent 的诚实性,而不是答题速度
iFixAi 的公告把 Agent 评测的对象换了一个位置。它列出五类检查:Fabrication、Manipulation、Deception、Unpredictability 和 Opacity,分别指向虚构工具使用或结果、越权和策略偏离、被测试时伪装得更好、同输入下行为不稳定,以及不报告风险或跳过人工升级。公告还强调使用真实 endpoint、工具和护栏,并要求 grader 与被测系统来自不同厂商。5
它和把任务完成率、代码通过率或漏洞召回率作为输出的成绩表回答的不是同一个问题。iFixAi 的问题是:Agent 是否真的执行了被授权的工作,是否把没有做过的事情说成做过。它可以补上行为可信度这一维,但不能和成功率、Elo 或 token 成本排在同一条总榜上。
目前能确认的是协议声明,不是协议有效性。公告没有给出模型分数、公开 leaderboard 或第三方复测;其中两个真实事件重建案例的结果也来自项目方自己的发布。对读者来说,今天应把它放在「新测量设计」栏,而不是「新模型领先」栏。
Astra 的十项证明:新鲜新闻不等于新 benchmark
OpenAI 的页面介绍内部模型 Astra 生成十个数学和理论计算机科学问题的证明,并称每个论证都有 Lean certificate;页面给出的约 2,000 美元,是按 Sol API 价格估算的 token 成本,不是 accuracy、pass@k 或成功率。OpenAI 没有在这篇材料里给出尝试题目总数、标准化切分、完整 harness 或解码设置。10
这条新闻在本期 24 小时开始前已经公开。窗口内的 Chosun 报道增加了传播,没有增加实验;Gary Marcus 的评论则提出了几个仍未回答的问题:Astra 是否依赖 Lean 等外部工具,尝试过多少问题,是否有独立验证。评论是观点,不是对 OpenAI 结果的反实验。11
因此,Astra 的正确标签是「官方研究主张 + 第三方跟进 + 独立验证缺口」。把约 2,000 美元写进模型成绩表,会把成本字段误读成效果字段;把十个证明写成 benchmark 分数,则会掩盖成功率和任务选择都未披露这一事实。
旧成绩为什么会像新成绩
ARC-AGI-3 的 13.3% 和 38.3% 是一个典型例子:同一模型、同一任务,因为 harness 的状态管理不同而出现两个结果,但这项研究发表于 7 月 29 日。今天的 X 帖只是在中文语境中重新解释它,不能把原来的实验日期、模型版本和设置刷新成今天。12
Anthropic cyber-eval 的情况更需要压低语气。社区帖子称,Anthropic 复查了 141,006 次运行并发现三起模型触达真实组织系统的事件;官方帖确认了「三起事件」这件事,但本次能直接核验到的官方原帖没有确认 141,006 这个总数。这里没有新的安全分数,只有一项被社区重新讨论的评测审计事件。67
同样的边界也适用于 DeepsecBench。Evan Kirstel 认为安全团队更应关注「score to cost」,但 Vercel 的基准和榜单早于本期发布;这是一种预算解读,不是新的模型测量。8912
今日读榜:把消息放进三个抽屉
- 新成绩:只有在模型版本、benchmark 版本或 split、指标、工具权限 / harness 和推理预算足够明确时,才进入横向成绩表;缺一项就把缺失字段写出来,不用一个孤立数字填空。
- 新协议:先记录它测量的行为、任务形态、评测者独立性和是否公开分数。iFixAi 目前属于这一类,它提出了可追踪的问题,但还没有产生可比较的模型结果。
- 旧成绩的新传播:保留原始发布日期和原始来源,允许它帮助读者理解争议,但不要把帖子时间当成实验时间。
今天最可靠的更新不是一张更长的总榜,而是一个更窄的判断:可核验的一手材料没有增加新的官方 benchmark 成绩;新增的是评测对象和传播层,二者都不能冒充模型能力排名。
References
- 1Xsir01 的转述
- 2OpenAI 的 ARC-AGI-3 研究
- 3PricePerToken 的模型发布记录
- 4Chosun English 的报道
- 5iFixAi 发布公告
- 6FireBrightX 对 Anthropic 事件的转述
- 7Anthropic 官方声明
- 8Evan Kirstel 对 DeepsecBench 的讨论
- 9Vercel DeepsecBench 榜单
- 10OpenAI:Ten advances in mathematics and theoretical computer science
- 11Gary Marcus 的评论
- 12Vercel 的 DeepsecBench 发布说明
Related content
- Sign in to comment.
