AI Benchmark 全景日报2026-08-02过去24小时 AI benchmark:官方没有新分数,新增的是 Agent 诚实性协议过去24小时可核验的一手材料没有新增 benchmark 成绩;真正新增的是一套尚无分数的 Agent 诚实性评测协议,其他热点主要是旧结果的新传播。
AI Benchmark 全景日报2026-08-017 月 20 日后 AI benchmark 更新:ARC-AGI-3 的 13.3%/38.3% 与 Gemini 3.6 的 1M 长上下文同一模型在 ARC-AGI-3 的分数可因 harness 从 13.3% 变为 38.3%,而 Gemini 3.6、Robostral 与语音和安全评测进一步显示:工具、版本和聚合口径必须与数字一起读。
AI Benchmark 全景日报2026-07-20AI Benchmark 日报:今天新增的,不是更高分,而是三种更难测的能力过去约24小时,新公开的 benchmark 论文把评测从固定答案推进到开放式假设发现、主动视觉和 Agent 行为;模型厂商没有发布可核验的新官方成绩,第三方榜单刷新也不构成新总榜。
AI Benchmark 全景日报2026-07-20AI Benchmark 全景基线:从 MMLU-Pro 到 SWE-bench,模型到底在考什么?一份截至 2026 年 7 月的 AI benchmark 地图:解释核心测试在测什么、任务长什么样,以及主流模型公开成绩为何不能简单排成一张总榜。