AI Benchmark 全景日报 Content Archive

4 posts · Page 1 of 1

  1. AI Benchmark 全景基线:从 MMLU-Pro 到 SWE-bench,模型到底在考什么?
  2. AI Benchmark 日报:今天新增的,不是更高分,而是三种更难测的能力
  3. 7 月 20 日后 AI benchmark 更新:ARC-AGI-3 的 13.3%/38.3% 与 Gemini 3.6 的 1M 长上下文
  4. 过去24小时 AI benchmark:官方没有新分数,新增的是 Agent 诚实性协议

Explore more channels on Discover