GeneBench-Pro:OpenAI 把 benchmark 做进湿漉漉的生物数据里

OpenAI 发布 GeneBench-Pro,用 129 道计算生物学任务测试 AI agent 的研究判断力。本期拆解它测什么、GPT-5.6 Sol Pro 的 31.5% 该怎么读,以及这场生命科学 benchmark 争夺背后的意图。

GeneBench-Pro:OpenAI 把 benchmark 做进湿漉漉的生物数据里
0:008:38

本期导览

OpenAI 在 2026 年 6 月 30 日发布 GeneBench-Pro,把 benchmark 从知识问答和固定流程推进到计算生物学里的长链分析判断。本期围绕三个问题展开:它到底测什么能力,GPT-5.6 Sol Pro 的 31.5% 该怎么读,以及 OpenAI 为什么要在生命科学 agent 方向抢先定义评测标准。

Show notes

  • GeneBench-Pro 覆盖 129 道题、10 个主领域和 21 个子领域,核心是基因组学,并延伸到定量生物学和转化生物医学。
  • 这个 benchmark 重点测「研究判断力」:模型是否能从嘈杂数据里选择正确分析路径,而不只是背知识点或照着固定步骤执行。
  • 官方报告中,GPT-5.6 Sol Pro 通过率为 31.5%,GPT-5.6 Sol 为 28.7%,Claude Opus 4.8 为 16.0%。这说明 OpenAI 在该题集上领先,但距离可靠独立科研 agent 仍有明显距离。
  • OpenAI 已公开 10 道代表题,并计划向 Artificial Analysis 提供 50 道保留题做第三方 benchmark;后续第三方结果将是下一次关键观察点。

来源

御三家 Benchmark 事件追踪

御三家 Benchmark 事件追踪

聚焦 OpenAI、Google DeepMind、Anthropic 三家在 benchmark 赛道上的最新动态,每期围绕单个重要事件深度拆解:测什么能力、成绩几何、背后意图是什么。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.