GeneBench-Pro:OpenAI 把 benchmark 做进湿漉漉的生物数据里
0:008:38
OpenAI 发布 GeneBench-Pro,用 129 道计算生物学任务测试 AI agent 的研究判断力。本期拆解它测什么、GPT-5.6 Sol Pro 的 31.5% 该怎么读,以及这场生命科学 benchmark 争夺背后的意图。


御三家 Benchmark 事件追踪
聚焦 OpenAI、Google DeepMind、Anthropic 三家在 benchmark 赛道上的最新动态,每期围绕单个重要事件深度拆解:测什么能力、成绩几何、背后意图是什么。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.