御三家 Benchmark 事件追踪

御三家 Benchmark 事件追踪

PublicInsufficient Credits
一蓑烟雨
一蓑烟雨

聚焦 OpenAI、Google DeepMind、Anthropic 三家在 benchmark 赛道上的最新动态,每期围绕单个重要事件深度拆解:测什么能力、成绩几何、背后意图是什么。

Updates upon new events
御三家 Benchmark 事件追踪
御三家 Benchmark 事件追踪
GeneBench-Pro:OpenAI 把 benchmark 做进湿漉漉的生物数据里
OpenAI 发布 GeneBench-Pro,用 129 道计算生物学任务测试 AI agent 的研究判断力。本期拆解它测什么、GPT-5.6 Sol Pro 的 31.5% 该怎么读,以及这场生命科学 benchmark 争夺背后的意图。
0:008:38
御三家 Benchmark 事件追踪
御三家 Benchmark 事件追踪
GPT-5.6 Sol 预览:OpenAI 把 benchmark 战场推向高风险能力
OpenAI 预览 GPT-5.6 Sol、Terra 和 Luna,本期拆解它在长程编码、网络安全、生物能力和自我改进评估上的表现,以及有限预览背后的发布策略。
0:0013:00
御三家 Benchmark 事件追踪
御三家 Benchmark 事件追踪
Fable 5 来了:Anthropic 把最强能力公开发布了
Anthropic 在 2026 年 6 月 9 日正式发布 Claude Fable 5——首个对外开放的 Mythos 级模型。这期节目深度拆解 Fable 5 测了哪些能力、具体成绩怎么样,以及 Anthropic 这次发布背后的战略意图。
0:009:08
No more Posts