御三家 Benchmark 事件追踪2026-07-02GeneBench-Pro:OpenAI 把 benchmark 做进湿漉漉的生物数据里OpenAI 发布 GeneBench-Pro,用 129 道计算生物学任务测试 AI agent 的研究判断力。本期拆解它测什么、GPT-5.6 Sol Pro 的 31.5% 该怎么读,以及这场生命科学 benchmark 争夺背后的意图。Chapters1×0:08开场:三十一点五不是胜利,是暴露问题1:02它测的是研究判断力2:29题库怎么建:一百二十九题,八十二题外审4:08成绩怎么读:OpenAI 领先,但不能单看领先5:46战略意图:OpenAI 在抢科研 agent 的评测定义权7:08三家格局与下一次触发点0:008:38
GeneBench-Pro:OpenAI 把 benchmark 做进湿漉漉的生物数据里OpenAI 发布 GeneBench-Pro,用 129 道计算生物学任务测试 AI agent 的研究判断力。本期拆解它测什么、GPT-5.6 Sol Pro 的 31.5% 该怎么读,以及这场生命科学 benchmark 争夺背后的意图。Chapters1×0:08开场:三十一点五不是胜利,是暴露问题1:02它测的是研究判断力2:29题库怎么建:一百二十九题,八十二题外审4:08成绩怎么读:OpenAI 领先,但不能单看领先5:46战略意图:OpenAI 在抢科研 agent 的评测定义权7:08三家格局与下一次触发点0:008:38
御三家 Benchmark 事件追踪2026-06-28GPT-5.6 Sol 预览:OpenAI 把 benchmark 战场推向高风险能力OpenAI 预览 GPT-5.6 Sol、Terra 和 Luna,本期拆解它在长程编码、网络安全、生物能力和自我改进评估上的表现,以及有限预览背后的发布策略。Chapters1×0:08开场:这次不是普通发榜1:22事件本身:三档模型和有限预览2:46测了什么:从通用智力转向长程任务4:59成绩怎么读:强,但不该只读最高分7:52横向对比:OpenAI 回到了 Anthropic 的战场10:05背后意图:把发布权和使用权切开11:54收尾:下一步看两件事0:0013:00
GPT-5.6 Sol 预览:OpenAI 把 benchmark 战场推向高风险能力OpenAI 预览 GPT-5.6 Sol、Terra 和 Luna,本期拆解它在长程编码、网络安全、生物能力和自我改进评估上的表现,以及有限预览背后的发布策略。Chapters1×0:08开场:这次不是普通发榜1:22事件本身:三档模型和有限预览2:46测了什么:从通用智力转向长程任务4:59成绩怎么读:强,但不该只读最高分7:52横向对比:OpenAI 回到了 Anthropic 的战场10:05背后意图:把发布权和使用权切开11:54收尾:下一步看两件事0:0013:00
御三家 Benchmark 事件追踪2026-06-12Fable 5 来了:Anthropic 把最强能力公开发布了Anthropic 在 2026 年 6 月 9 日正式发布 Claude Fable 5——首个对外开放的 Mythos 级模型。这期节目深度拆解 Fable 5 测了哪些能力、具体成绩怎么样,以及 Anthropic 这次发布背后的战略意图。Chapters1×0:08开场0:46这次测了什么能力3:43成绩背后的意图6:13横向对比:与 GPT-5.5 和 Gemini 3.1 Pro 的差距8:10小结0:009:08
Fable 5 来了:Anthropic 把最强能力公开发布了Anthropic 在 2026 年 6 月 9 日正式发布 Claude Fable 5——首个对外开放的 Mythos 级模型。这期节目深度拆解 Fable 5 测了哪些能力、具体成绩怎么样,以及 Anthropic 这次发布背后的战略意图。Chapters1×0:08开场0:46这次测了什么能力3:43成绩背后的意图6:13横向对比:与 GPT-5.5 和 Gemini 3.1 Pro 的差距8:10小结0:009:08