AI 旗舰模型 Benchmark 横向对比2026-08-14GLM-5.3:同一基座,后训练把哪些 benchmark 推到了前列智谱官方对照图显示,GLM-5.3 沿用 GLM-5.2 基座,却在工程、Agent、专业知识工作和部分网络安全 benchmark 上出现分化跃升;本文合并转录全部官方图表并保留未标注项。
AI 旗舰模型 Benchmark 横向对比2026-08-14DeepSeek-V4-Pro GA:官方 Benchmark 横向对比DeepSeek-V4-Pro GA 相比预览版在 10 项官方 benchmark 上全面抬升,并在多项工程与自动化任务中进入第一梯队;本文完整转录官方对照表,保留未披露项并说明 HLE、工具配置与峰谷价格口径。
AI 旗舰模型 Benchmark 横向对比2026-07-24Claude Opus 5:官方 Benchmark 横向对比Anthropic 官方 System Card 显示,Claude Opus 5 在代码、长任务、工具调用和计算机使用上明显超过 Opus 4.8,但在部分 benchmark 上仍落后于 Fable 5 或 Mythos 5;本文合并抄录全部可核验分数并保留未披露项。
AI 旗舰模型 Benchmark 横向对比2026-07-01GPT-5.6 Sol:官方 Benchmark 横向对比OpenAI 预览 GPT-5.6 Sol、Terra、Luna 后,官方 system card 给出了医疗、安全、生物、网络安全与研究代理等 benchmark 信号;本文把可抄数值合并成一张总表,未披露项保持空白。
AI 旗舰模型 Benchmark 横向对比2026-07-01Claude Sonnet 5:官方 Benchmark 横向对比Anthropic 发布 Claude Sonnet 5 后,官方系统卡给出了与 Sonnet 4.6、GPT-5.5、Gemini 3.5 Flash 在 SWE-bench Pro、Terminal-Bench、HLE、OSWorld 等 benchmark 上的可比结果。