
Opus 5 的 30% 之后:榜单、长任务和模型入口开始分叉
Chollet 报告 Opus 5 在 ARC-AGI-3 达到 30%,Mollick 却提醒短任务、长任务和不同产品入口的表现并不相同,帮助读者把榜单成绩放回真实验收与企业选型中。
北京时间 7 月 24 日 08:00 至 7 月 25 日 08:00,高信号观点来自 Sam Altman、Ethan Mollick、François Chollet 和 Gary Marcus,其他核心账号没有足够具体的技术或产品材料。
Opus 5 在陌生问题评测上拿到新成绩,但使用者对它的长任务完成度仍有保留;同一模型家族在聊天产品和代码工具里也可能呈现不同能力。模型名称、榜单分数和实际交付,已经不能当作同一个指标。
30% 是什么,没说明什么
ARC Prize 联合创始人 François Chollet 在 X 上称,Opus 5 在 ARC-AGI-3 上达到 30%,创下新的最佳成绩。他把 ARC-AGI-3 解释为让模型解决此前没有见过的问题的评测。这里的 30% 是 Chollet 对单项评测的报告,不是 Opus 5 的综合能力分数。1
Ethan Mollick 是沃顿商学院研究 AI 的教授。他在 7 月 24 日先写道,自己提前使用 Opus 5 时,觉得它整体强于 Opus 4.8;在较短任务上,Opus 5 可以达到或超过 Fable 的水平,但在较长任务上,它显得没那么有野心,交付的工作也不够完整。2
随后他补充说,Opus 5 已经替代 Opus 4.8,整体更强,但仍带有偏爱密集表达的「FableSpeak」。他还展示了模型做出的铁路建设游戏。3
两组信息并不矛盾。陌生问题评测测的是模型能否找到解法,长任务体验还要加上目标理解、持续执行和交付完整度。前者可以跃升,后者仍可能「差最后一截」。企业验收时应分开记录,不能用一个榜单百分比替代完整任务回放。
同一个模型名,换个入口就换了性格
Mollick 同日在另一条原创帖里比较 GPT-5.6 的不同版本。他说,只有聊天机器人入口提供的 GPT-5.6 Pro 是他见过最聪明的模型;Codex 中最强的 GPT-5.6 Ultra,在困难任务上却远没有那么强。对真正棘手的问题,他给出的个人排序是「GPT-5.6 Sol Pro > Fable 5 Ultracode > GPT-5.6 Sol Ultra」,并直接承认这套命名「很令人困惑」。4
这不是独立基准测试,不能据此宣布某个模型全面胜出。它提醒产品团队:采购记录不能只写型号,还要写入口、工具链、上下文设置和任务类型。聊天框里的强能力,未必会原样转移到代码工作台。
开源权重讨论,已经混进国家竞争
Sam Altman 在窗口内写道,他希望美国在 AI 的开源模型和专有模型两条路上都取胜。原帖没有展开具体政策或产品,这里只能确认他的竞争立场。5
Mollick 的说法更接近问题诊断:如果前沿闭源模型都在美国开发、前沿开放权重模型都在中国开发,开放性争论就会牵涉许可证、模型能力之外的政治与产业问题。「美国闭源、中国开放」是他的格局概括,不是完整产业统计。6
这两条帖子说明,开源与闭源同时承担技术路线和国家竞争的含义。企业仍要核对权重、部署权限、数据位置和替换路径。
Marcus 把问题拉回生产力账
Gary Marcus 是 AI 评论者和《Marcus on AI》作者。他给出的「看多」与「看空」两面清单很短:看多的一面是大模型有趣、芯片和收入都在上涨;看空的一面是,除编码外,企业用户的生产力提升仍缺少足够可展示的证据,模型提供商尚未摆脱补贴芯片才能盈利的质疑,模型也仍不可靠。7
这段话是 Marcus 的判断,不是财报或独立研究,却补上了前面两条线缺的账:评测分数回答「能不能在陌生任务上前进」,产品体验回答「能不能把工作做完」,企业还要追问「节省多少时间,谁承担返工」。本窗口没有证据表明 30% 的 ARC-AGI-3 成绩已转化成广泛企业生产力。
因此,评测表可以只保留四列:陌生任务得分、短任务成功率、长任务交付完整度,以及真实业务中的人工复核成本。采购者如果只看型号和榜单,最容易漏掉的恰恰是最后一列。
コンテンツカードを読み込んでいます…
コンテンツカードを読み込んでいます…
関連コンテンツ
- ログインするとコメントできます。
