Sama 推 GPT-live,Mollick 把模型选择压成两家

Sama 推 GPT-live,Mollick 把模型选择压成两家

过去 24 小时,Sama 把 GPT-live 和 GPT-5.6 sol 放到台前;Mollick 认为 Sol 与 Fable 已拉开差距,并把新语音、本地开源工具调用视作 AI 工作方式变化;Marcus 则提醒 LLM 仍是语言模型,容易被宣传材料牵引。

过去 24 小时最强的新增信号,不是又多了一个模型代号,而是 AI 的入口正在从聊天框往两边扩散:一边是 Sam Altman 说新一代语音 GPT-live 已在 ChatGPT 上线,自己过去偏好打字,现在觉得会转向说话;另一边是 Ethan Mollick 把 Sol、Fable、本地开源模型和代码工具放进同一个工作流里讨论。对国内 AI 团队来说,这比单看榜单更有用:模型能力在升级,但真正改变成本结构的是入口、路由和工具调用方式。12

先看本期可入选素材

人物窗口内原创本期信号
Sam Altman2 条GPT-5.6 sol 发布预告;GPT-live 语音入口上线,且互动量明显高于其他候选。31
Ethan Mollick4 条把 Sol/Fable 视作与其他模型拉开差距的双选择;同时观察新语音、Claude Tag、本地开源工具接入代码环境。452
Gary Marcus1 条从语言模型「建模语言而非思想」切入,提醒 LLM 可能被宣传材料牵引。6
Karpathy、Yann LeCun、Demis Hassabis、Jim Fan、François Chollet、Ilya Sutskever 在本窗口内没有可入选的原创 AI 长推;LeCun 和 Demis 主要是 RT,Chollet 最新也是 RT,不计入原创主条目。

Sama 的两条短推:发布节奏和入口转向同时出现

Sam Altman 先在北京时间 7 月 8 日中午预告「GPT-5.6 sol launches thursday」,并用「happy building」收尾。按 X 详情载荷,这条推文已有 2.8 万以上点赞和 159 万以上浏览。它不是技术说明书,也没有公开 benchmark,因此不能把它写成模型能力已经被验证;更稳妥的读法是,OpenAI 正在把新模型发布节奏继续压到开发者可立即试用的语境里。3
更值得看的是当晚那条 GPT-live。Altman 说 GPT-live 是「next-generation voice」,当天在 ChatGPT 上线;他的主观感受是「magical and real」,并说自己一直偏好打字,现在认为这种习惯会改变。按 X 详情载荷,这条推文已有约 40 万浏览、7900 多点赞。1
这句话的重点不是「语音更自然」这么简单。语音入口如果真的足够低延迟、足够聪明,它会改变用户给 AI 分配任务的场景:临时想法、会后复盘、走路时的指令、多人讨论里的旁路助手,都比传统聊天框更接近真实工作流。对企业产品来说,问题也随之改变:不是「有没有语音按钮」,而是语音会不会进入权限、记忆、任务状态和复核机制。

Mollick 的补充:不是多一个模型,而是工作方式开始分叉

Ethan Mollick 在同一窗口给出更明确的选型判断。他说自己的大 takeaway 是,Sol 和 Fable 都比上一代模型出现跳跃,已经与次优 AI 拉开大差距;用户可以偏好其中一个,但只要工作里「更高智能」重要,这两个模型就是仅有选择。4
这句话对团队采购和产品设计的含义很直接:如果任务需要连续推理、复杂写作、代码修改、跨工具操作,便宜模型未必省钱。模型单价只是账面成本,返工、人工复核、错误回滚和上下文丢失才是实际成本。Mollick 的判断也延续了他最近几周的主线:企业应该按任务风险和返工成本选模型,而不是把「大模型 vs 小模型」写成固定宗教。
他随后把 GPT 新语音和 Claude Tag 放在一起,说新 GPT voice 更接近科幻里「和 AI 说话」的体验,部分原因是它更聪明;再加上 Claude Tag,意味着新的 AI 工作方式正在出现。5
这里的关键词是「working with AI」。聊天框时代,AI 主要是一个你主动打开的页面;Agent 时代,AI 更像一个可以持续执行、可以接入工具、可以在不同界面里被唤起的工作伙伴。语音只是入口之一,Tag、本地模型、代码环境、文件权限才是后面的系统工程。

本地模型接入:成本控制不只靠换便宜 API

Mollick 的第三条值得国内团队单独记下。他说自己常用 Pinokio 下载和操作本地开源 AI 工具/模型,而 Pinokio 的一个有趣之处,是能把这些工具无缝暴露给 Code 和 Codex;他还说 GPT-5.6 曾经找到自己的本地视频模型和图像模型,并把它们当作付费 API 的廉价替代。2
这比「本地部署省钱」更具体。真正的新模式是:前沿模型不一定亲自完成每一步,而是判断什么时候调用本地工具、什么时候调用专业模型、什么时候才需要昂贵的云端推理。换句话说,模型路由正在从后端工程配置,变成 AI 自己可以参与的工作流决策。
这会带来一个新验收标准:Agent 不只要答得好,还要会选择工具。它能否发现本地资源?能否知道哪些任务不该花贵价 API?能否把中间结果交给人复核?这些问题决定了 AI 系统从演示走向长期使用时的单位经济模型。

Marcus 的冷水:语言流畅不等于思想可靠

Gary Marcus 今天没有继续资本开支账本,而是换了一个更偏技术可靠性的角度。他说,一个案例提醒我们,语言模型建模的是语言,而不是思想本身;也正因为如此,LLM 很容易受到宣传材料影响。6
这条短推不能被扩写成「所有模型都会被任意宣传操纵」,原文没有给出那么强的结论。但它对今天的主线正好形成制衡:当语音入口更真实、Agent 更会调用工具、前沿模型看起来更像同事时,用户更容易把流畅表达误认成稳定判断。
所以,本期三组观点合在一起看,真正的变化不是「又有一个更强模型」。更准确的说法是:AI 正在从单一聊天产品变成一组入口、模型和工具的调度系统。Sama 给出发布和入口信号,Mollick 把它落到选型与成本结构,Marcus 提醒它仍可能在语言层面被牵引。对从业者来说,下一轮产品评测要少问一句「模型分数多少」,多问三句:它进入什么工作流、调用什么工具、错误由谁兜底。

関連コンテンツ

  • ログインするとコメントできます。
More from this channel