Sama 把 5.6 推进 Copilot,Mollick 追问 Work 到底缺什么

Sama 把 5.6 推进 Copilot,Mollick 追问 Work 到底缺什么

过去 24 小时,Sama 将 GPT-5.6 与 Microsoft 365 Copilot 绑定,OpenAI 把 ChatGPT Work 描成跨应用长任务 agent;Mollick 则用 NotebookLM 对比追问它是否真正围绕流程、来源和可复核性设计,Chollet 的 agentic coding 短评补上技术侧背景。

过去 24 小时最值得看的变化,是 OpenAI 把 GPT-5.6 从模型发布继续推到办公入口里:Sam Altman 说 GPT-5.6 已成为 Microsoft 365 Copilot 的 preferred model;OpenAI 的官方页面把它放进 Word、Excel、PowerPoint、Chat 和 Cowork。Ethan Mollick 同时给了一盆冷水:如果 ChatGPT Work 只是把 Codex 的能力藏进一个更钝的外壳,却没有围绕流程和来源重做体验,那知识工作者未必会买账。123

先看可入选素材

人物窗口内原创本期信号
Sam Altman2 条GPT-5.6 与 Microsoft 365 Copilot 绑定;他继续强调用户喜欢 5.6 sol。4
Ethan Mollick6 条把 ChatGPT Work、NotebookLM、Fable 项目中断、新语音和公开模型数学证明放进同一个「工作流验收」问题里。56
François Chollet1 条Agentic coding 过去 6 个月进展很快,已经像换了一个世界。7
Gary Marcus2 条版权和训练数据批评继续出现,但原推多为上下文依赖短句,只适合作为风险旁注。89
Karpathy、Yann LeCun、Demis Hassabis、Jim Fan、Ilya Sutskever 在这个窗口内没有可入选的原创 AI 长推;LeCun 和 Demis 主要是 RT,Jim Fan 与 Ilya 暂无新原创。

Sama 的新信号:5.6 不再只是榜单模型

Altman 这次没有展开技术细节,只转发式地把重点放在 Microsoft 365 Copilot:GPT-5.6 已经是 Copilot 的 preferred model。OpenAI 官方页面说,GPT-5.6 会进入 Word、Excel、PowerPoint、Chat 和 Cowork,目标是让用户在文档、数据分析、演示稿和跨团队协作里用更少提示词做出更完整的工作成果。2
这里比「模型更强」更具体的是分发位置。Microsoft 365 是企业已经在用的工作台,不是一个需要用户主动迁移的新页面。GPT-5.6 如果在这里变成默认能力,评测标准就会从「回答好不好」转成「能不能少改几轮文档、少返工几张表、少开几次协调会」。
OpenAI 还强调 GPT-5.6 的 performance per dollar,并说 Microsoft 会通过 OpenAI API 直接访问模型,把它带给 Microsoft 365 客户。2这和 Altman 近几天反复提到的 5.6 sol 成本叙事接上了:企业不只问模型智商,也问每个任务要烧多少钱。

Mollick 的反问:Work 缺的不是能力,是工作过程

OpenAI 对 ChatGPT Work 的定义很雄心勃勃:它是 ChatGPT 里的 agent,可以跨应用和文件行动,必要时陪一个项目跑几个小时,把一个目标拆成小步骤并完成成品。官方页面还写到,它内置 Codex 技术,Codex 每周有超过 500 万用户,其中超过 100 万人已经把它用于软件开发之外的工作。10
Mollick 看的是另一个问题:产品到底有没有围绕知识工作重做。他拿 Google NotebookLM 回答同一个问题、处理同样 70 多个文件的效果作对比,认为 NotebookLM 更重视 process 和 sources,而不只是输出一个结果。3这句话很关键。企业里很多任务不是缺一个「最终答案」,而是缺少能被复核的路径:用过哪些文件、排除了哪些证据、哪些结论还要人确认。
他随后追问 ChatGPT Work 的定位:如果它只是一个隐藏了 coding 过程的弱化版 Codex,发布时又没有清楚说明未来会成为什么,用户很难理解它的价值。5这不是简单吐槽 UI。Agent 进入办公场景后,界面要承担解释责任:它不能只说「我做完了」,还要告诉人类它怎么做、哪里不确定、哪些步骤需要批准。

Fable 和语音:长任务里,护栏也会变成产品体验

Mollick 同日还提到一个更小但更真实的故障:Fable 在长项目中读到他论文参考文献页后,因为某个 forbidden thought 中断项目;他的表述是,只要读到那页,项目就停。6
这条推文的价值不在于判断 Fable 好坏,而是提醒团队别把安全策略只当后台规则。长任务 agent 最怕中途突然停机,而且停在用户无法理解的地方。对企业来说,护栏需要有可解释的中断原因、可恢复的检查点和可申诉的流程,否则越是长任务,越容易把一次安全拦截变成整条工作流的损耗。
同一天,Mollick 对新 ChatGPT 语音也给出比较克制的评价:值得在手机上试一分钟,但要记住 voice model 不会像完整 thinking model 那么聪明。11这和上一条连起来看,入口变自然不等于判断更可靠。语音、桌面、浏览器、办公套件都在把 AI 往用户身边推,但越靠近真实工作,越要把能力边界说清楚。

Chollet 的一句短评,补上技术侧背景

François Chollet 今天只有一句可入选短评:agentic coding 在过去 6 个月进展快得惊人,已经是完全不同的世界。7这句话短,但和 OpenAI Work、Copilot、Mollick 的批评正好对上。
编码 agent 过去半年证明了一件事:模型可以在长上下文、文件系统、工具调用和反复修改中做出可用结果。现在问题转向更混乱的办公场景。代码至少有测试、diff、编译和版本控制,知识工作常常只有一堆文件、模糊目标和会变的老板意见。谁能把来源、过程、审批和恢复机制做清楚,谁才更像真正的工作产品。
今天几条观点合在一起,给企业团队的检查清单很朴素:不要只看 GPT-5.6 是否接入了你常用的软件,也要看它能不能留下可复核的工作轨迹;不要只看 agent 能不能跑几个小时,也要看它出错后能不能恢复;不要只看语音是不是自然,也要看它背后的模型是否适合当前任务。AI 正在进入办公套件,但办公套件里最值钱的不是「替你写完」,而是让人知道这份工作为什么可信。

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel