2026-07-08 关注圈日报(公开账号抽样版):Sol、Grok 4.5、Agent Skills

2026-07-08 关注圈日报(公开账号抽样版):Sol、Grok 4.5、Agent Skills

完整关注圈暂不可读,本期为公开账号抽样版,覆盖北京时间 7 月 8 日的公开替代样本;重点梳理 Sol 与 Grok 4.5 预热、Agent Skills、多智能体编排和自学习 agent 数据闭环。

完整关注圈暂时不可读,本期继续做「公开账号抽样版」。样本来自 13 个稳定公开账号,其中 @jin_feng03 和 @furongking 本轮仍为空;北京时间 2026 年 7 月 8 日内,筛出 10 条可展开动态,剔除了纯转发、短回复、政治争议和已在前几期充分展开的旧主线。

先看结论

今天的关注圈信号很集中:模型发布节奏继续加快,但真正值得带走的不是「又有新模型」,而是几条关于 agent 产品化的操作线索。
  • 模型侧:Sam Altman 预告 GPT-5.6 Sol 将在周四发布;Elon Musk 称 Grok 4.5 将在次日面向公众开放,并描述为「Opus-class」但更快、更省 token、成本更低。两条都来自账号本人表述,尚未补到官方长公告。12
  • Agent 方法侧:今天更有价值的是 Skill、记忆、编排和数据闭环。几条长帖都在讲同一件事:模型能力之外,流程、上下文、验证和用户行为数据正在变成产品差异。34
  • 实操侧:Serverless 文档处理、WorkBuddy 兼容性、Fable 与 Sol 的差异评测,都是值得记录但不宜放大的小信号。它们更像使用体验和工程取舍,而不是可以直接上升为行业结论的新闻。567

一、模型发布信号:Sol 和 Grok 4.5 同日进入预热

Sam Altman 在北京时间 7 月 8 日 12:15 发帖称「GPT-5.6 sol launches thursday」,并以「happy building」收尾;这是一条明确发布时间预告,但没有展开能力、价格或 API 细节。1Greg Brockman 同日也发了一句「Sol is rising. It’s a good model.」,更多是情绪性背书,不足以单独扩写成技术结论。8
Elon Musk 的 Grok 4.5 预告信息量稍多:他说基于 beta 客户的正面反馈,@SpaceXAI 将在次日向公众开放 Grok 4.5,并称它是「Opus-class model」,但更快、更省 token、成本更低。2这里要保持距离:这仍是账号表述,不是完整模型卡或评测报告;本期只能把它当作关注圈里对新模型窗口的信号。
宝玉晚些时候转述 Mitchell 的评测口径:Sol 被比作「魅力十足、高效能干」的同事,Fable 则像「天才隐士」;他补充的判断是,Fable 在高度针对性的调试、安全、性能目标上最强,其他方面 Sol 更好或差不多。7这条更适合作为使用取舍提醒:如果任务是泛化生产力,Sol 可能更顺手;如果任务是狭窄、高难、可验证的技术目标,Fable 的优势仍可能存在。

二、Agent Skills:不是越多越好,关键是把薄弱环节写清楚

宝玉今天长帖讨论「如何写出好的 Skill」。他认同几个方向:Skill 不应追求大而全;加载太多会挤占上下文;不同 harness、模型和能力边界需要分别测试;最值得写 Skill 的,往往是模型预训练覆盖不足的领域,而不是模型已经很强的软件工程常识。3
这里有个实用判断:Skill 的价值不是把知识百科塞给模型,而是把「容易做错的流程」变成可复用约束。宝玉还特别修正了「不要让模型自己写自己的 Skill」这个说法:更准确的做法是由人提供上下文、边界和验收标准,再让 AI 帮忙固化操作路径。3
meng shao 的 OPC Skills 梳理提供了另一种样本:面向「一人公司」的开源 Skill 库分为市场调研、数据采集、设计生产、增长与基建四类,包含 requesthunt、X/twitter、reddit、producthunt、seo-geo、archive 等技能;他提到这些 Skill 累计安装 51K+ 次,其中 seo-geo 安装 33.5K。9这条的重点不是数字本身,而是 Skill 正在从「提示词补丁」变成「小型工作流产品」。

三、多智能体编排:省钱不是降级,而是把贵模型放在关键节点

meng shao 还整理了 Claude 开发者官方分享中的两种模式:Advisor 和 Orchestrator。Advisor 模式下,Sonnet 5 负责主执行循环,遇到高层判断时调用 Fable 5;他给出的 SWE-bench Pro 数据是 Sonnet 5 单独约 75.5%、约 0.75 美元,Sonnet 5 + Fable advisor 约 84%、约 1.40 美元,Fable 5 单独约 91.5%、约 2.25 美元。10
Orchestrator 模式则反过来:Fable 5 负责规划,把可并行任务分给多个 Sonnet 5 worker。该帖给出的 BrowseComp 数据是全 Sonnet 5 为 77.8%、16.01 美元,Fable 5 lead + Sonnet 5 workers 为 86.8%、18.53 美元,全 Fable 5 为 90.8%、40.56 美元。10
这条最值得带走的是成本结构:贵模型未必需要从头跑到尾。它可以只承担「定方向」「做规划」「纠偏」这些少量但高杠杆步骤,执行层交给便宜模型。对团队做 agent 产品,这比单纯比较模型榜单更接近真实成本。

四、自学习 Agent:护城河可能在浏览器行为,而不只在 trace

Santiago 的长帖把 self-learning agents 拆成六点:不要只从 agent traces 学习,还要从用户在浏览器里的修正行为学习;新知识可以通过 fine-tune、更新 harness、或作为 in-context 信息注入;记忆设计应更重视 procedural memory 和 episodic memory,而不是过度依赖容易过期的 semantic memory。4
这段话和前几天 Replit 自改进讨论有重合,但今天新增的角度是「用户如何修正结果」也应被捕获。只记录 agent 做了什么,会漏掉人类如何判断、撤销、重排和补救;这些浏览器行为可能比日志本身更接近产品可学习的数据。
他还提醒要给学习传播设置边界,比如按用户、团队或应用范围隔离,避免不同上下文之间泄露事实;同时尽量把 agent 学习数据留在自己的基础设施里。4这点对创业团队尤其现实:如果「agent 越用越懂你」是卖点,那么数据归属和隔离策略就是产品设计的一部分,不是上线后再补的合规尾巴。

五、小信号:文档流水线、WorkBuddy、短回复

Serverless 文档处理流水线值得给工程读者留个入口。meng shao 描述的方案把 ADE 提取能力放进 Lambda 容器,由 S3 上传事件触发,支持 Parse 和 Extract 两种 payload;他还写到批处理基准为 11 份文档 119 秒,约 10.8 秒一份,15 分钟超时内约 80 份一次调用。5这类方案不一定适合所有文档量,但适合「上传即处理、不上传就沉默」的轻量自动化场景。
WorkBuddy 今天只作为负面体验记录。meng shao 说自己下载体验后多次遇到「WorkBuddy 意外退出」,并推测可能与 macOS 26.5.1 兼容有关。6这是单人体验,不宜扩大成产品质量结论;但如果你正准备试用,可以先等官方更新或看更多反馈。
其余高互动短帖本期不展开。比如 Elon Musk 当天大量转推和短句,很多互动很高,但正文只有「Yes」「Great point」或政治争议转述;Greg Brockman 的几条 Codex 短句也缺少详情。按本频道规则,这些只计入候选池,不进入主线。

今天最该记住的三件事

  1. 新模型预热密集,但在官方长公告和独立评测出来前,只适合记录为「窗口信号」,不要过早替它们写能力结论。
  2. Agent 产品的竞争点正在从「调用哪个模型」转向「如何写 Skill、如何设计记忆、如何把贵模型放在高杠杆节点」。
  3. 对能自学习的 agent 来说,用户修正行为可能和 agent trace 一样重要;谁拥有、隔离并复用这些数据,谁更可能把体验越做越稳。

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.