马斯克动态简报|Grok 4.5登顶长任务基准,X政治叙事回潮

马斯克动态简报|Grok 4.5登顶长任务基准,X政治叙事回潮

本期聚焦北京时间7月14日8:00-20:00已返回的马斯克X动态:Grok 4.5登顶Long-Horizon Terminal-Bench是唯一清晰的xAI信号,但官方基准也显示长任务代理仍远未被解决;X政治叙事回潮,Tesla、SpaceX硬件与加密没有新的马斯克本人硬催化。

北京时间 7 月 14 日 8:00-20:00 可见的马斯克本人 X 动态只有两条,但其中一条够硬:他确认 Grok 4.5 在 Long-Horizon Terminal-Bench 拿到第一。这个基准不是普通答题榜,而是把模型丢进终端环境,让它连续跑几十到上百步任务,再用隐藏验证器给分。Grok 4.5 排第一,但官方结果也说得很克制:46 个任务里,它只解出 13 个,29 个任务没有任何模型能解完。12
Cargando tarjeta de contenido…

今日重点推文

北京时间原文中文释义互动与判断
13:44「The woke mob had turned Twitter into Wormtongue to the World」马斯克说,过去的「woke mob」曾把 Twitter 变成面向世界的「Wormtongue」。Wormtongue 是《指环王》里挑拨君主、扭曲判断的角色。约 164.2 万浏览。这是 X 平台治理和政治叙事,不是产品功能更新;它延续马斯克把旧 Twitter 描述成舆论操控工具的口径。3
13:58「Grok 4.5 reaches #1 position on Long-Horizon Terminal-Bench」Grok 4.5 在 Long-Horizon Terminal-Bench 排名第一。约 166.0 万浏览,是今天唯一清晰的商业科技信号。LHTB 官方报告显示,Grok 4.5 平均奖励 0.505、解出 13/46 个任务,成本约 11.19 美元/任务;领先是真的,但离「长任务代理被解决」还很远。14

市场影响:xAI 有硬一点的成绩,但边界也很清楚

xAI / Grok

今天的 Grok 4.5 推文比昨天的「后台代理模式」更可核验。昨天是马斯克个人使用线索,今天有外部 benchmark 承接:LHTB 把 46 个任务放进容器终端,每个任务有 90 分钟预算,用隐藏验证器检查最终产物;任务覆盖代码迁移、科学计算、系统安全、研究复现、交互游戏和专业工作流等场景。24
这对 xAI 的意义在于,它把 Grok 4.5 从「马斯克说很强」推进到一个可被其他团队复跑、可比较的长任务榜单。长任务代理的难点不是会不会写一段代码,而是能不能在一个下午里不断试错、读取结果、修正方向,并且不把前面做过的决定忘掉。LHTB 测的正是这个能力。
不过这不是一个可以直接拉满估值的信号。官方报告写得很直白:Grok 4.5 只拿到 0.505 平均奖励,最好模型仍低于一半满分;在严格解决标准下,Grok 4.5 是 13/46,仍有 29 个任务没有任何模型解完。2 也就是说,Grok 4.5 现在更像是「在难题上领先」,不是「已经把难题解决」。

X 平台

「Wormtongue to the World」这条更像政治品牌叙事。马斯克把旧 Twitter 描述成误导世界的声音,等于再次把 X 的改造包装成意识形态纠偏。3
对 X 的商业判断来说,这条没有给出广告、支付、订阅、创作者分成或产品功能的新信息。它能强化马斯克核心受众对 X 的认同,但也会继续把平台放在政治冲突中心。今天只能把它放在「平台定位」而不是「经营催化」里。

Tesla

Tesla 今天没有 FSD、Cybercab、Optimus、车辆交付或能源业务的新推文。行情背景上,StockAnalysis 页面显示,TSLA 在美东 7 月 13 日收于 394.76 美元,跌 3.19%;北京时间 7 月 14 日约 20:01 的盘前价为 396.68 美元,下一次财报日期列为 7 月 22 日。5
这意味着 Tesla 今天仍主要受财报前市场预期和外部分析师口径影响,马斯克本人没有给出新的产品节奏。把 Grok 4.5 的 benchmark 成绩硬接到 Tesla 上,还太早。

SpaceX / SPCX

SpaceX 今天没有 Starship、Starlink、发射任务或 SPCX 的新推文。StockAnalysis 页面显示,SPCX 在美东 7 月 13 日收于 139.14 美元,跌 4.24%;北京时间 7 月 14 日约 20:02 的盘前价为 139.33 美元。页面同时显示日内区间低点 136.78 美元,说明市场仍在消化上市后估值回落。6
Grok 4.5 的长任务能力可以服务 SpaceXAI 叙事,但今天没有 SpaceX 业务端的新参数。SPCX 的核心变量仍是 Starship Flight 13、Starlink 增长和上市后交易结构,而不是这条 benchmark 推文本身。

加密

加密继续空窗。今天没有 DOGE、BTC 或明确加密资产表态。

继续关注什么

  1. LHTB 排名是否被更多第三方复跑,尤其是 5 次 trial 的社区榜结果。单次快照有意义,但长期榜单更能说明模型稳定性。7
  2. xAI 是否把 Grok 4.5 的长任务成绩转成产品入口,例如后台 agent、代码执行、企业工作流或 API 定价。没有产品页和客户使用数据,benchmark 仍只是能力证明。
  3. Tesla 财报前,马斯克会不会重新谈 FSD、Cybercab 或 Optimus。今天没有这类推文。
  4. SpaceX Flight 13 前后,马斯克是否补充 Starship 或 Starlink 的工程信息。今天的窗口里没有。
今天的排序很简单:Grok 4.5 登顶 LHTB 排第一,因为它有可核验成绩;X 平台政治叙事排第二,因为它有传播但缺经营信息;Tesla、SpaceX 硬件和加密都没有新的马斯克本人硬催化。

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel