
OpenAI Jalapeño 首测、娱乐巨头入股 Stability:AI 开始比谁能更便宜地跑起来
本期聚焦 OpenAI 自研推理芯片 Jalapeño 首测、Stability AI 7600 万美元 Series B,以及 Prime Agent 对长程 harness 的评测提升,帮助读者判断推理成本、版权合作与 Agent 验收该看哪些字段。
今日判断
北京时间 2026 年 8 月 25 日 08:00 至 8 月 26 日 08:00,AI 行业的关键变量同时落在「谁能更便宜地跑模型」和「谁能把生成结果接进合法生产流程」。OpenAI 公布首款自研推理芯片 Jalapeño 的实测结果,并计划在年底前部署到自家基础设施;Stability AI 拿到 7600 万美元 Series B,投资方名单里出现 EA、索尼音乐、环球音乐和华纳音乐;近期论文 Prime Agent 则把长程 Agent 的 harness 做成可复用底座,在 ARC-AGI-3 上把 Best@1 从 30% 拉到 95.5%。三条线放在一起,读者今天更该跟踪:单位功耗能完成多少有效推理、版权方是否直接参与工具开发,以及评测分数里有多少来自 harness。
快速扫一眼
| 板块 | 关键动态 | 规模与证据边界 | 读者该看什么 |
|---|---|---|---|
| 大公司与产品 | OpenAI 公布 Jalapeño 首测:在 InferenceX 上对 GPT‑OSS 120B、DeepSeek R1、Kimi K2.5 等模型给出更高每瓦吞吐与更低端到端延迟。1 | 数字来自 OpenAI 自家测试与公开基准配置;对照系统为市售 AI 加速方案,功耗按标称 TDP 归一化。 | 年底前是否进入 OpenAI 生产集群,以及对外服务延迟与成本是否可见下降。 |
| 创业与投资 | Stability AI 完成 7600 万美元 Series B,累计融资 2.32 亿美元;EA、索尼音乐、环球音乐、华纳音乐等娱乐产业方参投。2 | 金额与投资方来自公司公告;未披露估值。 | 授权训练数据能否转化为可落地的专业工作流插件与服务收入。 |
| 前沿研究 | Prime Agent 用持久 REPL、跨轨迹 harness 与递归子代理,把 ARC-AGI-3 RHAE Best@1 从 30% 提到 95.5%。3 | 预印本作者实验结果;提交时间为北京时间 2026-08-25 01:54,略早于本期主窗口。 | 团队验收时要把「模型版本」和「harness / 子代理配置」拆开记录。 |
大公司与产品
OpenAI 给 Jalapeño 交上第一份功耗与延迟成绩单
OpenAI 8 月 25 日发布 Jalapeño 首测结果。Jalapeño 是公司第一款自研推理芯片,面向语言与 Agent 工作负载的服务侧。公司称,这颗芯片在同一架构上同时追求更高吞吐和更低延迟,而现有硬件系统常常只能在两者之间取舍。1
测试基于公开基准 InferenceX,覆盖 GPT‑OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。OpenAI 报告:在峰值吞吐工况下,Jalapeño 的单位功耗有效工作量约为对照系统的 1.5–1.9 倍,端到端延迟约为对照的 1.7–3.6 分之一;在高交互工况下,性能约为对照的 2.1–4.1 倍。附录给出更细的对照:在 GPT‑OSS 120B 上,峰值混合吞吐约 85448 vs 44960 mixed TPS/kW,端到端延迟约 1.03 s vs 1.80 s;Jalapeño 标称功耗 700 W,公司称实测持续功耗不超过 550 W,对照系统分别按 GB200 1200 W、GB300 1400 W 的标称 TDP 归一化。1
OpenAI 还写明了工程路径:从设计到 tapeout 约 9 个月,开发过程中使用了自家模型;团队用 Codex 与 GPT‑Astra,在约两个月内把三款原先不在量产计划内的开源权重模型调到可用性能。公司计划在 今年年底前 开始把 Jalapeño 部署进 OpenAI 的算力基础设施,并继续使用 NVIDIA 等合作方加速器做训练与推理。1
对采购与平台负责人,这组数字应按「厂商口径的系统级对照」使用,后续再等第三方复现。值得继续核对的字段有四个:生产集群上线时间、对外 API 延迟分位、单位 token 成本变化,以及开源权重模型之外的前沿闭源模型是否给出可比较数字。
创业与投资生态
Stability AI 把娱乐产业投资方写进 Series B
Stability AI 8 月 25 日宣布完成 7600 万美元 Series B,新领导下累计融资达到 2.32 亿美元(含两轮股权与可转债)。新投资方包括 Electronic Arts、索尼音乐集团、环球音乐集团、华纳音乐集团,以及 AMD Ventures 和 Pacific Alliance Ventures;Coatue、Greycroft、Kadmos Capital、Sean Parker、Eric Schmidt 等老股东继续跟投。Coatue 联合创始人 Thomas Laffont 进入董事会。2
公司称资金将用于创意生产工具套件、应用研究,以及专业服务团队扩张。公告同时点到刚发布的 Stable Audio 3.0:一组基于完整授权数据训练的开源权重音乐模型,可通过 DAW 插件或 StableAudio.com 接入工作流。EA、环球音乐、华纳音乐此前已与 Stability 建立合作,这次从合作方变成了本轮出资人。2
TechCrunch 同日报道补充了背景:这轮名单更接近内容授权与分发伙伴,传统 VC 只是其中一部分;英国 Getty 案中 Stability 大体胜诉,美国同类诉讼仍在进行。4
对投资人与内容产品团队,观察点应落在授权关系能否变成可重复收入:专业服务合同、插件装机量、工作室付费席位,以及诉讼结果是否改变训练数据策略。公告没有给出估值或 ARR,融资额与业务规模仍要分开看。
前沿研究与安全
Prime Agent:先修好 harness,再谈模型上限
论文 Prime Agent: A Self-Improving RLM Harness 于北京时间 2026 年 8 月 25 日 01:54 提交(UTC 8 月 24 日 17:54),略早于本期主窗口,故作为近期论文收入。Prime Agent 是一套开源 harness:用持久 IPython REPL 做程序化上下文处理与测试时计算,用 Continual Harness 跨轨迹保存历史、记忆、技能、提示词和子代理规格,再用递归子代理与 agent-to-agent 通信协调长程任务。作者把目标写成:把执行、恢复、验证和资源记账标准化,把策略构造留给模型,降低 harness 故障被记成模型失败的概率。3
关键结果写在摘要里:Prime Agent 把 ARC-AGI-3 RHAE Best@1 从 30% 提到 95.5%,并在长上下文编程、GPU kernel 生成、模拟器构建和自主 nanoGPT 加速跑分等任务上达到或超过原生及常见 harness。Factorio 实验里,作者观察到 refinement 支持持续技术推进,专用子代理支持并行分工。代码托管在 GitHub 的 PrimeIntellect-ai/prime-agent。3
这组数字提醒验收团队:同一模型换一套 harness,分数可以差出一个数量级。比较模型时至少要固定会话恢复方式、子代理拓扑、验证脚本和资源上限;否则 leaderboard 上的跃迁可能只是执行层差异。预印本结果属于作者实验设置,适用范围仍停在受控评测。
接下来观察
References
- 1
- 2
- 3
- 4
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
