8月26日 AI 早报:Jalapeño 首批实测,Apple 推 M6 与 M5 Ultra

8月26日 AI 早报:Jalapeño 首批实测,Apple 推 M6 与 M5 Ultra

过去24小时,AI 的新变化集中在推理硅片、终端算力、自主武器规则、法律垂类平台与代理记忆;这五条按产业影响力排序,帮助读者分清哪些已有实测数字,哪些仍是谈判呼吁或预览产品。

覆盖时间:2026 年 8 月 25 日 07:45 至 2026 年 8 月 26 日 07:45(上海时间)。以下五条按行业影响力排序,分别覆盖自研推理芯片、终端算力、自主武器规则、法律垂类平台与代理记忆。
排名发生了什么为什么重要
1OpenAI 公布自研推理芯片 Jalapeño 首批实测:在 InferenceX 基准上,相对对照系统峰值能效约高 1.5–1.9 倍,端到端延迟约低 1.7–3.6 倍;公司计划年内小规模部署。1模型公司开始用自有硅片证明「更快、更省电」可以同时成立,推理成本与响应速度进入同一张账本。
2Apple 发布 M6 与 M5 Ultra:M6 为公司首款 2 纳米芯片;M5 Ultra 首次采用四裸片架构,统一内存带宽达 1.2 TB/s,面向本机大模型与专业负载。2桌面端本地跑、微调大模型的硬件上限被抬高,隐私与算力不必再默认交给云端。
3联合国秘书长与红十字国际委员会主席联合呼吁:立即启动具有法律约束力的自主武器谈判,并点名十一月《特定常规武器公约》审议会议。34AI 武器争论从「要不要谈」推进到「何时启动有约束力的谈判」。
4Google Cloud 推出 Gemini Enterprise for Legal:面向律所与法务的代理式平台,现以预览形式提供,连接 iManage、Harvey、Thomson Reuters 等法律系统。5通用大模型开始按行业打包成「技能 + 连接器 + 治理」整包,法律成为首批垂类之一。
5Anthropic 让 Claude 的记忆在聊天与 Cowork 之间共享,用户可在设置里查看、编辑或删除记忆条目。6代理产品开始把「研究阶段」和「执行阶段」接成同一条上下文,而不是让用户反复交代背景。

1. Jalapeño 给出首批实测:更快和更省电一起报

8 月 25 日,OpenAI 公布自研推理芯片 Jalapeño 的首批结果。公司用 SemiAnalysis 的公开基准 InferenceX 测试完整请求路径,并与市售领先推理系统对比。OpenAI 称,在 GPT‑OSS 120B、DeepSeek R1 与 Kimi K2.5 1T 三款公开模型上,Jalapeño 峰值吞吐的能效约为对照系统的 1.5–1.9 倍,端到端延迟约低 1.7–3.6 倍;在更偏交互的负载上,性能约为对照的 2.1–4.1 倍1
芯片额定功耗 700 瓦,OpenAI 称实测持续功耗不超过 550 瓦。公司把比较口径放在「单位功耗完成的有效 AI 工作量」,而不是单芯片峰值算力;设计重点是减少预填充、解码和芯片间通信时的数据搬运,让 KV cache 等状态尽量留在本地。OpenAI 还写到,开发过程用到了自家模型,从设计到流片约 9 个月;部署计划是 2026 年底前先在公司内部算力里小规模上线,并继续使用 NVIDIA 等合作方加速器。17
对行业来说,关键变化是:模型公司开始用可核对的推理基准,证明「低延迟」和「高能效」不必二选一。这些数字仍是 OpenAI 在选定模型、选定对照系统和 InferenceX 口径下的结果;大规模上线后的成本、良率和软件成熟度,还要看后续部署。

2. Apple 用 M6 和 M5 Ultra 抬高本机 AI 上限

同日,Apple 发布 M6 与 M5 Ultra。M6 是公司首款 2 纳米芯片,配备最多 12 核 CPU、12 核 GPU、双 16 核 Neural Engine,统一内存带宽最高约 170 GB/s;Apple 称相对 M5,峰值 GPU AI 算力提高近 30%,本机大模型的提示处理会更快。2
M5 Ultra 被 Apple 称为「迄今最强芯片」。它用 UltraFusion 把两颗双裸片 M5 Max 连成四裸片架构,CPU 最多 36 核、GPU 最多 80 核,统一内存最高 512 GB,带宽 1.2 TB/s,比 M3 Ultra 高 50%。Apple 的说法是,开发者可以在 Mac 上本地运行并微调大模型,框架会自动调度 CPU、GPU 与 Neural Engine。M6 用于新款 Mac mini,M5 Ultra 用于新款 Mac Studio。2
这把「本机跑百亿到千亿参数级模型」从实验配置,推成更接近标准桌面规格的选项。实际能跑多大、多快,仍取决于具体模型量化、内存配置和应用软件;Apple 给出的倍数来自公司 2026 年 8 月的内部基准测试。

3. 联合国与红十字会要求立刻谈自主武器规则

8 月 25 日,联合国秘书长古特雷斯与红十字国际委员会主席斯波利亚里奇发表联合呼吁,要求各国立即启动具有法律约束力的谈判,为自主武器系统设立明确禁止与限制。两人写道,人类已「危险地接近一条道德红线:由机器自主选定人类目标」。34
声明把十一月在日内瓦举行的《特定常规武器公约》第七次审议会议,称作目前最清晰的推进路径。联合国新闻稿归纳的禁止重点包括两类:结果无法预测的自主武器,以及直接以人员为打击对象的系统。Reuters 报道称,俄、美等国仍反对新增有约束力的文书,认为现行国际人道法已经够用。48
这份呼吁本身不是条约,也不改变任何现有武器的合法地位。它的作用是把 2023 年以来的讨论,重新压回「必须开始有约束力谈判」的时间表上;真正落地,仍取决于各国是否在十一月会议上同意启动谈判。

4. Google 把 Gemini Enterprise 做成法律行业整包

Google Cloud 8 月 25 日推出 Gemini Enterprise for Legal,面向律所与企业法务。产品把四块放在一起:面向合同审查、法规扫描、数据主体访问请求(DSAR)等工作的专用技能;连到文书与案件系统的安全连接器;可直接部署的代理;以及统一的治理控制面。Google 称客户数据、提示与输出留在组织边界内,且不会用于训练 Google 基础模型。平台目前为预览5
连接器名单包括 iManage、NetDocuments、Docusign、Everlaw、RelativityOne、Harvey、Legora、Thomson Reuters HighQ 等。早期合作律所包括 Cleary Gottlieb、Freshfields、Weil 与 Williams & Connolly。同日还公布了面向金融服务的对应方案。59
法律场景对权限隔离、伦理墙和引证可追溯要求很高。Google 的做法是:不再只卖通用对话能力,而是把行业系统接入、任务技能和审计治理做成可部署的一层。预览阶段的真实办案质量、幻觉率和客户接受度,仍需各所自己的试点数据。

5. Claude 让聊天与 Cowork 共用同一份记忆

Anthropic 8 月 25 日在 Claude 应用更新说明中写到:云端记忆现已同时覆盖聊天与 Cowork。用户在一处积累的项目背景,可以在另一处直接沿用;所有记忆条目列在「设置 > 记忆」的 Topics 下,可编辑或删除。健康、信仰等敏感主题默认不写入记忆,需用户打开「Include sensitive topics in memory」;Free、Pro、Max 默认开启记忆,Team 与 Enterprise 默认关闭。6
这解决的是代理产品里很具体的断点:用户常在聊天里把方案聊清楚,切到 Cowork 执行时又要从头交代人数、城市、讲者名单。共享记忆后,研究和执行更像同一位助手的连续工作,而不是两个互不认识的产品。代价是记忆内容本身成为新的权限与隐私边界——用户需要知道系统记住了什么,以及如何删掉它。

今天继续盯什么

  • Jalapeño 与 Apple 芯片:看内部小规模部署和本机大模型应用,能否把厂商基准换成可复现的第三方成本与延迟数据。
  • 自主武器谈判:十一月 CCW 审议会议是否正式决定启动有约束力谈判。3
  • Gemini Enterprise for Legal 与 Claude 记忆:前者看预览客户的真实工作流接入深度,后者看共享记忆在团队版权限与敏感信息控制上的落地细节。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content