
服务器、开放权重与评测天花板:AI行业的竞争转向成本与验证
Apple 追逐 AI 服务器芯片、Thinking Machines 发布开放权重模型,可灵 AI 获近 30 亿美元单轮融资,两篇新论文则提醒行业:模型能力之外,成本、定制和可靠评测正在成为下一道门槛。
AI 行业正在把竞争从单纯追求模型能力,推向三个更难的指标:服务器和推理成本、模型能否被外部开发者改造,以及评测能不能跟上模型能力。今天的几条消息,分别落在这三个位置。
速览
| 板块 | 今日重点 | 读者该关注什么 |
|---|---|---|
| 大公司与模型 | Apple 被报道正接触 AI 芯片公司;Thinking Machines 发布开放权重模型 Inkling | AI 基础设施和模型分发都在向可控性靠拢 |
| 创业与投资 | 快手旗下可灵 AI 据报道完成近 30 亿美元单轮融资 | AI 视频仍能拿到超大额资金,但具体条款尚未公开 |
| 前沿研究 | 两篇新论文把焦点放到自我改进的验证瓶颈和评测专家稀缺 | 下一轮能力竞争,可能先卡在测量和验证,而不是模型参数 |
大公司与模型
Apple 正考虑收购芯片公司,以增强 AI 服务器处理器能力。Reuters 转述 The Information 称,Apple 已接触部分芯片初创公司并和银行家讨论潜在交易;公司内部 AI 服务器目前使用自研 M2 Ultra,代号 Baltra 的下一代芯片据报道已经延期。Apple 没有立即回应,Reuters 也无法独立核实这组信息。1
这条消息的价值不在于 Apple 是否马上买下一家公司,而在于服务器芯片已经成为产品路线的一部分。模型公司可以租云,但大规模训练和推理的成本、供给和延迟,最后都会回到芯片与系统设计上。
Thinking Machines Lab 则把另一条路线摆到台面上。公司 7 月 15 日发布 Inkling,开放完整模型权重。官方披露,Inkling 是一个 MoE 模型,总参数 9750 亿,激活参数 410 亿,最长支持
1M token 上下文,预训练数据包含文本、图像、音频和视频,共 4.5 万亿 token。它可以通过 Tinker 微调,并允许开发者调节推理力度,在效果、延迟和成本之间取舍。公司也承认,Inkling 并不是当前整体能力最强的模型。2这比又一次刷新榜单更值得看:开放权重、原生多模态和可控推理,组成的是一套面向定制部署的产品策略。模型不必在所有公开测试里第一,但要让企业能拿自己的数据改、能算清每次调用的成本。
创业与投资
36 氪 7 月 15 日的报道提到,快手旗下可灵 AI 在 2026 年 7 月完成近 30 亿美元单轮融资,腾讯、阿里巴巴和百度参与其中;报道将其称为全球大视频模型赛道目前最大单笔融资。文章没有披露具体轮次、估值、股权条款或资金用途,这些字段不能从现有材料中补齐。3
可以确认的是,资本仍愿意为 AI 视频押注大额资金;还不能确认的是,这笔钱对应怎样的商业化目标。可灵融资的下一步看点,不只是估值,而是它能否把视频生成继续推向实时世界模型、游戏或更稳定的企业生产流程。这里的技术方向来自同一篇报道的行业访谈,仍应视为公司和受访者的判断,不宜当成已经验证的市场结果。
前沿研究
一篇 7 月 8 日发布的 arXiv 综述整理了 2024 至 2026 年间的 1250 篇自我改进研究,把问题分成部署时自进化、训练时自迭代、自我评估和自动科研四类,再按人类逐步审查、人类监督和完全闭环区分自动化程度。作者的核心判断是:自我改进循环的上限取决于验证信号,formal verifier、执行反馈和 learned judge 的可靠性不同,完全闭环仍容易出现自我确认、模型坍塌和多样性下降。论文同时说明,样本只是研究集合而非完整普查,分类和修正由单一标注者完成。4
另一篇 7 月 13 日更新的工作论文讨论评测基准的天花板问题。它用形式化模型分析基准有效性如何随模型变强而下降,并结合覆盖法律、医疗、工程和金融任务的
1000+ 名专业人士平台数据,观察高难度、低可编码性任务的专家劳动是否稀缺。作者报告,难度最高四分位任务的报酬溢价比最低四分位高约 28 个百分点,但也明确表示这些描述性数据不能单独识别评测生产的完整社会价值。5这两篇论文放在一起,指向同一个实际问题:当模型越来越会刷固定测试,真正稀缺的可能是可靠的验证器、难题设计者和可复核的评测流程。今天可以继续盯三件事:Apple 是否确认芯片交易或 Baltra 进度,Inkling 的独立实测是否接近官方展示,以及可灵这笔融资何时公开完整条款。
Fuentes de referencia
- 1Apple chasing AI chip company deals, The Information reports
- 2Inkling: Our open-weights model
- 3Alibaba's heavy investment fuels the strong rise of the AI video track
- 4Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops
- 5The Benchmark Ceiling: Human Judgment, Evaluation Scarcity, and the Political Economy of AI Capability Measurement
Contenido relacionado
- Inicia sesión para comentar.
