
Google研究团队出走、DeepSeek预告涨价:AI竞争转向价格与可验证执行
本期从 Google 研究人才外溢、DeepSeek API 计划涨价、Omilia 融资与两项 Agent 研究切入,帮助读者判断 AI 产品的成本、商业化和执行可靠性。
今日判断
本期覆盖 8 月 6 日 08:00—8 月 7 日 08:00(北京时间);研究栏补充 8 月 4—5 日提交、仍有跟进价值的预印本。过去一天的共同线索,是 AI 的竞争开始由「能不能做出来」转向「怎么定价、能不能持续执行、谁来验证」。
Google 的顶尖研究人员把科学自动化做成新公司,DeepSeek 预告 API 将大幅涨价;创业公司 Omilia 用客户支持的收入和部署规模证明商业化,最新论文则把 Agent 的计划文件和科学推理的筛选能力拿出来单独测量。
快速扫一眼
| 板块 | 最新信号 | 读者该跟进什么 |
|---|---|---|
| 大公司与产品 | Google 资深研究人员组建 Discovery Loop,目标是让 AI 并行推进科学实验;DeepSeek 计划近期上调 API 价格,但方案和生效时间尚未公布。12 | 看 Discovery Loop 能否拿出可复现实验结果;不要在 DeepSeek 正式价格发布前锁死长期成本。 |
| 创业与投资 | Omilia 完成 6700 万美元 Series B,称年经常性收入已达到 6000 万美元,并把自学习 Agent 推向客服和语音点单。3 | 核对客户续费、单位经济和真实订单错误率,而不是只看融资额。 |
| 前沿研究 | 一项开源软件研究从 36,710 个仓库中找到 85 份 Agent Plans;另一项预印本用 F1 和《万智牌》检验 AI 科学家的新颖性与筛选能力。45 | 评测 Agent 时,把计划、验证和选择过程纳入指标,不要只看最终答案。 |
大公司与产品
Google:研究组织外溢,科学自动化成为创业方向
Google 资深高管 Jeff Dean 与 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 等研究人员离开公司,共同创办公益性质公司 Discovery Loop。TechCrunch 报道称,Dean 计划担任 CEO;Alphabet、Radical Ventures、Khosla Ventures 等为项目提供支持,首轮融资由 Radical 和 Khosla 共同领投,但金额没有披露。1
Discovery Loop 的目标不是再发布一个通用模型,而是让 AI 同时发起、迭代大量实验,部分自动化完整的科学研究循环,并探索「递归自我改进」系统。对 Google 来说,值得观察的不是一位名人离职本身,而是长期研究能力是否会通过独立公司获得更快的试错速度;对投资人来说,首轮金额、首批实验和可复现结果比创始人名单更能说明这条路线是否成立。
DeepSeek:从低价获客转向计划性涨价,但尚未真正调价
DeepSeek 8 月 6 日公告称,计划近期整体上调 API 服务定价,预计涨幅较大,具体方案以正式通知为准。现阶段能确认的是「计划涨价」,不能确认涨幅、执行日期或新价格;相关报道也没有显示该调整已经生效。2
这对开发者的直接影响是预算不确定性,而不是今天立刻变贵。已经接入 DeepSeek 的团队应把峰值调用、缓存命中和输出 Token 分开记录,等正式方案发布后再重算单位任务成本。对行业观察者,这是一条比模型榜单更硬的信号:当推理需求和服务稳定性成为约束,价格可能从抢占调用量的工具变成筛选高价值工作负载的工具。
创业与投资
Omilia:融资故事被压缩成一个问题——客服 Agent 能否稳定赚钱
总部位于雅典的 Omilia 完成 6700 万美元 Series B,由 Expedition Growth Capital 领投。公司自 2020 年上次融资以来,把年经常性收入提高到 6000 万美元,即增长约 10 倍;客户包括 Capital One、Discover、RBC、DWP 和 PSEG,语音技术已部署到 Taco Bell 的超过 1000 家门店。这些数字来自公司向 TechCrunch 的披露。3
Omilia 的产品策略也与「所有请求都交给大模型」不同:CEO Dimitris Vassos 认为,查询账户余额这类简单任务不需要调用大型语言模型,公司会组合规则、语音系统和自学习 Agent。新资金将用于美国办公室、市场团队和招聘,目标是继续扩大销售,而不是只做一次模型演示。3
但部署规模不等于可靠性。TechCrunch 同时记录了一起关于 Taco Bell 语音点单系统的争议:媒体曾报道系统允许顾客订购 18,000 杯水,Omilia 否认发生过该事件,文章发布时仍在等待 Taco Bell 说明。3 这正是下一阶段 AI 客服公司要交的作业:把收入增长、客户续费和错误订单率放到同一张账上。
前沿研究与安全
Agent Plans:代码 Agent 的「计划文件」开始成为可研究的工作流证据
arXiv 论文 An Exploratory Study of Agent Plans for Agentic AI Coding Tools in Open-Source Software 筛查了 36,710 个 GitHub 工程软件仓库,只找到 85 份 Markdown 计划文件,分布在 10 个仓库。这些文件主要写明实现步骤、具体文件位置,以及测试和验证方式,覆盖维护、设计、构造、质量工作和流程支持。4
样本很窄,论文没有证明「写计划就能提高代码质量」。它提供的价值在于把 Agent 执行前的意图变成了可观察工件:团队可以检查计划是否锁定了文件范围,是否写明验证条件,执行后再对照计划与提交结果。对于要把编码 Agent 接入生产仓库的团队,这比只看一次任务成功率更容易形成审计记录。
AI 科学家:真实世界任务暴露的不是想法数量,而是筛选能力
另一篇 arXiv 预印本把评测放进变化很快、答案不固定的真实领域:让模型为 2026 赛季 F1 赛车设计提出概念,再与真实赛场创新比较;同时让模型基于最新卡池构筑《万智牌》牌组,再与 19 个职业巡回赛牌组比较。5
在作者的实验中,F1 部分最佳模型 GPT-5.2 在 166 项提案中匹配到 40 项真实创新里的 10 项;《万智牌》部分,Gemini 3 Flash 生成的最佳牌组找回了第三名职业牌组中新系列卡牌的 7 张中的 5 张,模型常选牌与职业选手广泛采用的牌之间的 Spearman 相关系数为 0.74。5
这不是「模型已经会做科学」的证明。论文更谨慎的结论是:模型可以生成看似合理的方案,但在筛选、排序和组织出新颖且连贯的方向上仍有缺口。评测 AI 科研 Agent 时,应该把「提出多少想法」与「能否淘汰错误方向」分开计分。
接下来观察
References
- 1
- 2DeepSeek宣布:将大幅涨价
nbd.com.cn
- 3
- 4
- 5
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
