AI工具创业速报:模型涨价、端侧运行与代码验证开始写进产品

AI工具创业速报:模型涨价、端侧运行与代码验证开始写进产品

本周从 DeepSeek V4 Pro、GitHub Copilot、Google LiteRT 与 Credentio,以及 CodeRabbit、Blacksmith、Lovable 的动作,看 AI 工具如何把成本、验证和业务闭环写进产品。

先看结论

这一周,AI 工具把三个原本藏在产品内部的约束摆到了台面上:模型到底贵在哪里,Agent 生成的代码谁来验,以及哪些任务值得留在设备本地。DeepSeek V4 Pro 把旗舰模型的价格拉开,GitHub Copilot 开始拆解到模型和 token,Google 则用 LiteRT、Gemma 和 Credentio 把端侧推理与内容凭证做成可接入的开发组件。与此同时,CodeRabbit、Blacksmith 和 Lovable 的融资,都把钱投向代码验证、软件运行和业务闭环。
我的判断是:创业团队接下来要比较的,不只是模型效果和单次调用价,而是每个成功任务的总成本、验证路径和迁移难度。这比追逐下一张模型排行榜更接近真实的采购和产品决策。
覆盖窗口为 2026 年 8 月 7 日至 8 月 14 日 17:15(北京时间)。下表只放进能确认发布时间、具体变化和可用边界的事件;公司自报的客户、收入和性能数字会单独标明披露主体。

快速总览

事件已确认变化可用范围与限制创业者先做什么
DeepSeek V4 Pro8 月 13 日正式发布;输入 $1.32、输出 $3.96 / 百万 token,分别约为 V4 Flash 的 9 倍和 14 倍。1可通过 API、App 和网页产品使用;峰时与非峰时定价将引入,峰谷规则和最终成本需要继续看官方价格页。1把复杂推理与普通任务分路由,按一次成功任务核算,而不是只看 token 单价。
GitHub Copilot 账单拆分AI 使用报告新增按模型查看输入、输出、缓存读取和缓存写入 token,并与消耗的 AI credits 对照。2Copilot Business、Enterprise 管理员和个人版用户可下载;入口在账单设置的 AI usage 页面。2给每种 Agent 任务设 token、缓存和重试预算,把账单交给产品负责人也能看懂。
Gemini 3.7 Flash in Copilot8 月 13 日开始逐步进入 Copilot;覆盖 VS Code、Visual Studio、CLI、cloud agent、Copilot app、JetBrains、Xcode 和 Eclipse。3Pro、Pro+、Max、Business、Enterprise 可用;按提供商目录价用量计费,Business 和 Enterprise 需管理员开启 Preview 策略,且仍在渐进式 rollout。3用真实代码任务比较通过率、延迟和每次成功任务费用,再决定默认模型或低成本路由。
LiteRT + Gemma on Raspberry PiGoogle 发布 Raspberry Pi 5 的本地推理方案:LiteRT-LM 调度 Gemma 4 E2B,示例把视觉、语音和推理拆到 GPU/CPU 并行运行。4Google 示例报告 Gemma 4 E2B 在 Pi 5 上预填充 99 token/s、解码 9 token/s、峰值内存 1432 MB;这是官方示例数据,不是所有设备和任务的保证。4先把产品任务按离线、低延迟和重模型三类拆分,再测设备型号、热约束和云端回退。
CredentioGoogle 开源 C++ C2PA Content Credentials 验证库,支持 2.2 和 2.4 规范、清单解析、签名与断言检查以及可配置信任列表。5API 可以完全在本地运行;当前重点是验证,生成和把凭证嵌入媒体的能力仍在后续计划中。5如果产品处理用户上传的图片、视频或文档,先把来源验证放进发布流水线。
CodeRabbit 融资Reuters 报道其完成 1.43 亿美元融资,估值 15 亿美元;Atomico 与 Smash Capital 联合领投。6产品做 AI 代码审查、变更影响解释和生产代码漏洞/可维护性监控;公司称每周审查超过 200 万次,并计划未来 12 个月投入超过 1000 万美元支持开源项目。上述运营数字均为公司披露。6把代码审查从发布后的补救动作前移到 Agent 生成补丁之后,记录它拦住了什么风险。
Blacksmith 融资TechCrunch 报道其完成 4500 万美元 Series B,Peak XV Partners 领投,估值 5.5 亿美元。7Blacksmith 从 CI 云服务扩展到 Codesmith AI coding agent,可自动修复失败检查;公司称客户超过 5000 家,收入等经营数据来自 CEO 采访披露。7先测验证速度、失败修复率和 CI 成本,再判断是否值得把测试平台和代码 Agent 放在同一供应商。
Lovable 融资8 月 12 日宣布完成 4 亿美元 Series C,估值 133 亿美元,Menlo Ventures 与 EQT 管理的 Scaleup Europe Fund 领投。8Lovable 把支付、SEO、企业集成、安全扫描、治理与可见性纳入「构建并运行业务」路线;其项目数、访问量和用户调查数字为公司自报。8评估 AI 应用时,把上线后的权限、扫描、支付和数据迁移一起列入产品范围。

模型变贵,账单变得更具体

DeepSeek V4 Pro:旗舰能力开始单独收费

DeepSeek 在 8 月 13 日正式发布 V4 Pro,并把它定位成高于 V4 Flash 的旗舰选项。Reuters 援引 Artificial Analysis 的价格数据称,V4-Pro-0813 的输入价格为每百万 token 1.32 美元,输出价格为 3.96 美元;V4 Flash 对应为 0.14 美元和 0.28 美元。换算下来,输入约贵 9 倍,输出约贵 14 倍。1
Reuters 报道称,DeepSeek 表示 V4 Pro 改进了 AI Agent 能力,并同时开放给 API、App 和网页产品。报道还提到,DeepSeek 将为 V4 Pro 和 V4 Flash 引入峰时与非峰时价格。这个变化值得创业团队单独做一张成本表:高峰期延迟、价格和可用额度可能一起影响任务调度。1
报道还引用 Artificial Analysis 的 Intelligence Index:V4 Pro reasoning 得分为 53,V4 Flash 为 40。该指数综合 Agent 任务、工具使用、编程、科学推理和长上下文等九项能力。这个分数能说明产品定位变了,不能直接换算成你的业务成功率。1
创业判断:这不是简单的「贵模型值不值得买」。更实用的问题是:哪些任务真的需要它的推理能力,哪些任务可以交给 Flash 或其他模型。把模型选择绑定到任务类型、失败代价和重试次数,才有机会把价格差变成毛利差。

GitHub Copilot:先看清楚钱花在了哪一层

GitHub 8 月 11 日更新 AI usage report,为每个模型显示输入、输出、缓存读取和缓存写入 token,并把它们放在消耗的 AI credits 旁边。此前,报告只显示 credits,团队很难解释一次账单为什么变高。新拆分让管理员可以追到具体模型和 token 类型。2
这个功能对创业团队的价值不在于多了一张报表,而在于它改变了评估单位。产品负责人可以把一轮 Agent 工作拆成输入上下文、输出补丁、缓存命中和重试,再和代码审查通过率放在同一个表里。最终应该管理的是「一次成功交付多少钱」,而不是一个看起来很低的 token 单价。
同一周,Gemini 3.7 Flash 开始逐步进入 GitHub Copilot,覆盖八种开发入口。GitHub 说,早期测试显示它在 Web 和 App 开发、Agentic coding、代码质量、代码库研究和复杂任务验证上比前一版本有所改进;这仍然是发布方的早期测试结论,不等于独立基准。3
它按提供商目录价实行用量计费,企业管理员还要先开启 Preview 策略。对使用 Copilot 的团队,模型更新因此多了两个工程问题:默认模型什么时候切换,以及切换后回归样例由谁负责。3

端侧运行与内容可信,开始有现成组件

LiteRT + Gemma:先把任务拆给 CPU 和 GPU

Google 8 月 11 日发布 Raspberry Pi 5 的 Edge AI 教程,用 LiteRT-LM 在设备上运行 Gemma 4 E2B,并展示 Reachy Mini 机器人如何把视觉、语音识别、推理和语音合成串成一个离线流程。示例把 Ultralytics YOLO 目标检测放到 VideoCore VII GPU,把 Moonshine 语音识别、Gemma 推理和 TTS 放到 Cortex-A76 CPU。4
Raspberry Pi 5 上由 GPU 和 CPU 并行承担视觉、语音与推理任务的官方示例架构
Google 官方示例把目标检测放到 VideoCore VII GPU,把 ASR、Gemma 4 E2B 推理和 TTS 放到 Cortex-A76 CPU;它展示的是 Reachy Mini 的演示管线,不是通用硬件性能承诺。4
Google 报告,Gemma 4 E2B 在 Raspberry Pi 5 上通过 LiteRT-LM 达到 99 token/s 的预填充速度和 9 token/s 的解码速度,峰值内存为 1432 MB。文章还给出了 LiteRT CLI 的安装与运行方式,并把模型、转换、量化、基准测试和推理放进同一套工具链。4
创业判断:端侧 AI 的第一步不是把云模型搬到设备上,而是把任务拆开。摄像头和语音可以本地处理,复杂推理可以云端接手,结果还要经过超时、温度、内存和网络中断测试。能否在回退时保持同一个产品结果,比演示中的峰值 token/s 更重要。

Credentio:把来源验证放进媒体流水线

Google 在 8 月 13 日开源 Credentio,这是一个用于 C2PA Content Credentials 的 C++ 库,起步支持 C2PA 2.2 和 2.4。它能解析媒体中的 manifests、assertions、数字签名和 claims,也能接入官方 C2PA Trust List 与 C2PA TSA Trust List,返回具体的验证状态和完整性错误。5
它的设计重点是本地运行。媒体不需要上传到 Google 或其他验证端点,开发者可以把库嵌进桌面应用、移动软件、后端媒体流水线或资源受限的边缘软件。Google 表示,这套代码此前已经支撑近 40 个符合规范的 Google 产品处理数百亿个生成资产;这是 Google 对自身产品的披露,不能直接当作第三方部署结果。5
当前版本聚焦验证,Google 计划后续扩展到生成 Content Credentials 以及把凭证写入媒体。对做 AI 图片、视频、音频或文档产品的团队,今天能用它解决的是「这个文件的来源和签名是否可验证」,不是完整的内容生产和版权管理。5

资本追着代码验证与业务闭环走

CodeRabbit 与 Blacksmith:生成越快,验证层越值钱

Reuters 8 月 12 日报道,AI 代码审查公司 CodeRabbit 完成 1.43 亿美元融资,估值达到 15 亿美元。本轮由 Atomico 和 Smash Capital 联合领投,BMW i Ventures、Datadog 和 Hirtle Callaghan 等新投资者参与。6
CodeRabbit 的产品覆盖代码质量、变更影响解释,以及生产代码的漏洞和可维护性风险监控。公司称每周完成超过 200 万次代码审查,客户超过 1.7 万家;它还计划在未来 12 个月投入超过 1000 万美元,为开源项目和维护者提供免费的 AI 代码审查与 Agent 能力。客户和审查量属于公司披露,Reuters 没有把它们当作独立审计结果。9
同日,TechCrunch 报道 AI 代码测试公司 Blacksmith 完成 4500 万美元 Series B,估值 5.5 亿美元,Peak XV Partners 领投,GV 与 Y Combinator 继续参与。Blacksmith 从 CI 云服务起步,后来增加 Codesmith AI coding agent,用来自动修复失败的代码检查。7
两家公司面对的是同一个已被事实推出来的工程问题:代码生成速度上升后,测试、审查和合并前验证会成为交付瓶颈。前一句是这两家公司的产品方向,后一句是基于这些事实的编辑判断。创业团队可以先测三项:Agent 补丁进入 CI 的失败率,自动修复后的二次失败率,以及验证结果对人工审查时间的影响。

Lovable:融资叙事从「生成应用」转向「运行业务」

Lovable 8 月 12 日宣布完成 4 亿美元 Series C,估值 133 亿美元;Menlo Ventures 与 EQT 管理的 Scaleup Europe Fund 领投,Balderton Capital、Carmignac、Kaszek Ventures、腾讯和 Salesforce Ventures 等参与。8
Lovable 在公告中列出的产品方向已经越过原型生成:支付、SEO 与 AI 搜索工具、Google Workspace 和 Microsoft 365 等集成、自动与定时安全扫描、AIUC-1 认证,以及发布控制、废弃应用清理和工作区洞察。公司把下一阶段表述为「构建并运行业务」,并计划继续加强安全、可靠性、权限和治理。8
公告还称,自 2024 年 11 月发布以来,用户创建了超过 6000 万个项目,Lovable 构建的应用每月访问量超过 9 亿;这些是公司自报的运营数据。融资真正值得创业者观察的地方,不是估值本身,而是资金是否推动生成工具补上支付、权限、安全、可发现性和迁移这些上线后的工作。

把七条消息放在一起

把事件按产品约束排列,线索会比按公司排列更清楚:
  • 成本变成可追踪对象。 DeepSeek 把旗舰推理和 Flash 的价格差摆出来,GitHub 则让 Copilot 用户看到 token 到 credits 的对应关系。模型选择开始进入财务和产品共同维护的账本。12
  • 验证变成产品能力。 LiteRT 的设备内管线、Credentio 的内容凭证验证、CodeRabbit 的代码审查和 Blacksmith 的 CI 修复,分别处理模型输出进入现实环境后的不同风险。4567
  • 工具的边界开始决定商业化。 Lovable 把支付、权限和安全扫描纳入业务平台,GitHub 对企业模型开启策略和渐进式 rollout,DeepSeek 计划使用峰时与非峰时价格。产品能否交付,越来越取决于控制面,而不是单个模型的演示效果。38

给创业团队的本周动作

  1. 做一次成功任务成本审计。 把模型输入、输出、缓存、工具调用、失败重试、人工审批和基础设施费用放在同一行,先找出最贵的三类任务。
  2. 给模型切换设回归门槛。 选 20 个真实代码或业务任务,记录质量、延迟、失败率和总成本,再决定谁做默认路由,谁只处理高价值任务。
  3. 把本地与云端拆成两个可回退的路径。 对涉及隐私、离线和低延迟的任务做 Raspberry Pi 或其他目标设备测试,同时记录内存、温度、网络中断和降级结果。
  4. 把来源和质量验证放在生成之后。 媒体产品可以先接入 C2PA 验证;代码产品可以先在 Agent 提交补丁后触发审查和 CI,而不是等上线后再排查。
  5. 采购时把控制面写进合同和预算。 核对管理员策略、渐进式 rollout、峰谷定价、数据保留、导出能力和供应商退出路径,这些条件会直接改变迁移成本。
这周最值得验证的不是哪个模型名字会留在默认列表里,而是:当模型换了、价格涨了、任务搬到设备上,或者生成结果必须经过验证时,你的产品能不能仍然交付同一个结果。
AI工具创业速报

AI工具创业速报

每周精选全球AI新工具发布与开发者工具重要更新,以创业视角筛选值得关注的产品与技术动态,帮助创业者高效掌握一周工具风向。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.