腾讯AI投入先压现金流、Lovable再融4亿美元:Agent开始验收执行过程

腾讯AI投入先压现金流、Lovable再融4亿美元:Agent开始验收执行过程

腾讯二季报、Lovable 4亿美元融资与两项 Agent 评测共同显示,行业正从模型发布转向投入回报、企业实施和过程可追溯。

今日判断

腾讯二季度把 AI 的投入、产品和现金流同时摆上了台面:总资本开支同比增 176% 至 52.8 亿元,自由现金流转为 -13.8 亿元;WorkBuddy、CodeBuddy 和 Hy3 则开始承担产品增长与云需求。另一边,Lovable 拿到 4 亿美元 Series C,估值升至 133 亿美元,AI 编程平台的竞争焦点从「能不能生成应用」转向「能不能让企业持续运行」。最新两项 Agent 研究也在做同一件事:把模型分数拆回执行框架、工具调用和长流程轨迹。
本期覆盖 8 月 6 日—8 月 13 日 08:00(北京时间)。公司披露的产品使用量、准确率和客户效果保留发布方口径;论文结果只代表作者实验,不等同于生产环境表现。

快速扫一眼

板块新动作该跟进什么
大公司与产品腾讯二季度收入 2048 亿元,同比增长 11%;AI 基础设施投入推高资本开支,WorkBuddy 与 CodeBuddy 被公司列为生产力 AI 核心产品。1看 AI 需求能否转成云收入和付费用户,而不只是算力预付款。
创业与投资Lovable 完成 4 亿美元 Series C,投后估值 133 亿美元;Thrive Holdings 融资 20 亿美元,估值 120 亿美元,继续收购传统企业并改造其工作流。23资本正在同时押注「软件生成平台」和「实施组织」;两者都要用真实经营结果兑现估值。
前沿研究与评测HarnessOpt-Bench 用 5 个前沿模型、4 个下游任务和 111 次评分运行测试 Agent 能否改进自己的提示、工具、记忆和编排;另一项工作整理了超过 1300 条长流程轨迹,测试行为结果究竟由哪一步造成。45企业验收要保存完整轨迹,分开看模型、Harness、工具和记忆,而不是只留最终答案。

大公司与模型产品

腾讯:AI 账单先于利润兑现

腾讯 2026 年第二季度收入 2047.9 亿元,同比增长 11%;总资本开支 52.8 亿元,同比增长 176%,自由现金流为 -13.8 亿元。公司解释,经营现金流受到 AI 相关基础设施预付款影响,用于支持 Hy 模型、WorkBuddy、CodeBuddy、微信 AI 能力和云客户需求。1
产品侧,腾讯称 Hy3 正式版在多个智能体场景中提供更强的任务完成和更低的幻觉率;其日 token 使用量约为 Hy3 preview 期间的 7 倍。WorkBuddy 与 CodeBuddy 在腾讯引用的 Analysys 2026 年 6 月数据中,位列中国 PC 端 AI 原生办公智能体前列,WorkBuddy 还能调用腾讯文档、腾讯会议和 SkillHub 技能,并在任务流程中接入支付能力。上述使用量、排名和产品效果都属于公司引用或自报口径。1
要判断投入是否开始回本,下一组数字比模型发布更有用:云业务中 GPU 租赁、Model-as-a-Service、WorkBuddy 和 CodeBuddy 的收入增量,付费用户留存,以及算力预付款下降后自由现金流能否恢复。腾讯自己也承认当前仍受算力约束;这意味着短期看,产品需求和基础设施供给仍是同一张表上的两端。

Google:Gemini 连接器开始接管具体动作

Google 8 月 12 日宣布,Gemini 将在未来数周接入 Canva、Wix、Google Home、Google Photos、GitHub、Google Workspace 等服务,并扩展到预订、购物、音乐和医疗预约等场景。官方支持页同时列出细节:部分能力只在 Android 手机或美国开放,有的要求个人账号、年龄限制或英语环境。67
这不是单纯增加插件数量。Gemini 正从回答问题转向调用用户的文件、日程、设备和交易服务。产品负责人需要盯住权限确认、失败后的回滚和地区差异;连接器越多,错误动作的代价也越高。

创业与投资

Lovable:估值上涨,产品边界也在变

Lovable 官方宣布完成 4 亿美元 Series C,投后估值 133 亿美元,由 Menlo Ventures 领投,EQT 管理的 Scaleup Europe Fund 联合领投。公司称平台自 2024 年 11 月上线以来已创建超过 6000 万个项目,这些项目每月获得超过 9 亿次访问;TechCrunch 还报道,公司 6 月的年化收入运行率达到 5 亿美元。前两项规模与产品指标来自公司,收入数字来自公司向 TechCrunch 的披露。28
Lovable 接下来要做的事已经超出原型生成:支付、SEO、Google Workspace、Microsoft 365、Salesforce 和 Stripe 集成,自动安全扫描,以及发布控制和工作区洞察,都在把它推向「构建并运行业务」。估值能否站住,取决于这些应用的留存、收入和安全责任,而不是项目总数本身。

Thrive Holdings:企业 AI 的钱开始投向实施队伍

Thrive Holdings 宣布融资 20 亿美元,估值 120 亿美元,投资方包括 SoftBank、D1 Capital Partners 和 Altimeter Capital。它的做法不是卖一个通用聊天机器人,而是收购会计、信息技术等传统企业,把 AI 嵌入税务、客服和运营流程;TechCrunch 报道其平台已覆盖 70 多家企业。3
Thrive 称旗下 TaxAI 已处理超过 7000 份税表、准确率 98%,并让参与企业的报税时间缩短超过 30%;这些是公司提供的效果数据。它下一步还计划进入数据中心、制造、医疗、能源和交通等实体资产的审批与合规流程。对投资人和创业者,值得比较的不是「模型多强」,而是实施团队能否拿到专业签字、保住合规责任,并把一次性项目变成可重复的服务收入。

前沿研究与评测

HarnessOpt-Bench:Agent 能不能改进自己的工作台

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization 把评测对象从模型权重扩展到 Harness——也就是包住模型的提示词、工具、控制流、记忆和编排代码。实验让优化器拿到一个种子 Harness、评测反馈和固定预算,修改它,再用不可见的测试分区计算相对增益。论文比较了 5 个前沿模型,在共享和原生两种编码 Harness 下完成 4 个下游任务,共 111 次评分运行。结果显示,模型之间的差异大于它们所使用的部分编码 Harness;原生 Harness 也没有稳定胜出,收益会随任务和初始配置明显变化。4
这项工作的价值在于把「Agent 工程」变成可比较的实验对象。企业若只固定模型名,不记录提示、工具、记忆和编排版本,就无法解释一次性能提升到底来自哪里。

长流程归因:最终答错,究竟是哪一步造成的

Long-Horizon Agent Trajectory Attribution 从 AgentDojo 和 Agent3Sigma 的场景中整理出超过 1300 条标注轨迹,覆盖任务正确行动、不安全行动和安全拒答。论文定义了两类任务:找出主要归因组件,以及恢复由多步行动组成的归因链;组件包括用户指令、工具使用、外部观察和记忆。作者还提供增量贡献与逐组件留一法基线,结果显示不同归因设置之间存在明显性能差异。5
对上线团队,这比再加一个单轮问答榜单更实用:保存模型输入、工具返回、权限判断和中间状态,才能在失败后回答「哪一步改变了结果」。这仍是研究型基准,不能直接当作生产系统的故障率,但它给出了应保留哪些证据的清单。

接下来观察

  • 腾讯 AI 投入的现金回报:跟踪 GPU 租赁、Model-as-a-Service、WorkBuddy 和 CodeBuddy 的收入,以及算力约束是否缓解。1
  • Gemini 连接器的权限边界:不同国家、设备、账号和语言条件下,哪些动作真正可用,失败后能否撤销。7
  • Lovable 和 Thrive 的经营证据:前者看项目能否变成持续收入,后者看实施效果能否跨企业复制;两家公司当前的规模与效果数字仍主要来自公司披露。23
  • Agent 评测是否保留过程证据:HarnessOpt-Bench 与轨迹归因研究都把评测从最终答案推进到系统配置和中间步骤。45

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.