
腾讯Hy4开源、a16z押注11亿美元:AI竞争从模型走向物理栈与执行层
腾讯开源Hy4、a16z设立11亿美元硬件基金,两篇Agent预印本则把关注点推进到基础设施、经验复用与执行验证。
今日判断
北京时间 2026 年 8 月 28 日 08:00 至 8 月 29 日 08:00,最值得跟进的变化,是 AI 竞争继续从“模型多强”伸向“模型怎样运行”。腾讯把大模型、产品入口和 API 一起铺开;a16z 则用 11 亿美元基金押注芯片、数据中心、机器人和电力等物理基础设施。两篇近期预印本进一步把问题推进到执行层:Agent 如何积累可复用经验,团队怎样用更少的试跑验证 harness(智能体运行脚手架)的修改。
快速扫一眼
| 板块 | 关键变化 | 证据边界 | 今天看什么 |
|---|---|---|---|
| 大公司与产品 | 腾讯发布并开源 Hy4 preview:770B 总参数、49B 激活参数、上下文超过 100 万 token。1 | 腾讯官方公告;模型定位、入口和价格为发布方口径。 | 开源权重、产品入口和 API 是否保持同一版本。 |
| 创业与投资 | a16z 宣布 Machine Age Fund,规模 11 亿美元,覆盖芯片到电力层的 AI 基础设施。2 | a16z 官方披露;基金结构、出资人和首批项目未公布。 | 资金会落到哪些设备、能源和数据中心项目。 |
| 前沿研究 | WikiSkill 把 Agent 经验整理成持久化知识;HarnessLens 按行为相关任务验证 harness 修改。34 | 两篇均为预印本作者实验,样本与模型范围有限。 | 企业验收是否记录经验来源、技能版本和回归证据。 |
大公司与产品
腾讯 Hy4 preview:模型、入口和 API 同时开放
腾讯官方页面公布了 Hy4 preview:总参数 770B,激活参数 49B,上下文长度超过 100 万 token。模型已开源,用户可以通过 WorkBuddy、CodeBuddy、元宝、ima、腾讯云 TokenHub 和 OpenRouter 使用。腾讯把它定位在编程、办公和科研等生产力任务上。1
配套商业化也同步给出:WorkBuddy 和 CodeBuddy 上线后免费两周,Hy3 的免费访问延长至 9 月 30 日;API 价格为输入每百万 token 0.834 美元、输出 2.501 美元、缓存命中 0.042 美元。这些数字来自腾讯公告,页面没有提供独立评测或真实生产成功率。1
对开发团队,真正的变化在于接入路径变多了:同一模型既进入办公与编程产品,也进入 API 分发。接下来应核对三个入口是否使用同一权重和上下文配置,再分别测试长上下文、工具调用和价格到期后的迁移成本。
创业与投资生态
a16z 用 11 亿美元押注 AI 的“物理层”
a16z 于 8 月 28 日公布 Machine Age Fund,规模 11 亿美元。基金覆盖芯片、内存、网络、存储和数据中心,也看机器人、家用 AI 设备,以及冷却、材料、电气和房地产等配套环节。2
这类基金的对象已经从模型公司扩到“让模型跑起来”的供应链。a16z 的判断是,硬件供应侧习惯了每年两三成的增长,而 AI 需求要求更快扩张;电力、散热、机房和设备交付因此成为同一笔基础设施投资里的连续问题。这个判断属于 a16z 的投资逻辑,基金公告没有披露出资人、结构或首批投资项目。2
投资人和创业者接下来应把基金规模与项目落地分开看:首批被投公司的设备交付、客户订单、能耗指标和融资用途,才会说明资金是否真正转化为供给能力。
前沿研究与安全
以下两篇论文属于近期预印本:arXiv 元数据所示提交时间换算为北京时间 2026 年 8 月 28 日凌晨,早于本期主窗口。5
WikiSkill:把 Agent 经验变成可复用技能
WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution 将 Agent 的原始执行经验、持续积累的 wiki 知识和可执行技能分开管理。作者在 5 个基准、5 个模型上比较技能进化方法,报告相对最强基线提升 3.3 至 12.0 个百分点;在一组模型对比中,带技能的 Qwen-3.5-9B 平均得分 47.4%,高于没有技能的 Qwen-3.6-27B 的 39.4%。3
这项工作的实用线索是:团队可以把成功轨迹里的知识沉淀为技能,再用新任务验证技能是否继续有效。当前实验把完整技能直接放进系统提示,尚未评估技能检索、触发和长期剪枝;论文也没有覆盖数百步的连续任务。3
HarnessLens:验证 Agent 修改时,先测相关行为
Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification 研究的是 Agent harness 的自动修改。HarnessLens 会根据候选修改影响的行为,挑选相关任务做验证,再用带归因的证据决定是否接受修改。
作者在 3 个 harness、4 个基准上测试,held-out 平均性能提升 7.6% 至 13.6%;12 个 harness—基准组合中,有 8 个达到最好或并列最好成绩。论文报告的预算低于若干固定任务集方法,但实验只使用一个模型族,预算也按试跑和会话计量,尚未统一到 token、延迟或货币成本。4
两篇论文放在一起,给 Agent 平台的验收清单更具体了:保留经验从哪次执行产生,标记技能和 harness 的版本,记录验证任务与回归结果,并把作者实验中的提升重新放到自家模型、任务和真实成本下复测。
接下来观察
References
- 1
- 2The Machine Age Fund
a16z.com
- 3WikiSkill
arxiv.org
- 4HarnessLens
arxiv.org
- 5arXiv submission metadata
export.arxiv.org
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
