腾讯混元 Hy4 preview 开源:770B 总参数、49B 激活,1M 上下文

腾讯混元 Hy4 preview 开源:770B 总参数、49B 激活,1M 上下文

腾讯混元发布并开源 Hy4 preview,770B 总参数、49B 激活、1M 上下文,现已提供权重、产品体验与 API 入口。

先看结论

腾讯混元在 2026 年 8 月 28 日 发布并开源 Hy4 preview:主干总参数 770B,每个 token 激活 49B,上下文长度 1M,许可证为 Apache 2.0。模型当前主打长程软件工程、Agent 工具调用和办公分析。12
对开发者和产品团队来说,Hy4 preview 现在值得进入代码智能体、跨文件办公和复杂工具调用任务的评测队列。它已经有权重、API 和腾讯系产品入口;评测时要把它当作早期 preview,重点观察实际任务的交付质量与等待时间。

关键规格

项目目前可确认的信息
发布时间与状态2026 年 8 月 28 日发布;当前为 Hy4 的 preview 版本。12
架构与参数混合专家(MoE);主干 78 层,总参数 770B,每个 token 激活 49B;另有 1 层 MTP,参数量 10B、激活 0.7B。1
上下文1M tokens;模型卡给出的词表大小为 120,832。1
推理方式默认 high 深度推理;日常对话可以用 no_think 直接回答。1
权重与许可证已提供 Hy4 preview 和 FP8 量化权重;模型卡列出 Hugging Face、ModelScope、GitCode、CNB 等下载入口,许可证为 Apache 2.0。1
本地部署官方仓库提供 vLLM 和 SGLang 部署示例,并给出工具调用、推理解析和 MTP 推测解码配置。3
这里的 770B 是主干网络参数量。模型卡明确说明,规格表不包含 MTP 层;阅读不同平台的模型大小字段时,需要先确认统计口径。1

它把能力押在哪些任务上

腾讯混元把 Hy4 preview 定位为“为生产力而生”。模型卡列出的重点场景有四类:软件工程侧重长程开发任务的理解、规划、调试和验证;办公分析侧重跨文件处理,以及文档、表格和演示文稿交付;游戏开发支持从一句需求生成可玩原型并多轮迭代;科学研究覆盖 AI 研发、分子动力学、凝聚态物理和基础数学。12
模型卡的 benchmark 附录中,Hy4 preview 的代表性分数包括 Terminal-Bench 2.1 85.4、DeepSWE 64.3、Toolathlon-Verified 74.1 和 GPQA Diamond 92.3。腾讯科技对同一批发布材料的报道也列出了 Terminal-Bench 2.1 的 85.4、DeepSWE 的 64.3,以及 Toolathlon-Verified 的 74.1。45
Hy4 preview 官方 benchmark 附录,列出代码、搜索、Agent、科学和推理等任务的对比结果
表格来自腾讯混元模型卡;带星号的结果按图下注释属于腾讯团队自测,适合用来了解厂商公布的能力侧重点,不等同于独立机构在完全相同脚手架下的总榜。5
更贴近真实产品使用的,是腾讯内部盲测:163 位内部专家在 203 个工程任务上进行评价,Hy4 preview 平均分 2.99 / 4,高于 GLM 5.3 的 2.92 / 4 和 Kimi K3 的 2.94 / 4。模型卡还给出了相对两者的胜、平、负比例。这个结果只说明 Hy4 preview 在这组内部工程任务和测试设置中略占优势,不能直接推导出它在所有任务上全面领先。12

现在可以怎么用

路径入口与成本适合的动作
腾讯产品体验WorkBuddy、CodeBuddy 国内版及国际版、腾讯元宝、ima 已同步首发。2先用真实办公或编码任务做短测,观察结果交付和工具调用过程。
腾讯云 TokenHub科技日报报道的价格为:输入 ¥6 / 百万 tokens,输出 ¥18 / 百万 tokens,缓存命中 ¥0.3 / 百万 tokens;官方模型详情入口为 TokenHub Hy4 preview2已有腾讯云账号和调用链的团队,可以按这组价格重算 Agent 长上下文成本。
OpenRouter模型 slug 为 tencent/hy4-preview,页面列出的输入 / 输出价格为 $0.834 / $2.501 / 百万 tokens,Cache Read 为 $0.042 / 百万 tokens,上下文为 1,048,576 tokens,最大输出 64,000 tokens。6适合已有 OpenRouter 接入、希望快速和其他模型使用同一套客户端或脚手架的团队。
自部署Hugging Face、ModelScope、GitCode、CNB 提供权重;官方仓库给出 vLLM 和 SGLang 路径,FP8 版本可用于部署尝试。13适合需要控制数据、推理链路或模型服务参数的团队;先核对显存、并行和吞吐,再决定是否扩大测试。

评测前先留一条余地

Hy4 preview 仍是早期版本。腾讯混元在模型卡中明确提到,复杂任务可能花费过长时间进行推理,也可能反复验证自己的结果。腾讯团队会继续迭代,因此当前体验更适合作为“可用能力预览”,而不是稳定正式版的承诺。1
第一次评测可以只做三件事:拿一组已有基线任务,固定相同的工具和提示词;分别记录成功率、最终交付物质量、端到端耗时和 token 消耗;再把复杂任务拆成直接回答和深度推理两种模式比较。这样得到的结果,比单看 770B 或一张 benchmark 表更接近是否值得接入自己的产品。
截至本次发布,Hy4 preview 已经满足“有权重、有体验入口、有 API、有价格”的试用条件。下一步真正需要验证的是:它在你的工具链里能否把长任务做完,以及 1M 上下文带来的成本和等待时间是否可接受。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content