
Seed2.0 Model Card:字节把评测搬进真实任务
Seed2.0 Model Card 把字节 Seed 的模型评测从单题能力推向真实工作流。文章拆解它的四维评测框架、价格和关键 benchmark 信号,以及在长程代码、上下文学习和科学事实核验上的边界。
如果只扫榜单,Seed2.0 很容易被读成「字节又发了一个高分模型」。这份模型卡更值得看的地方在另一层:字节 Seed 开始把模型评测从单题能力,推向科学研究、整仓代码、长文档学习和真实业务流程。arXiv 页面显示,这篇《Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity》由 Bytedance Seed 署名,v1 提交时间对应北京时间 2026 年 7 月 1 日清晨。1
模型卡一开头就把问题说得很直白:Agent 系统能解竞赛题,却常常不能稳定做完真实任务;原因一是任务链条长,二是现实知识太长尾。Seed2.0 要补的不是单一 benchmark,而是这个「会答题」到「会办事」之间的断层。2
先看结论:这是一份生产系统说明书
Seed2.0 被拆成 Pro、Lite、Mini 三个尺寸。Pro 面向复杂推理和长上下文,Lite 走通用质量和成本平衡,Mini 面向高吞吐、低延迟场景。模型卡把用户体验拆成四个工程变量:视觉和多模态查询、推理延迟、复杂指令执行、代码辅助。2
这和很多模型报告的口径不同。Seed2.0 不是先列一堆公开榜单,再补几张案例图;它先从大陆 MaaS 使用数据和开发者使用轨迹出发,说明企业正在拿模型处理非结构化信息、教育、内容创作、搜索推荐和客服销售等任务。换句话说,模型卡把「线上用户到底怎么用」放到了评测设计之前。2
价格也是这条路线的一部分。表 1 写得很具体:Seed2.0 Pro 每百万输入 token 为 0.47 美元、输出为 2.37 美元;Lite 是 0.09 / 0.53 美元;Mini 是 0.03 / 0.31 美元。作为参照,表中 GPT-5.2 High 为 1.75 / 14.00 美元,Claude Opus 4.5 thinking 为 5.00 / 25.00 美元。2
这不是单纯的便宜。对高频企业流程来说,价格会决定模型能不能被塞进每一次检索、每一份文档分析、每一轮客服问答里。Seed2.0 的产品逻辑是:如果模型要参与工作流,就不能只在最高档模型上成立。
评测怎么变:从 benchmark 到工作流
模型卡把高级评测分成四个维度,每个维度都对应一个真实失败模式。
| 维度 | 它想测什么 | 代表性任务 |
|---|---|---|
| Scientific Discovery | 模型能否做研究式推理和科学计算 | AInstein Bench、BABE,覆盖科学代码和生物多模态证据推理。模型卡 PDF |
| Vibe Coding | 模型能否从自然语言需求一次性搭出完整仓库 | NL2Repo-Bench,重点看跨文件一致性、依赖管理和长程构建。模型卡 PDF |
| Context Learning | 模型能否严格按用户给的长文档和噪声材料执行 | DeR2、CL-Bench、企业知识库问答和复杂流程。模型卡 PDF |
| Real-World Tasks | 模型能否完成有经济价值的端到端任务 | GDPVal-Verified、XPertBench、WorldTravel、K12 和企业信息抽取。模型卡 PDF |
「Vibe Coding」这个词容易被误读成随手写代码。论文里的意思更窄:用户给一份不完整需求,模型要自己规划、写文件、跑测试、修 bug,最后交出能跑的仓库。它考的不是某个函数写得对不对,而是模型能不能把软件工程当成一条长链条处理。
Context Learning 也类似。它不是问模型记住了多少知识,而是把长手册、内部文档、噪声检索结果塞给模型,看它能不能提取有用信息并按约束完成任务。对企业用户来说,这比「模型训练时见没见过某个冷门知识」更接近真实问题。
数字:强项在搜索、多模态和成本,短板也写出来了
基础语言能力上,Seed2.0 Pro 进入第一梯队,但不是每项都领先。表 3 中,Seed2.0 Pro 在 AIME 2025 为 98.3、AIME 2026 为 94.2,Codeforces 为 3020,IMOAnswerBench 为 89.3;但 SimpleQA Verified 只有 36.0,明显低于表中 Gemini-3-Pro High 的 72.1。FactScore 也只有 71.2,低于其它大模型的 90 分以上区间。2
这说明它的定位不是「所有维度压过对手」。Seed 自己在引言里也承认,Seed2.0 系列在编码上和 Claude 仍有差距,在与用户体验密切相关的长尾知识上和 Gemini 仍有差距,举的例子就是 SWE-Evo、NL2Repo、SuperGPQA 和 SimpleQA-Verified。2
多模态部分更强势。模型卡报告 Seed2.0 Pro 在 MathVision 为 88.8、MathKangaroo 为 90.5、MathCanvas 为 61.9;在长文档和图表理解上,DUDE 为 72.4、MMLongBench 为 74.8、ChartQAPro 为 71.2。2 这些数字和前面「真实用户大量上传截图、图表、扫描文档」的判断能对上。
Agent 能力里,搜索和视觉 Agent 是亮点。表 11 中,Seed2.0 Pro 在 BrowseComp-zh 为 82.4,HLE-Verified 为 73.6,DeepSearchQA 为 77.4;视觉 Agent 任务里,Minedojo-Verified 为 49.0,MM-BrowseComp 为 48.8,HLE-VL 为 39.2。2
但代码 Agent 的短板同样明显。SWE-Evo 上,Seed2.0 Pro 为 8.5,低于 Claude Opus 4.5 的 27.1;高级任务表里,NL2Repo-Bench 上 Seed2.0 Pro 为 27.9,低于 GPT-5.2 High 的 49.3。模型卡在结果段落里明确说,context-driven learning 和 repository-level code 仍有 headroom。2
真正的看点:长尾知识变成产品问题
Seed2.0 的长尾知识评测值得单独看。模型卡提出 LPFQA 和 Encyclo-K:前者来自专业论坛和专家社区里的真实长尾问题,覆盖编程、金融、工程、医学和应用科学;后者从书籍中抽取原子知识,再组合成测试实例。2
这背后有一个产品判断:用户不会只问通用百科题。企业流程里的问题经常非常碎,比如某个合同字段怎么抽、某个制造流程里的异常怎么解释、某个专业文档里的规则怎么落到操作。模型在常识题上强,不代表它能在这种长尾工作里可靠。
复杂指令也是同一类问题。模型卡披露了一个中文内部评测:912 个测试样例、17 个加权维度,覆盖格式、条件、内容、措辞、语气、emoji、few-shot、中文和英文长度约束。Seed2.0 Pro 总分 75.26%,比 Seed1.8 的 72.89% 高 2.37 个百分点;其中语气控制提升 15.16 个百分点,措辞遵循提升 10.31 个百分点,few-shot 提升 9.53 个百分点。2
这些听起来不像「前沿智能」的大词,但很接近真实产品里的麻烦。用户要的经常不是一段聪明回答,而是「按我给的条件,一条都别漏」。漏一个长度限制、错一个格式、把中文语气写偏,模型在生产里就要返工。
边界:科学案例里仍要人工验算
模型卡后半段放了大量 use case,其中科学分析案例很能说明边界。Cannabidiol 分析中,Seed2.0 能提出合理的分子动力学工作流、验证指标和 GROMACS 操作,但模型卡也写明,它会幻觉具体 PDB 条目和文献细节,实际使用前必须人工核验。2
Maleimide Polyacetylene 案例里,模型能解释 ROMP、氧化、结构-性质关系和 n 型半导体逻辑,但没有识别 TEA 与氧化剂可能先形成电荷转移复合物这一更具体的机理。模型卡的评价很克制:宏观叙述成立,关键动力学细节不够深。2
这类边界比一串总分更有用。Seed2.0 已经能把复杂科学任务写成有步骤的初稿,但在会造成实验误导的位置,仍会把「像真的」细节写出来。对科研、工程和企业流程来说,这意味着它适合作为初稿生成器、方案拆解器、检索和推理助手,不适合作为无人复核的最终执行者。
读者该怎么判断 Seed2.0
如果你关心的是中文企业场景、图文档理解、搜索研究、低成本高频调用,Seed2.0 Model Card 给出的信号是正面的。Pro 的多模态和搜索 Agent 能力已经进入第一梯队,Lite 的价格和结果也适合大规模部署。
如果你关心的是整仓代码、长程上下文学习、科学事实准确性,就要看得更谨慎。模型卡没有把这些问题藏起来:NL2Repo、SWE-Evo、DeR2、SimpleQA Verified、科学案例里的幻觉,都在提示同一个事实。Seed2.0 正在向真实任务靠近,但真实任务不是一个榜单分数能盖住的东西。下一步最该盯的,不是它还能多刷几个 benchmark,而是这些长链条任务在真实用户环境里能不能稳定少返工。
Contenido relacionado
- Inicia sesión para comentar.
