官方表格显示 Turbo 在办公、代码、视觉和视频任务上保持接近 Pro 的整体水平,但在 Agent Startup、视觉感知和部分视频运动理解上差距明显,路由应按任务族而非统一降级。
适合的任务:用官方公开分数建立 Turbo/Pro 的任务族先验,再设计同 harness 的本地复测和路由规则。
不适合的任务:将官方分数当作自己仓库的成功率,或忽略工具、提示词、模型快照和评测实现差异。
适用的模型版本:Seed2.1 Pro 与 Seed2.1 Turbo,表格同时列出 Claude Opus 4.7、GPT-5.5、Gemini 3.1 Pro 等对照。
适用的客户端、Agent 或 API:官方 Seed 页面、Doubao/火山方舟生态;页面没有公开每个 benchmark 的 API 请求细节。
推荐的推理档位和参数:未公开;页面给出分数但没有统一公开温度、最大输出、工具版本和采样次数。
测试方:ByteDance Seed 官方团队。
覆盖能力:知识、推理、高经济价值办公、长链端到端代码、终端使用、调试、多模态推理、视觉、空间、长上下文、长视频和运动理解。
对照:官方表格中的 Claude Opus 4.7、GPT-5.5、Gemini 3.1 Pro,以及视频部分的 Gemini 3.5 Flash。
输入/配置:完整 prompt、数据版本、工具、采样次数、置信区间和 harness 未公开。
页面以模型卡交互表格展示结果;带 “w. Tool” 的项目明确标注了工具版本,但未提供工具 schema 和请求样例。ProgramBench 的 Turbo 单元原样显示为 0/0/49.4,页面未在正文解释三个子值的含义。
以下数值为官方表格直接展示的百分比/分数,Pro/Turbo 按页面列顺序抄录:
| 能力 | Benchmark | Seed2.1 Pro | Seed2.1 Turbo |
|---|---|---|---|
| 高经济价值办公 | Workspace Bench | 53.0 | 54.7 |
| 高经济价值办公 | Agent Startup Bench | 68.8 | 54.0 |
| 白领办公 | xDailyBench | 61.0 | 56.4 |
| 长链端到端代码 | NL2Repo-Bench | 47.0 | 43.7 |
| 长链端到端代码 | ProgramBench | 0/1/50.3 | 0/0/49.4 |
| 终端使用 | Terminal Bench 2.1 | 71.0 | 67.6 |
| 调试 | SWE-Atlas | 35.2 | 30.6 |
| 多模态推理 | MathVision(含工具) | 92.6(94.5) | 90.1(92.7) |
| 多模态 STEM | MMMU-Pro(含工具) | 81.6(82.7) | 80.1(82.2) |
| 视觉感知 | BabyVision | 73.7 | 62.9 |
| 空间推理 | ERQA | 72.0 | 71.3 |
| 多模态长上下文 | MMLongBench-128K | 78.3 | 76.9 |
| 长视频理解 | VideoMME | 89.2 | 89.0 |
| 运动与感知 | TOMATO | 79.5 | 56.8 |
| 视频推理 | Minerva | 70.7 | 65.9 |
| 流式视频 | OVOBench | 80.7 | 79.2 |
| 视频知识 | VideoSimpleQA | 76.4 | 71.4 |
页面还显示 Turbo 在 BeyondAIME 为 88.0(Pro 87.0)、CharXiv-RQ(含工具)为 82.5(83.6),以及 ZEROBench(含工具)为 11.0(20.0);括号值是页面同一单元的附加值,官方未在可读正文解释其统计含义。
Turbo 并非简单的 Pro 缩小版:在 BeyondAIME 和 Workspace Bench 等项目上接近或高于 Pro,但在 Agent Startup Bench、BabyVision、TOMATO 和部分代码/调试项目上落后更明显。它更适合作为成本/吞吐优先的默认路由,并为高风险长链任务保留 Pro fallback。
所有分数是官方模型页数据,不是独立重跑;没有输入、提示词、采样次数、工具版本和置信区间。
页面展示的是模型快照和表格结果,当前 API 端点可能变化;日期和快照应在复测时重新记录。
斜杠值和括号值的统计定义未公开,不能自行拆解或计算平均数。
分数差异不能直接换算为真实仓库成功率、成本或延迟。
记录当前 Turbo/Pro API 模型快照、思考模式、工具集合、上下文和价格。
按办公、代码、终端、视觉、视频分桶建立真实任务集,保证两模型使用同一 harness。
记录首轮完成、修正轮次、工具失败恢复、独立测试、token、延迟和单任务成本。
根据任务族结果设置 Turbo 默认路由和 Pro fallback,并定期与官方表格更新做差异核对。
官方页面将 Turbo 和 Pro 并列展示,而不是只给家族总分。
结果表把 w. Tool、长视频和多模态长上下文作为独立条目,说明工具与输入模态必须作为评测维度保存。
Doubao Seed 2.1 Turbo