官方模型卡显示 Seed1.8 的强项集中在搜索、GUI、视频工具和可调测试时计算,适合长流程 Agent,但其分数是厂商自报且包含内部任务与技术报告对照。
适合的任务:多步搜索与证据合成、浏览器/桌面 GUI、视频时间窗分析、工具调用和需要按预算调节推理的 Agent。
不适合的任务:把内部 benchmark 直接外推到业务成功率,或只用高档思考追求低延迟和低成本。
适用的模型版本:Seed1.8;报告采用 no_think、think-low、think-medium、think-high 四档。
适用的客户端、Agent 或 API:ByteDance Seed/火山引擎模型服务,以及自行实现的搜索、代码、GUI、VideoCut 工具编排。
推荐的推理档位和参数:简单抽取先试 no_think/low;复杂检索、编码和视频推理用 medium/high,并记录每档的 token、步骤和成功率。
评测类别:基础语言、多模态视觉/视频、Agent 搜索/编码/写作/工具/GUI、效率和真实世界启发的内部工作流。
对照模型:GPT-5-high、Claude-Sonnet-4.5、Gemini-2.5-pro、Gemini-3-pro 等;非 Seed 分数多来自各自技术报告。
配置:第 2.1–2.3 节报告主要使用 think-high;表 1 基础能力默认不使用工具;表 7 比较 Seed1.8 与 increased thinking。
公共任务包括 AIME-25、LiveCodeBench v6、GPQA-Diamond、BrowseComp-en/zh、GAIA、SWE-bench Verified、Terminal Bench 2.0、BFCL-v4、OSWorld、Online-Mind2web、AndroidWorld 和长视频集合。
报告支持 VideoCut 工具:模型指定起止时间和 1–5 FPS,工具重采样视频帧后再供模型分析。
报告没有公开全部题目、system prompt、采样参数和每题产物;可复现的是任务名、思考档位、工具机制和汇总分数。
| 基准/任务 | Seed1.8 分数 | 说明 |
|---|---|---|
| AIME-25 | 94.3 | 表 1,think-high、无工具 |
| LiveCodeBench v6 | 79.5 | 表 1,Pass@1 |
| GPQA-Diamond | 83.8 | 表 1,Pass@1 |
| MMLU | 92.3 | 表 1,Pass@1 |
| Customer Support Q&A(内部) | 69.0 | 经济价值任务 |
| Complex Workflow(内部) | 54.6 | 按 SOP 多步执行 |
| GAIA | 93.2 | Agentic search,报告称高于 GPT-5-high 的 76.7 |
| BrowseComp-en / zh | 67.6 / 78.5 | 搜索 |
| WideSearch | 63.8 | 搜索 |
| SWE-bench Verified | 未在正文 Agent 段给出单独分数 | 仅列为评测项,避免用搜索摘要补写 |
| FinSearchComp | 56.2 | 财务检索与合成 |
| XpertBench Finance / Law | 62.0 / 55.2 | 内部专家任务 |
| 基准 | Seed1.8 | Seed1.8 + 工具 |
|---|---|---|
| OSWorld | 61.9 | — |
| Realbench | 49.1 | — |
| Online-Mind2web | 85.9 | — |
| AndroidWorld | 70.7 | — |
| CGBench | 62.4 | 65.9 |
| LVBench | 73.0 | 78.9 |
| ZeroVideo | 6.9 | 18.8 |
| 基准 | Seed1.8 | Increased Thinking |
|---|---|---|
| AIME-25 Avg@10 | 94.3 | 97.3 |
| HMMT25(Feb) Avg@10 | 89.7 | 96.7 |
| LeetCodeBench(v6) Avg@8 | 79.4 | 84.7 |
| HLE full / text / vision | 21.4 / 22.1 / 17.3 | 25.6 / 26.4 / 20.2 |
Seed1.8 的可复用优势是把搜索、视觉、GUI、视频工具和多档思考放入同一 Agent 接口;VideoCut 在长视频任务上带来明显增益。纯编码或纯知识任务仍应按相同 harness 与目标模型重测,不能只依据 Agent 搜索分数选型。
这是官方模型卡,存在厂商自报、内部 benchmark 和引用其他技术报告结果的混合证据。
复杂工作流的任务定义、评分器、工具环境和成功判据没有全部公开;表格分数不能直接当作业务 SLA。
think-high/increased thinking 会提升计算量;模型卡强调质量-延迟-成本权衡,但没有给出每档统一 token/美元表。
报告中的模型名称是 Seed1.8,不应与 Seed1.8 的不同火山/BytePlus 快照或第三方代理结果混在一起。
固定 Seed1.8 实际 endpoint、区域、思考档位和工具版本;先复现无工具的 AIME/代码/视觉基线。
对搜索、GUI 和视频任务公开输入、工具 schema、网页/应用环境和终止条件。
分别跑 no_think、low、medium、high,记录正确率、工具调用成功率、执行步骤、总 token、延迟和失败类型。
视频任务固定 VideoCut 的时间窗和 FPS,报告开启/关闭 VideoCut 的差值。
对外部模型使用相同题目、工具、预算和重复次数,并把官方自报结果与实测结果分栏。
模型卡明确列出四档思考模式,并把 Agent 评测扩展到 search、coding、tool use、GUI 与 video tool-use;本文只保留页面可直接核对的汇总数据。
Doubao Seed 1.8