官方将 Seed2.0 Lite 定位为 Pro/Lite/Mini 通用 Agent 家族中的成本与能力平衡档,但发布博客主要公开系列能力和 Pro 结果,不能从中推导 Lite 的完整独立分数。
适合的任务:非结构化文档/表格/图形处理、长内容理解、多步工具工作流、企业检索与研究型 Agent 的候选筛选。
不适合的任务:仅按官方“业界领先”描述上线 Lite,或把 Pro 的数学/科研分数直接归给 Lite。
适用的模型版本:Seed2.0 Pro、Lite、Mini 及 Code;本条目聚焦 Lite 在家族中的定位。
适用的客户端、Agent 或 API:豆包 App、TRAE、火山引擎 API;博客称全系列 API 同步上线火山引擎。
推荐的推理档位和参数:未公开;Lite 的具体推理档位、最大输出、温度和工具参数需按 API 文档核实。
测试方:ByteDance Seed 官方团队,基于 MaaS 服务调用场景和自建评测体系。
场景:多模态文档/表格/图形/视频、长链路搜索与研究、GDPVal/专业任务、数学与科研、代码工程。
模型拆分:发布文中很多具体分数和案例指向 Seed2.0 Pro 或全系列,未为 Lite 提供完整单独测试表。
输入/配置:完整 prompt、数据集版本、采样次数、工具和 harness 未公开。
官方称 Seed2.0 面向真实生产需求,重点优化视觉与多模态理解、复杂指令执行和 Pro/Lite/Mini 的推理选择。博客说明 Pro 与 Code 已分别在豆包 App、TRAE 上线,全系列 API 已上线火山引擎,但没有给出 Lite 的完整请求样例。
官方将 Seed2.0 设计成 Pro、Lite、Mini 三种通用 Agent 规格,另有 Code 模型,以覆盖不同成本和场景。
全系列能力主张包括复杂文档、表格、图形、视频解析,多约束多步骤长链任务,连续“找资料—归纳—写结论”工作流,以及工具调用。
官方报告 Seed2.0 Pro 在 MathVista、MathVision、MathKangaroo、MathCanvas 等视觉数学基准、VLMsAreBiased/VLMsAreBlind/BabyVision、DUDE/MMLongBench/MMLongBench-Doc、TVBench/TempCompass/MotionBench 等任务上处于领先或 SOTA 语境;这些结果不能改写成 Lite 的分数。
官方称 Seed2.0 Pro 在 SuperGPQA 超过 GPT-5.2,并在 GDPVal-Diamond、XPert Bench、FrontierSci 等任务上有竞争力;同样没有公开 Lite 对应完整数值。
官方承认 Seed2.0 在端到端整体代码生成、上下文学习上仍有部分高难基准与国际领先模型存在差距。
官方材料足以说明 Lite 值得纳入成本敏感的多模态/Agent 评测集,尤其是长内容、文档和工具工作流;但“Lite 具体达到什么分数”仍需读取当前 Model Card 或自行复测,不能用 Pro 的公开数字代替。
发布博客是系列发布说明,Lite 的独立输入、参数、样本量和结果表不完整。
SOTA、第一梯队和“约一个数量级成本优势”等表述是官方发布语境,不是统一受控的第三方测量。
API、价格、模型快照和地区可用性会变化;发布日信息不能代替当前端点验证。
获取当前 Lite API 模型 ID和 Model Card,记录快照、上下文、思考档位和价格。
用真实文档/表格、视频、检索和多步工具任务建立分桶测试,分别测 Lite 与 Pro。
固定同一 prompt、工具、超时和验收门槛,记录首轮成功、事实/字段准确率、工具恢复、token、延迟与成本。
将官方系列分数作为背景,不在报告中把 Pro 结果归到 Lite。
官方把 Lite 放在 Pro、Lite、Mini 的“不同尺寸通用 Agent 模型”选择中。
官方材料同时强调真实长程任务与多模态能力,并承认部分高难端到端代码任务仍有差距。
Doubao Seed 2.0 Lite