APIYI 的对照表显示 Lite 在 AIME、知识、视觉、视频和代码任务上接近 Pro,并公开 low/high/xhigh 视觉档位;这些是 provider 页面整理的 benchmark 数据,需在同一 API 上复核。
适合的任务:文档/收据/合同抽取、图表分析、视频理解、搜索推荐、工具调用和高 QPS 生产路由。
不适合的任务:把 provider 页面基准当成独立重跑,或在财务/高风险任务中省略人工抽查。
适用的模型版本:APIYI 的 seed-2-0-lite-260228;页面同时列 Seed2.0 Pro 和 Seed1.8 作对照。
适用的客户端、Agent 或 API:APIYI OpenAI-compatible endpoint https://api.apiyi.com/v1;不是火山方舟直连。
推荐的推理档位和参数:视觉输入可按 low/high/xhigh 选档;页面未公开完整 temperature、reasoning 和工具参数。
测试方:APIYI 的模型介绍和 benchmark 汇总页。
对照模型:Seed 2.0 Lite、Seed 2.0 Pro、Seed 1.8。
测试任务:AIME 2025、MMLU-Pro、SWE-Bench Verified、LiveCodeBench v6、MathVision、MathVista、VideoMME、COLLIE。
完整输入/配置:页面未公开原始 prompt、样本量、采样次数、工具和评测脚本。
输入模态:文本、图片、视频;输出类型为文本。
视觉档位:low 适合简单识别/快速分类,high 为标准文档/图表分析默认档,xhigh 面向密集文字、复杂图表和细节丰富场景。
API:OpenAI-compatible;页面列出的模型名为 seed-2-0-lite-260228。
知识截止:页面列出 2024-01;该字段应按当前 provider 实测/文档复核。
APIYI 页面表格直接列出的数值:
| Benchmark | Seed 2.0 Lite | Seed 2.0 Pro | Seed 1.8 |
|---|---|---|---|
| AIME 2025 | 93.0 | 96.0 | - |
| MMLU-Pro | 87.7 | 87.0 | - |
| SWE-Bench Verified | 73.5% | 76.5% | - |
| LiveCodeBench v6 | 81.7 | 84.0 | - |
| MathVision | 86.4 | - | 81.3 |
| MathVista | 89.0 | - | - |
| VideoMME | 87.7 | - | - |
| COLLIE | 94.0 | - | - |
页面据此将 Lite 定位为约为 Pro 五分之一成本、适合日常生产任务和高并发覆盖,并将 MMLU-Pro 视为 Lite 高于 Pro 的知识任务例子。
这份资料支持 Lite 在结构化知识、视觉理解和高吞吐多模态场景中作为 Pro 的成本替代候选;SWE-Bench 和 LiveCodeBench 仍低于 Pro,复杂软件工程应保留升级路径。视觉档位可直接转成成本/质量 A/B 变量。
APIYI 是第三方 provider,页面没有提供 benchmark 原始输入、评测代码或独立复核证明。
“约五分之一成本”、知识截止、模型名和 endpoint 都是 provider 页面口径,不等同于方舟当前价格或快照。
表格中的 benchmark 可能来自官方 Model Card;不能将其标记为 APIYI 独立受控测试。
在 APIYI 固定 seed-2-0-lite-260228、视觉档位、temperature、max output 和请求模式。
对 AIME/MMLU/代码/视觉/视频任务保存原始输入和输出,并与 Pro 使用相同 prompt、工具和超时。
分别统计准确率、字段/代码测试、视频事件识别、token、延迟、错误和重试成本。
在 high 与 xhigh 视觉档位之间做同样输入的 A/B,判断质量提升是否抵消成本。
页面把 Lite 的视觉输入拆成 low/high/xhigh 三档,而不是只给一个“视觉能力”标签。
页面同时列出 Lite 与 Pro 的代码和知识分数,适合作为路由假设,但不应替代独立复测。
Doubao Seed 2.0 Lite