在一个同时考察“从近似噪声中找对目标”和“无有效目标时返回 NULL”的检索测试中,Seed 2.0 Lite 达到 66% 总准确率,并高于该作者测试中的 Seed 2.0 Pro;这说明它可能适合低成本 resolver/tool-target 任务,但不能外推为通用智能排名。
适合的任务:文件、标签、工具目标、记录或检索片段的近似匹配,以及需要拒绝错误候选的 Agent resolver。
不适合的任务:将单一合成检索 benchmark 的结果当作长链编码、视觉或生产财务任务成功率。
适用的模型版本:作者称 Doubao Seed 2.0 Lite;具体 API provider、模型快照和参数未公开。
适用的客户端、Agent 或 API:测试平台未公开;原文聚焦模型比较,不是某个网关的延迟测试。
推荐的推理档位和参数:未公开;复现时必须固定模型、temperature、max output 和是否启用思考。
任务结构:每次给一个 query 和 1,000 个 label 的 haystack,只允许一次回答。
样本比例:每个 benchmark run 包含 750 个正例和 250 个负例。
重复方式:每模型 100 轮,每轮使用同一组 1,000 个案例并打乱顺序。
目标:正例找出正确 label_id;负例在相似但无效的候选中返回 NULL。
输入规模:单 label 约 4–35 个 Gemini tokenizer token,1,000 labels 总计约 23,000–25,000 tokens。
原文给出的可复现任务规则:
给定一个 query 和 1,000 个带 label_id 的标签列表。
若 query 对应一个经过轻微损坏、缩写、拼写变化或降质的真实目标,只返回正确的 label_id。
若列表中没有合法目标,即使有近似项,也只返回 NULL。
每个案例只能回答一次,不要补充解释。示例正例:query 0710B Lewis,列表含 [label_id=123] 0710B LewisC <random note>,期望 123。
示例负例:query 0720A LewisO,列表只有相似但不匹配的条目,期望 NULL。
Seed 2.0 Lite 总准确率:66%。
作者称 Lite 在该测试中高于 Seed 2.0 Pro,但没有在正文公开 Pro 的具体分数。
Gemini 3 Flash 总准确率:72%,并在该测试中高于 Gemini 3.1 Pro Preview。
作者指出 Qwen 3.5 Flash 的 33% 被“多数回答 NULL”影响,说明总准确率必须拆分正例/负例;原文定义了 Positive accuracy 和 Negative accuracy,但没有公开每模型拆分表。
Lite 在“近似匹配 + 拒答”这一类 Agent resolver 任务上表现出可用的成本/可靠性信号,且意外超过 Pro;不过该结果受合成数据分布、单轮输出和提示设计影响,实际文件/工具选择仍需用真实候选集重测。
测试是单一作者的合成 benchmark,未公开完整 1,000 案例、随机种子、模型参数和 provider。
100 轮的统计方式和置信区间未公开,只有总准确率和部分观察。
负例比例、tokenizer 与案例结构会强烈影响结果,不能直接外推到任意长上下文或多轮 Agent。
生成固定的 750 个正例、250 个负例,保存原始 1,000 条标签、query、期望答案和随机种子。
对每个模型固定 prompt、provider、模型快照、temperature、max output 和单次响应约束。
重复 100 轮并每轮打乱案例;记录总、正例、负例准确率和拒答格式错误。
额外在真实文件名、工具名和记录 ID 上运行同样协议,再报告合成与真实数据的差异。
作者把负例的正确答案定义为 NULL,专门测量“不要把最像的候选硬猜成答案”。
作者明确说明该测试用于选择 agentic orchestrator 的 resolver agent,而不是证明哪个模型最聪明。
Doubao Seed 2.0 Lite