在约 1,000 份混合 JPG/PDF 发票的个人批量抽取中,Seed2.1 Pro 经同一 VLM prompt 和后处理后每 100 行需修 3–4 行,成本约为原 frontier 方案的三分之一,但涉及金额仍必须人工复核。
适合的任务:大批量发票/票据 OCR 与结构化抽取的候选模型评估,尤其是可以设置人工抽检和失败重跑的流水线。
不适合的任务:无人审核的付款、财务入账或对扫描背景复杂的 PDF 直接自动化。
适用的模型版本:Seed 2.1 Pro;具体 preview/snapshot 未公开。
适用的客户端、Agent 或 API:通过 ZenMux provider router;不是方舟原生 API 的受控测试。
推荐的推理档位和参数:未公开;作者只说明复用了相同 VLM 提示词和后处理。
输入:约 1,000 份过去数年的混合 JPG 与 PDF 发票。
目标字段:姓名/名称、金额、日期、税号等结构化列。
对照:作者此前使用的 frontier 方案;同一 VLM extraction prompt 和同一 post-processing。
人工核验:随机抽查 100 行。
路由:ZenMux;模型调用参数、完整文件集和预处理脚本未公开。
原始抽取 prompt 未公开,不能将本文包装为可复制 prompt。
预处理、分块、重试、输出 schema 和 provider 参数未公开。
作者指出约 256K 上下文会限制长 PDF 或大批量拼接,需要 chunking;具体切分策略未公开。
抽取输出整体可用:作者称总额匹配,日期落在正确列。
随机抽查 100 行需手工修正约 3–4 行;原 frontier 方案通常需修 1–2 行/100 行。
一些带背景的扫描 PDF 被静默跳过,需要加入预处理提示后重跑。
计入重试后,作者估计每份文档成本约为原方案的三分之一。
作者仍对所有涉及金额的输出保留人工审查。
这份报告支持“Seed2.1 Pro 可作为批量视觉抽取的成本优化候选”,不支持“财务抽取可无人值守”。错误率、静默跳过和上下文限制都应进入生产验收门槛。
单一用户、单一文件集和 provider router;没有公开完整样本、随机种子、原始输出或统计置信区间。
100 行人工抽查不能估计所有版式和扫描质量的总体错误率。
成本是作者环境的约数,且未公开 token、重试次数和路由费用。
建立脱敏、分层的发票集,按 JPG/PDF、扫描背景、语言和版式分桶。
固定同一 prompt、schema、预处理、chunking、重试和 provider,对 Pro 与参考模型做批量运行。
对金额、日期、税号和行项目分别计算字段级准确率,记录静默跳过、重试和每文档成本。
对涉及金额的样本设置人工复核与拒绝/重跑规则,再决定是否扩大自动化范围。
作者的关键边界是“涉及金额仍需 review”。
报告把 provider router 的单文档成本与字段错误一并观察,而不是只看单次响应价格。
Doubao Seed 2.1 Pro