在开放文档 AI 排行榜上,Claude Sonnet 4.6 总分 80.7,略高于 Opus 4.6 的 80.4,适合把 OCR、表格、版式和关键信息抽取从 Opus 下放到 Sonnet;归档扫描件仍要防内容审核误拦。
模型:排行榜第 8 名 Claude Sonnet 4.6,第 9 名 Claude Opus 4.6,第 16 名 Claude Haiku 4.5。
任务:Intelligent Document Processing,覆盖 OCR、表格抽取、关键信息抽取、视觉问答;总分是各基准分的均值。
分项:OlmOCR、OmniDoc、IDP。
规模:Reddit 同步帖称 16 个模型、9000+ 真实文档;采集时主表已扩到 26 个模型。以排行榜当前数字为准。
产物:站点提供 Code、Datasets、Results Explorer;方法说明链到 GitHub。
页面未在首页列出每个 Claude 模型的完整 prompt、temperature、effort 或是否启用 thinking。复核时应打开 Results Explorer 看逐文档输出,并到 GitHub methodology 核对 harness。
采集时主表(Overall / OlmOCR / OmniDoc / IDP):
| 模型 | Overall | OlmOCR | OmniDoc | IDP |
|---|---|---|---|---|
| Nanonets OCR-3 | 85.9 | 87.4 | 90.0 | 80.2 |
| GPT-5.4 | 83.5 | 81.0 | 85.3 | 84.4 |
| Gemini-3-Pro | 82.8 | 77.7 | 88.8 | 81.8 |
| Claude Sonnet 4.6 | 80.7 | 73.9 | 86.9 | 81.2 |
| Claude Opus 4.6 | 80.4 | 74.1 | 85.9 | 81.1 |
| Claude Haiku 4.5 | 71.2 | 61.2 | 79.6 | 72.9 |
Reddit 同步帖当时写 Sonnet 80.8 / Opus 80.3 / Haiku 69.6,并称抽取类任务雷达图几乎重合;Sonnet 成本约 $24/1K pages,Opus 约 $40/1K pages。当前主表数字已微调,引用时以 https://www.idp-leaderboard.org/ 为准。
同步帖还记录:旧报纸扫描、教材页和历史文档有时触发 Claude 更严的内容审核,主要出现在 OlmOCR 与 OmniDoc。
文档抽取、表格和版式理解上,Sonnet 4.6 可以替代 Opus 4.6 作为默认模型;Haiku 4.5 明显落后。若业务是专项 OCR,当前榜首是 Nanonets OCR-3,不是通用 Claude。归档/历史扫描需要单独测审核拦截率。
这是文档理解榜,不能外推到 SWE、电脑使用或开放推理。
Reddit 旧数字与采集时主表有 0.1–1.6 分差异,必须引用页面当时快照。
首页未公开 Claude 的完整采样配置;成本数字来自 Reddit 同步帖,不是排行榜主表字段。
内容审核失败会计入相关分项,不等于模型“看不懂”该页。
从站点下载公开数据集与评测代码,固定模型 ID claude-sonnet-4-6 和对照模型。
按 GitHub methodology 跑 OlmOCR、OmniDoc、IDP,保存逐页预测。
分别统计抽取准确率、审核拦截率和每千页成本。
在 Results Explorer 抽查失败页,区分识别错误与安全过滤。
Claude Sonnet 4.6