Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Sonnet 4.6

IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平

原始来源

IDP Leaderboard

作者IDP Leaderboard / shhdwi(Reddit 同步说明)

原文日期2026-03

Tabbit 整理2026-08-20

查看原文

一句话结论

在开放文档 AI 排行榜上,Claude Sonnet 4.6 总分 80.7,略高于 Opus 4.6 的 80.4,适合把 OCR、表格、版式和关键信息抽取从 Opus 下放到 Sonnet;归档扫描件仍要防内容审核误拦。

测试环境

  • 模型:排行榜第 8 名 Claude Sonnet 4.6,第 9 名 Claude Opus 4.6,第 16 名 Claude Haiku 4.5。

  • 任务:Intelligent Document Processing,覆盖 OCR、表格抽取、关键信息抽取、视觉问答;总分是各基准分的均值。

  • 分项:OlmOCR、OmniDoc、IDP。

  • 规模:Reddit 同步帖称 16 个模型、9000+ 真实文档;采集时主表已扩到 26 个模型。以排行榜当前数字为准。

  • 产物:站点提供 Code、Datasets、Results Explorer;方法说明链到 GitHub。

输入/配置

页面未在首页列出每个 Claude 模型的完整 prompt、temperature、effort 或是否启用 thinking。复核时应打开 Results Explorer 看逐文档输出,并到 GitHub methodology 核对 harness。

结果数据

采集时主表(Overall / OlmOCR / OmniDoc / IDP):

模型OverallOlmOCROmniDocIDP
Nanonets OCR-385.987.490.080.2
GPT-5.483.581.085.384.4
Gemini-3-Pro82.877.788.881.8
Claude Sonnet 4.680.773.986.981.2
Claude Opus 4.680.474.185.981.1
Claude Haiku 4.571.261.279.672.9

Reddit 同步帖当时写 Sonnet 80.8 / Opus 80.3 / Haiku 69.6,并称抽取类任务雷达图几乎重合;Sonnet 成本约 $24/1K pages,Opus 约 $40/1K pages。当前主表数字已微调,引用时以 https://www.idp-leaderboard.org/ 为准。

同步帖还记录:旧报纸扫描、教材页和历史文档有时触发 Claude 更严的内容审核,主要出现在 OlmOCR 与 OmniDoc。

结论

文档抽取、表格和版式理解上,Sonnet 4.6 可以替代 Opus 4.6 作为默认模型;Haiku 4.5 明显落后。若业务是专项 OCR,当前榜首是 Nanonets OCR-3,不是通用 Claude。归档/历史扫描需要单独测审核拦截率。

局限

  • 这是文档理解榜,不能外推到 SWE、电脑使用或开放推理。

  • Reddit 旧数字与采集时主表有 0.1–1.6 分差异,必须引用页面当时快照。

  • 首页未公开 Claude 的完整采样配置;成本数字来自 Reddit 同步帖,不是排行榜主表字段。

  • 内容审核失败会计入相关分项,不等于模型“看不懂”该页。

复现步骤

  1. 从站点下载公开数据集与评测代码,固定模型 ID claude-sonnet-4-6 和对照模型。

  2. 按 GitHub methodology 跑 OlmOCR、OmniDoc、IDP,保存逐页预测。

  3. 分别统计抽取准确率、审核拦截率和每千页成本。

  4. 在 Results Explorer 抽查失败页,区分识别错误与安全过滤。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 4.6

在 Tabbit 中使用并对比模型

Claude Sonnet 4.6

相关测评

媒体Anthropic News / Introducing Sonnet 4.62026-02-17

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准

媒体BenchLM2026-08-17

BenchLM 对 Claude Sonnet 4.6 的公开证据账本

媒体Artificial Analysis

Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37

媒体Sansa Bench(trysansa.com)

Sansa Bench:Sonnet 4.6 高推理总体 0.733,当前排第 4

Claude Sonnet 4.6

相关提示词

媒体Claude Platform Docs / Prompting best practices

Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示

媒体Claude Platform Docs / Effort 与 Prompting best practices

Claude Sonnet 4.6 的 effort 与工具触发配置

媒体Anthropic Platform Docs / Computer Use API Reference2026-02-17

Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流

媒体Anthropic Platform Docs / Context Management & Compaction2026-02-17

Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置