Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Sonnet 4.6 · 社区来源 · 编辑分析

IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平

在开放文档 AI 排行榜上,Claude Sonnet 4.6 总分 80.7,略高于 Opus 4.6 的 80.4,适合把 OCR、表格、版式和关键信息抽取从 Opus 下放到 Sonnet;归档扫描件仍要防内容审核误拦。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源编辑分析编辑日期 2026-09-20

测试条件速查

模型/版本
Claude-Sonnet-4.6;来源日期:2026-03。
harness/任务
模型:排行榜第 8 名 Claude Sonnet 4.6,第 9 名 Claude Opus 4.6,第 16 名 Claude Haiku 4.5。;任务:Intelligent Document Processing,覆盖 OCR、表格抽取、关键信息抽取、视觉问答;总分是各基准分的均值。
样本/缺口
局限记录:首页未公开 Claude 的完整采样配置;成本数字来自 Reddit 同步帖,不是排行榜主表字段。;内容审核失败会计入相关分项,不等于模型“看不懂”该页。

关键数据与适用场景

一句话结论

在开放文档 AI 排行榜上,Claude Sonnet 4.6 总分 80.7,略高于 Opus 4.6 的 80.4,适合把 OCR、表格、版式和关键信息抽取从 Opus 下放到 Sonnet;归档扫描件仍要防内容审核误拦。

测试环境

  • 模型:排行榜第 8 名 Claude Sonnet 4.6,第 9 名 Claude Opus 4.6,第 16 名 Claude Haiku 4.5。

  • 任务:Intelligent Document Processing,覆盖 OCR、表格抽取、关键信息抽取、视觉问答;总分是各基准分的均值。

  • 分项:OlmOCR、OmniDoc、IDP。

  • 规模:Reddit 同步帖称 16 个模型、9000+ 真实文档;采集时主表已扩到 26 个模型。以排行榜当前数字为准。

  • 产物:站点提供 Code、Datasets、Results Explorer;方法说明链到 GitHub。

输入/配置

页面未在首页列出每个 Claude 模型的完整 prompt、temperature、effort 或是否启用 thinking。复核时应打开 Results Explorer 看逐文档输出,并到 GitHub methodology 核对 harness。

结果数据

采集时主表(Overall / OlmOCR / OmniDoc / IDP):

模型OverallOlmOCROmniDocIDP
Nanonets OCR-385.987.490.080.2
GPT-5.483.581.085.384.4
Gemini-3-Pro82.877.788.881.8
Claude Sonnet 4.680.773.986.981.2
Claude Opus 4.680.474.185.981.1
Claude Haiku 4.571.261.279.672.9

Reddit 同步帖当时写 Sonnet 80.8 / Opus 80.3 / Haiku 69.6,并称抽取类任务雷达图几乎重合;Sonnet 成本约 $24/1K pages,Opus 约 $40/1K pages。当前主表数字已微调,引用时以 https://www.idp-leaderboard.org/ 为准。

同步帖还记录:旧报纸扫描、教材页和历史文档有时触发 Claude 更严的内容审核,主要出现在 OlmOCR 与 OmniDoc。

结论

文档抽取、表格和版式理解上,Sonnet 4.6 可以替代 Opus 4.6 作为默认模型;Haiku 4.5 明显落后。若业务是专项 OCR,当前榜首是 Nanonets OCR-3,不是通用 Claude。归档/历史扫描需要单独测审核拦截率。

局限

  • 这是文档理解榜,不能外推到 SWE、电脑使用或开放推理。

  • Reddit 旧数字与采集时主表有 0.1–1.6 分差异,必须引用页面当时快照。

  • 首页未公开 Claude 的完整采样配置;成本数字来自 Reddit 同步帖,不是排行榜主表字段。

  • 内容审核失败会计入相关分项,不等于模型“看不懂”该页。

复现步骤

  1. 从站点下载公开数据集与评测代码,固定模型 ID claude-sonnet-4-6 和对照模型。

  2. 按 GitHub methodology 跑 OlmOCR、OmniDoc、IDP,保存逐页预测。

  3. 分别统计抽取准确率、审核拦截率和每千页成本。

  4. 在 Results Explorer 抽查失败页,区分识别错误与安全过滤。

能支持的判断

  • 文档抽取、表格和版式理解上,Sonnet 4.6 可以替代 Opus 4.6 作为默认模型;Haiku 4.5 明显落后。若业务是专项 OCR,当前榜首是 Nanonets OCR-3,不是通用 Claude。归档/历史扫描需要单独测审核拦截率。

不能支持的判断

  • 首页未公开 Claude 的完整采样配置;成本数字来自 Reddit 同步帖,不是排行榜主表字段。
  • 内容审核失败会计入相关分项,不等于模型“看不懂”该页。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

IDP Leaderboard · IDP Leaderboard / shhdwi(Reddit 同步说明) · 原文发布日期 2026-03 · 本站编辑日期 2026-09-20

打开原始来源

Claude Sonnet 4.6

在 Tabbit 中比较 Claude Sonnet 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

相关评测

OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。Reddit MLOps 对 Claude Sonnet 4.6 与 Opus 4.6 的任务分层观察社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流按“Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示按“Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置按“Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。