Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Sonnet 4.6 · 社区来源 · 编辑分析

OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析

在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源编辑分析编辑日期 2026-09-20

测试条件速查

模型/版本
Claude-Sonnet-4.6;来源日期:2026-02-28。
harness/任务
模型:Claude Sonnet 4.6(API 版本 `claude-sonnet-4-6`)。;价格:输入 $3.00 / 百万 token,输出 $15.00 / 百万 token。
样本/缺口
局限记录:失败模式集中:主要失败集中在:1) 页面微小像素级下拉箭头点击偏移(占比约 35% 的失败);2) 突发异步网络加载慢导致的动作抢跑;3) 软件快捷键冲突未触发。;高阶图形编辑较弱:在 GIMP 图像裁切、图层混合等连续空间判断任务中,成功率仅略超 50%。

关键数据与适用场景

一句话结论

在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。

测试环境

  • 模型:Claude Sonnet 4.6(API 版本 claude-sonnet-4-6)。

  • 价格:输入 $3.00 / 百万 token,输出 $15.00 / 百万 token。

  • 基准/工作流:OSWorld-Verified(包含 369 个跨应用真实桌面任务,涵盖 Chrome、LibreOffice Calc/Writer、VSCode、Thunderbird、GIMP 及原生 OS 文件管理)。

  • 版本边界:评测统一在 1024×768 分辨率、无辅助无障碍标签树(纯像素截图+坐标点击模式)的真实虚拟桌面容器中运行。

输入/配置

  • Scaffold:标准 OSWorld agent loop。

  • 参数配置:effort=medium,最大行动步数限制为 25 步/任务,每次操作前强制截取全屏并记录 action 轨迹。

  • 任务形式:如“在 LibreOffice 表格中根据条件汇总销售数据并导出为特定名称的 CSV”、“在 Chrome 中跨多标签页收集商品信息并填写至采购表单”。

结果数据

任务大类Sonnet 4.6 成功率Opus 4.6 成功率Sonnet 4.5 基线人类参考水平
全集综合 (OSWorld-Verified)72.5%72.7%61.4%72.36%
网页多步骤表单 (Chrome)84.2%85.0%71.3%88.5%
办公文档与表格 (LibreOffice)71.8%72.4%58.9%76.0%
文件系统与系统配置 (OS/Terminal)79.5%78.9%69.2%82.0%
复杂专业软件 (GIMP/CAD)54.5%54.8%46.2%63.0%
平均每任务消耗 Token34.2k48.6k38.1k-
平均每任务耗时 (秒)38.5s62.1s45.2s22.0s

结论

  1. 性价比跃升:Sonnet 4.6 在计算机使用综合得分上与 Opus 4.6 差距小于 0.2%,但平均完成耗时缩短 38%,Token 成本降低近 40%,具备大规模部署 RPA 与桌面智能体的极高实用性。

  2. 超越人类常模:在标准化、结构明确的跨应用数据转录任务中,Sonnet 4.6 成功率已略超普通人类测试者常模(72.5% vs 72.36%)。

局限

  • 失败模式集中:主要失败集中在:1) 页面微小像素级下拉箭头点击偏移(占比约 35% 的失败);2) 突发异步网络加载慢导致的动作抢跑;3) 软件快捷键冲突未触发。

  • 高阶图形编辑较弱:在 GIMP 图像裁切、图层混合等连续空间判断任务中,成功率仅略超 50%。

复现步骤

  1. 克隆 https://github.com/xlang-ai/OSWorld 官方评测仓库。

  2. 配置环境变量 ANTHROPIC_API_KEY,在配置文件中指定 model="claude-sonnet-4-6" 与 anthropic-beta="computer-use-2026-01-24"。

  3. 运行评测命令:python run.py --benchmark verified --model claude-sonnet-4-6 --max_steps 25。

  4. 导出汇总结果并使用评测脚本验证各项产物文件哈希与状态。

能支持的判断

  • 性价比跃升:Sonnet 4.6 在计算机使用综合得分上与 Opus 4.6 差距小于 0.2%,但平均完成耗时缩短 38%,Token 成本降低近 40%,具备大规模部署 RPA 与桌面智能体的极高实用性。
  • 超越人类常模:在标准化、结构明确的跨应用数据转录任务中,Sonnet 4.6 成功率已略超普通人类测试者常模(72.5% vs 72.36%)。

不能支持的判断

  • 失败模式集中:主要失败集中在:1) 页面微小像素级下拉箭头点击偏移(占比约 35% 的失败);2) 突发异步网络加载慢导致的动作抢跑;3) 软件快捷键冲突未触发。
  • 高阶图形编辑较弱:在 GIMP 图像裁切、图层混合等连续空间判断任务中,成功率仅略超 50%。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

OSWorld Benchmark Leaderboard / Evaluation Suite · OSWorld Evaluation Team & Independent Researchers · 原文发布日期 2026-02-28 · 本站编辑日期 2026-09-20

打开原始来源

Claude Sonnet 4.6

在 Tabbit 中比较 Claude Sonnet 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

相关评测

Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。Reddit MLOps 对 Claude Sonnet 4.6 与 Opus 4.6 的任务分层观察社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平在开放文档 AI 排行榜上,Claude Sonnet 4.6 总分 80.7,略高于 Opus 4.6 的 80.4,适合把 OCR、表格、版式和关键信息抽取从 Opus 下放到 Sonnet;归档扫描件仍要防内容审核误拦。Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流按“Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示按“Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置按“Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。