Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区Claude Sonnet 4.6

OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析

原始来源

OSWorld Benchmark Leaderboard / Evaluation Suite

作者OSWorld Evaluation Team & Independent Researchers

原文日期2026-02-28

Tabbit 整理2026-08-20

查看原文

一句话结论

在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。

测试环境

  • 模型:Claude Sonnet 4.6(API 版本 claude-sonnet-4-6)。

  • 价格:输入 $3.00 / 百万 token,输出 $15.00 / 百万 token。

  • 基准/工作流:OSWorld-Verified(包含 369 个跨应用真实桌面任务,涵盖 Chrome、LibreOffice Calc/Writer、VSCode、Thunderbird、GIMP 及原生 OS 文件管理)。

  • 版本边界:评测统一在 1024×768 分辨率、无辅助无障碍标签树(纯像素截图+坐标点击模式)的真实虚拟桌面容器中运行。

输入/配置

  • Scaffold:标准 OSWorld agent loop。

  • 参数配置:effort=medium,最大行动步数限制为 25 步/任务,每次操作前强制截取全屏并记录 action 轨迹。

  • 任务形式:如“在 LibreOffice 表格中根据条件汇总销售数据并导出为特定名称的 CSV”、“在 Chrome 中跨多标签页收集商品信息并填写至采购表单”。

结果数据

任务大类Sonnet 4.6 成功率Opus 4.6 成功率Sonnet 4.5 基线人类参考水平
全集综合 (OSWorld-Verified)72.5%72.7%61.4%72.36%
网页多步骤表单 (Chrome)84.2%85.0%71.3%88.5%
办公文档与表格 (LibreOffice)71.8%72.4%58.9%76.0%
文件系统与系统配置 (OS/Terminal)79.5%78.9%69.2%82.0%
复杂专业软件 (GIMP/CAD)54.5%54.8%46.2%63.0%
平均每任务消耗 Token34.2k48.6k38.1k-
平均每任务耗时 (秒)38.5s62.1s45.2s22.0s

结论

  1. 性价比跃升:Sonnet 4.6 在计算机使用综合得分上与 Opus 4.6 差距小于 0.2%,但平均完成耗时缩短 38%,Token 成本降低近 40%,具备大规模部署 RPA 与桌面智能体的极高实用性。

  2. 超越人类常模:在标准化、结构明确的跨应用数据转录任务中,Sonnet 4.6 成功率已略超普通人类测试者常模(72.5% vs 72.36%)。

局限

  • 失败模式集中:主要失败集中在:1) 页面微小像素级下拉箭头点击偏移(占比约 35% 的失败);2) 突发异步网络加载慢导致的动作抢跑;3) 软件快捷键冲突未触发。

  • 高阶图形编辑较弱:在 GIMP 图像裁切、图层混合等连续空间判断任务中,成功率仅略超 50%。

复现步骤

  1. 克隆 https://github.com/xlang-ai/OSWorld 官方评测仓库。

  2. 配置环境变量 ANTHROPIC_API_KEY,在配置文件中指定 model="claude-sonnet-4-6" 与 anthropic-beta="computer-use-2026-01-24"。

  3. 运行评测命令:python run.py --benchmark verified --model claude-sonnet-4-6 --max_steps 25。

  4. 导出汇总结果并使用评测脚本验证各项产物文件哈希与状态。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 4.6

在 Tabbit 中使用并对比模型

Claude Sonnet 4.6

相关测评

媒体Anthropic News / Introducing Sonnet 4.62026-02-17

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准

媒体BenchLM2026-08-17

BenchLM 对 Claude Sonnet 4.6 的公开证据账本

媒体IDP Leaderboard2026-03

IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平

媒体Artificial Analysis

Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37

Claude Sonnet 4.6

相关提示词

媒体Claude Platform Docs / Prompting best practices

Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示

媒体Claude Platform Docs / Effort 与 Prompting best practices

Claude Sonnet 4.6 的 effort 与工具触发配置

媒体Anthropic Platform Docs / Computer Use API Reference2026-02-17

Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流

媒体Anthropic Platform Docs / Context Management & Compaction2026-02-17

Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置