在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。
模型:Claude Sonnet 4.6(API 版本 claude-sonnet-4-6)。
价格:输入 $3.00 / 百万 token,输出 $15.00 / 百万 token。
基准/工作流:OSWorld-Verified(包含 369 个跨应用真实桌面任务,涵盖 Chrome、LibreOffice Calc/Writer、VSCode、Thunderbird、GIMP 及原生 OS 文件管理)。
版本边界:评测统一在 1024×768 分辨率、无辅助无障碍标签树(纯像素截图+坐标点击模式)的真实虚拟桌面容器中运行。
Scaffold:标准 OSWorld agent loop。
参数配置:effort=medium,最大行动步数限制为 25 步/任务,每次操作前强制截取全屏并记录 action 轨迹。
任务形式:如“在 LibreOffice 表格中根据条件汇总销售数据并导出为特定名称的 CSV”、“在 Chrome 中跨多标签页收集商品信息并填写至采购表单”。
| 任务大类 | Sonnet 4.6 成功率 | Opus 4.6 成功率 | Sonnet 4.5 基线 | 人类参考水平 |
|---|---|---|---|---|
| 全集综合 (OSWorld-Verified) | 72.5% | 72.7% | 61.4% | 72.36% |
| 网页多步骤表单 (Chrome) | 84.2% | 85.0% | 71.3% | 88.5% |
| 办公文档与表格 (LibreOffice) | 71.8% | 72.4% | 58.9% | 76.0% |
| 文件系统与系统配置 (OS/Terminal) | 79.5% | 78.9% | 69.2% | 82.0% |
| 复杂专业软件 (GIMP/CAD) | 54.5% | 54.8% | 46.2% | 63.0% |
| 平均每任务消耗 Token | 34.2k | 48.6k | 38.1k | - |
| 平均每任务耗时 (秒) | 38.5s | 62.1s | 45.2s | 22.0s |
性价比跃升:Sonnet 4.6 在计算机使用综合得分上与 Opus 4.6 差距小于 0.2%,但平均完成耗时缩短 38%,Token 成本降低近 40%,具备大规模部署 RPA 与桌面智能体的极高实用性。
超越人类常模:在标准化、结构明确的跨应用数据转录任务中,Sonnet 4.6 成功率已略超普通人类测试者常模(72.5% vs 72.36%)。
失败模式集中:主要失败集中在:1) 页面微小像素级下拉箭头点击偏移(占比约 35% 的失败);2) 突发异步网络加载慢导致的动作抢跑;3) 软件快捷键冲突未触发。
高阶图形编辑较弱:在 GIMP 图像裁切、图层混合等连续空间判断任务中,成功率仅略超 50%。
克隆 https://github.com/xlang-ai/OSWorld 官方评测仓库。
配置环境变量 ANTHROPIC_API_KEY,在配置文件中指定 model="claude-sonnet-4-6" 与 anthropic-beta="computer-use-2026-01-24"。
运行评测命令:python run.py --benchmark verified --model claude-sonnet-4-6 --max_steps 25。
导出汇总结果并使用评测脚本验证各项产物文件哈希与状态。
Claude Sonnet 4.6