Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
提示词与工作流

Claude Sonnet 4.6 · workflow

Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流

按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。

来源待核验Claude API、Claude Code 或兼容 Anthropic 的运行器

前置条件与输入

  • 任务相关文件
  • 工具白名单与权限
  • 输出 schema
  • 验收证据

Prerequisites\nClosed-loop computer use: operate an isolated browser with synthetic data, one action at a time, and a human takeover for high-impact steps.\n\n## Task-specific steps\nCapture the screen after every action, verify state, and save the trace. On a loop or visual error, restore the snapshot and reduce step size.\n\n## Output and acceptance\nCapture the screen after every action, verify state, and save the trace. On a loop or visual error, restore the snapshot and reduce step size.\n\n## Source and boundary\nAnthropic Computer Use documentation; website reliability varies.

查看来源研究笔记

一句话结论

通过标准化的 computer_20260124、bash_20260124 和 text_editor_20260124 工具定义,结合“观察-定位-行动-验证”闭环系统提示,使 Claude Sonnet 4.6 能够高精度执行桌面与浏览器跨应用自动化。

适用场景

  • 适合的任务:无公开 API 的遗留桌面软件操作、多标签页复杂网页表单录入、多应用数据搬运与跨系统对账。

  • 不适合的任务:高帧率实时游戏、毫秒级响应交易、涉及敏感资金划转但无人工审核确认的高风险操作。

  • 适用的模型版本:Claude Sonnet 4.6(claude-sonnet-4-6)。

  • 适用的客户端、Agent 或 API:Anthropic Messages API(启用 anthropic-beta: computer-use-2026-01-24 请求头)。

  • 推荐的推理档位和参数:推荐 effort=medium,屏幕分辨率建议缩放到 1024×768 或 1280×800 以保证坐标定位精度并控制视觉 token 消耗。

可直接使用的内容

API 工具声明配置

{
  "model": "claude-sonnet-4-6",
  "max_tokens": 4096,
  "output_config": {
    "effort": "medium"
  },
  "tools": [
    {
      "type": "computer_20260124",
      "name": "computer",
      "display_width_px": 1024,
      "display_height_px": 768,
      "display_number": 1
    },
    {
      "type": "bash_20260124",
      "name": "bash"
    },
    {
      "type": "text_editor_20260124",
      "name": "str_replace_editor"
    }
  ]
}

配套 Computer Use 系统引导提示词

<role>
你是一个操作计算机以完成特定业务目标的自动化 Agent。
</role>

<operating_principles>
1. 观察优先:在执行点击、输入前,必须先获取最新的屏幕截图,确认目标 UI 元素在当前视图中可见。
2. 坐标校准:根据 1024x768 的屏幕物理坐标进行点选,点击后观察画面变化确认操作已生效。
3. 容错与重试:若点击未触发预期响应,先检查是否存在未关闭的模态弹窗或加载遮罩,重新截图再定位。
4. 键盘组合键:优先使用常规快捷键(如 Ctrl+A / Cmd+A 全选、Ctrl+V 粘贴),减少逐字输入可能产生的丢失。
5. 状态断言:每个关键动作完成后,必须通过截图或文本检查确认目标状态达成,方可进入下一步。
6. 安全底线:遇到支付确认、删除生产数据库或向外部发送批量邮件前,必须输出提示请求操作员确认。
</operating_principles>

<execution_steps>
1. 解析用户给出的初始任务与目标终态。
2. 截取初始屏幕图像并分析当前窗口布局。
3. 规划分步子任务路径(不超过 10 步一组)。
4. 循环调用 computer 工具执行 action(mouse_move, click, type, key, screenshot)。
5. 任务结束时输出最终执行结果与验证证据。
</execution_steps>

测试/工作流步骤

  1. 环境准备:启动隔离的 Docker 容器或虚拟机,运行 Xvfb 虚拟桌面并绑定显示端口(如 :1,分辨率 1024x768)。

  2. API 握手:发送带有 computer-use-2026-01-24 请求头的初始请求,传入目标任务与系统提示词。

  3. Agent 循环运行:

    • 客户端收到模型的 tool_use(如 action: "screenshot")后,从虚拟桌面抓取图像转为 base64 PNG。

    • 客户端将 tool_result 回传给模型。

    • 模型返回下一步操作(如 action: "left_click", coordinate: [450, 320]),客户端通过 xdotool 或 OS API 执行动作。

  4. 终止判定:当模型输出 stop_reason: "end_turn" 且未调用工具时,检查最终状态并结束会话。

原始证据与数据

  • 官方文档说明:Sonnet 4.6 较前代显著降低了“坐标偏移”(Coordinate Drift)概率,在 1024×768 分辨率下首击命中率提升约 22%。

  • 官方基准指出:在 OSWorld-Verified 评测中,Sonnet 4.6 达到 72.5% 的任务完成率,与旗舰 Opus 4.6(72.7%)几乎持平,但运行成本降低约 40%,响应吞吐提升近 2 倍。

  • 官方建议在长时域自动化中将 screenshot 调用与局部裁剪结合,避免单次任务因大量全屏视觉 token 造成上下文快速耗尽。

适用边界

  • 操作系统 DPI 缩放(如 200% Retina 屏幕)会导致物理像素与逻辑像素不匹配,必须在 Agent 客户端层完成坐标归一化转换。

  • 动态下拉菜单或 hover 触发的悬浮层容易在鼠标移动后消失,需采用快捷键或显式 hover 等待策略。

  • 网页内自动化优先建议使用 Playwright/CDP DOM 定位;只有在没有 DOM 接口或跨原生桌面应用时才使用纯视觉 Computer Use。

来源摘录或观察(仅做合规短引)

Anthropic 官方指出:“Computer use allows Claude to interact directly with standard user interfaces, filling the gap where dedicated APIs are unavailable.”(官方技术文档转述)

来源与日期

Anthropic Platform Docs / Computer Use API Reference · 原文日期: 2026-02-17 · 编辑日期: 2026-09-20

阅读原始来源
变量检查

无必填变量

相关提示词

Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流Claude Sonnet 4.6 的 effort 与工具触发配置

相关测评

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准Harvey Legal Agent Bench:Sonnet 4.6 全通过率 4.2%Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

Claude Sonnet 4.6

在 Tabbit 中使用 Claude Sonnet 4.6

请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。