Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Opus 4.7

Claude Opus 4.7:官方编码、视觉与 Agent 基准

原始来源

Anthropic Newsroom

作者Anthropic 官方

原文日期2026-04-16

Tabbit 整理2026-08-19

查看原文

一句话结论

官方发布把 Opus 4.7 定位为面向困难软件工程、长程 Agent 和高分辨率视觉的 4.6 升级,但 BrowseComp 回落和更高 token 消耗说明它不是所有任务的无条件替代品。

适用场景

  • 适合的任务:复杂多语言代码库、工具编排、电脑操作、金融/专业知识工作、高分辨率图表和界面理解。

  • 不适合的任务:重度网页研究且以 BrowseComp 类能力为主的 Agent;低成本短任务也不应默认开启 xhigh/max。

  • 适用的模型版本:claude-opus-4-7,官方一般可用版本。

  • 适用的客户端、Agent 或 API:Claude 产品、Anthropic API、Amazon Bedrock、Google Vertex AI、Microsoft Foundry。

  • 推荐的推理档位和参数:官方建议代码/Agent 从 high 或 xhigh 开始;API 默认 high;同一任务的 effort、token budget、工具 harness 应记录下来。

测试环境、输入/配置

  • 官方模型:Claude Opus 4.7,与 Opus 4.6、Gemini 3.1 Pro、GPT-5.4 等比较;部分图表还包含 Claude Mythos Preview。

  • 任务/基准:SWE-bench Verified、SWE-bench Pro、Terminal-Bench 2.0、MCP-Atlas、Finance Agent v1.1、OSWorld-Verified、BrowseComp、GPQA Diamond、HLE、CharXiv、MMMLU。

  • 输入与 harness:官方发布页没有公开每道题的完整输入、工具 schema、重复次数和完整 harness,不能仅靠发布页重建。

  • 视觉配置:Opus 4.7 支持最长边 2,576 像素、约 3.75MP 的图片;官方将其描述为此前模型的三倍以上分辨率。

结果数据

下表为官方发布页/系统卡所列的关键数值(百分比):

基准Opus 4.7Opus 4.6其他官方对照
SWE-bench Verified87.680.8Gemini 3.1 Pro 80.6
SWE-bench Pro64.353.4GPT-5.4 57.7;Gemini 3.1 Pro 54.2
Terminal-Bench 2.069.465.4GPT-5.4 75.1;Gemini 3.1 Pro 68.5
MCP-Atlas77.375.8GPT-5.4 68.1;Gemini 3.1 Pro 73.9
Finance Agent v1.164.460.1GPT-5.4 Pro 61.5;Gemini 3.1 Pro 59.7
OSWorld-Verified78.072.7GPT-5.4 75.0
BrowseComp79.383.7GPT-5.4 Pro 89.3;Gemini 3.1 Pro 85.9
GPQA Diamond94.291.3GPT-5.4 Pro 94.4;Gemini 3.1 Pro 94.3
HLE(无工具/有工具)46.9 / 54.740.0 / 53.3GPT-5.4 Pro 42.7 / 58.7
CharXiv(无工具/有工具)82.1 / 91.069.1 / 84.7Mythos Preview 86.1 / 93.2

定价保持为每百万输入 token $5、每百万输出 token $25。官方还宣布 API task budgets beta、Claude Code /ultrareview 和 Max auto mode 等配套能力。

结论

在编码、工具调用、电脑操作和图表理解上,4.7 相比 4.6 有清晰增益;SWE-bench Pro、MCP-Atlas 和 CharXiv 的提升尤其支持长程工程/Agent 选型。BrowseComp 从 83.7 降至 79.3,说明研究型网页 Agent 应单独评估。

局限

  • 数字由 Anthropic 提供,官方发布页未提供完整题目、原始输出、重复统计或置信区间;不等同于独立复现实验。

  • 不同基准的工具、harness、effort 和上下文配置可能不同;跨模型分数不是同一生产 Agent 的保证。

  • 早期合作方评价(例如内部 coding benchmark、CursorBench、Finance/Computer-use 案例)属于合作方或 Anthropic 选择性披露,不能替代公开数据集。

  • 更新 tokenizer 和更高 effort 可能提高实际 token 用量;价格不变不代表每项任务成本不变。

复现步骤

  1. 选取与业务一致的仓库 issue、工具调用、截图/图表和网页研究样本,固定模型版本与 effort。

  2. 记录输入 token、输出 token、工具调用次数、超时、失败类型、最终测试结果和人工修订量。

  3. 对 4.6 与 4.7 使用同一 harness、权限、上下文预算和成功标准,至少重复多次。

  4. 分开报告编码/工具/视觉/网页研究四类结果,不用总平均掩盖 BrowseComp 等回归。

  5. 以成本、延迟和任务完成度共同决定是否迁移,并重新调校依赖旧模型宽松解释的 prompt。

原始证据与数据

官方原始页明确给出 4.7 的发布、同价位 $5/$25、xhigh effort、视觉分辨率上限以及上述基准;其中发布页强调 4.7 的网络安全能力低于受限的 Mythos Preview,并加入自动检测/阻断高风险网络安全请求的 safeguards。

来源摘录或观察(仅做合规短引)

官方将 4.7 概括为 “a notable improvement ... in advanced software engineering”,但同页也说明它 “less broadly capable” than Mythos Preview,适用边界应随任务类型记录。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Opus 4.7

在 Tabbit 中使用并对比模型

Claude Opus 4.7

相关测评

媒体Vellum2026-04-16

Claude Opus 4.7:Vellum 跨模型基准与任务选型

社区Reddit r/ClaudeCode

Claude Opus 4.7:Reddit ClaudeCode 发布后长会话体验

Claude Opus 4.7

相关提示词

媒体Anthropic Claude Platform Docs / Anthropic Newsroom2026-04-16

Claude Opus 4.7:努力档位与迁移提示模板

媒体Anthropic 官方文档

Claude Opus 4.7:Anthropic 官方提示词库与最佳模式

媒体ZooClaw AI Help2026-04-07

Claude Opus 4.7:三模式实战策略 - Caveman 提示词、CLAUDE.md 安全护栏与 Git Worktrees

媒体Tenten Learning

Claude Opus 4.7:50+ 社群精华技巧完全攻略