官方发布把 Opus 4.7 定位为面向困难软件工程、长程 Agent 和高分辨率视觉的 4.6 升级,但 BrowseComp 回落和更高 token 消耗说明它不是所有任务的无条件替代品。
适合的任务:复杂多语言代码库、工具编排、电脑操作、金融/专业知识工作、高分辨率图表和界面理解。
不适合的任务:重度网页研究且以 BrowseComp 类能力为主的 Agent;低成本短任务也不应默认开启 xhigh/max。
适用的模型版本:claude-opus-4-7,官方一般可用版本。
适用的客户端、Agent 或 API:Claude 产品、Anthropic API、Amazon Bedrock、Google Vertex AI、Microsoft Foundry。
推荐的推理档位和参数:官方建议代码/Agent 从 high 或 xhigh 开始;API 默认 high;同一任务的 effort、token budget、工具 harness 应记录下来。
官方模型:Claude Opus 4.7,与 Opus 4.6、Gemini 3.1 Pro、GPT-5.4 等比较;部分图表还包含 Claude Mythos Preview。
任务/基准:SWE-bench Verified、SWE-bench Pro、Terminal-Bench 2.0、MCP-Atlas、Finance Agent v1.1、OSWorld-Verified、BrowseComp、GPQA Diamond、HLE、CharXiv、MMMLU。
输入与 harness:官方发布页没有公开每道题的完整输入、工具 schema、重复次数和完整 harness,不能仅靠发布页重建。
视觉配置:Opus 4.7 支持最长边 2,576 像素、约 3.75MP 的图片;官方将其描述为此前模型的三倍以上分辨率。
下表为官方发布页/系统卡所列的关键数值(百分比):
| 基准 | Opus 4.7 | Opus 4.6 | 其他官方对照 |
|---|---|---|---|
| SWE-bench Verified | 87.6 | 80.8 | Gemini 3.1 Pro 80.6 |
| SWE-bench Pro | 64.3 | 53.4 | GPT-5.4 57.7;Gemini 3.1 Pro 54.2 |
| Terminal-Bench 2.0 | 69.4 | 65.4 | GPT-5.4 75.1;Gemini 3.1 Pro 68.5 |
| MCP-Atlas | 77.3 | 75.8 | GPT-5.4 68.1;Gemini 3.1 Pro 73.9 |
| Finance Agent v1.1 | 64.4 | 60.1 | GPT-5.4 Pro 61.5;Gemini 3.1 Pro 59.7 |
| OSWorld-Verified | 78.0 | 72.7 | GPT-5.4 75.0 |
| BrowseComp | 79.3 | 83.7 | GPT-5.4 Pro 89.3;Gemini 3.1 Pro 85.9 |
| GPQA Diamond | 94.2 | 91.3 | GPT-5.4 Pro 94.4;Gemini 3.1 Pro 94.3 |
| HLE(无工具/有工具) | 46.9 / 54.7 | 40.0 / 53.3 | GPT-5.4 Pro 42.7 / 58.7 |
| CharXiv(无工具/有工具) | 82.1 / 91.0 | 69.1 / 84.7 | Mythos Preview 86.1 / 93.2 |
定价保持为每百万输入 token $5、每百万输出 token $25。官方还宣布 API task budgets beta、Claude Code /ultrareview 和 Max auto mode 等配套能力。
在编码、工具调用、电脑操作和图表理解上,4.7 相比 4.6 有清晰增益;SWE-bench Pro、MCP-Atlas 和 CharXiv 的提升尤其支持长程工程/Agent 选型。BrowseComp 从 83.7 降至 79.3,说明研究型网页 Agent 应单独评估。
数字由 Anthropic 提供,官方发布页未提供完整题目、原始输出、重复统计或置信区间;不等同于独立复现实验。
不同基准的工具、harness、effort 和上下文配置可能不同;跨模型分数不是同一生产 Agent 的保证。
早期合作方评价(例如内部 coding benchmark、CursorBench、Finance/Computer-use 案例)属于合作方或 Anthropic 选择性披露,不能替代公开数据集。
更新 tokenizer 和更高 effort 可能提高实际 token 用量;价格不变不代表每项任务成本不变。
选取与业务一致的仓库 issue、工具调用、截图/图表和网页研究样本,固定模型版本与 effort。
记录输入 token、输出 token、工具调用次数、超时、失败类型、最终测试结果和人工修订量。
对 4.6 与 4.7 使用同一 harness、权限、上下文预算和成功标准,至少重复多次。
分开报告编码/工具/视觉/网页研究四类结果,不用总平均掩盖 BrowseComp 等回归。
以成本、延迟和任务完成度共同决定是否迁移,并重新调校依赖旧模型宽松解释的 prompt。
官方原始页明确给出 4.7 的发布、同价位 $5/$25、xhigh effort、视觉分辨率上限以及上述基准;其中发布页强调 4.7 的网络安全能力低于受限的 Mythos Preview,并加入自动检测/阻断高风险网络安全请求的 safeguards。
官方将 4.7 概括为 “a notable improvement ... in advanced software engineering”,但同页也说明它 “less broadly capable” than Mythos Preview,适用边界应随任务类型记录。
Claude Opus 4.7