Vellum 对官方数据的整理显示 Opus 4.7 的优势集中在 SWE-bench Pro、MCP-Atlas、Finance Agent 和视觉推理,而 BrowseComp 是相对回归点,适合按工作流而非总榜选型。
适合的任务:真实仓库修复、多工具编排、财务分析、桌面操作和复杂图表理解。
不适合的任务:主要做多页面网页检索/综合,或 token 预算严格且尚未重新测量 4.7 tokenizer 的应用。
适用的模型版本:Claude Opus 4.7。
适用的客户端、Agent 或 API:Vellum 分析与 Anthropic API/平台;文章不是某一客户生产流量的控制实验。
推荐的推理档位和参数:按 Anthropic 建议从 high/xhigh 开始;文章本身没有独立公开统一 effort 配置。
数据来源:Vellum 根据 Anthropic 官方 system card 和合作方资料整理基准表,并解释各 benchmark 任务含义。
比较模型:Opus 4.7/4.6、Claude Mythos Preview、GPT-5.4/5.4 Pro、Gemini 3.1 Pro。
原始输入与 harness:Vellum 没有公开重新运行这些 benchmark 的完整输入、代码或运行配置;属于数据解读与任务选型分析。
| 基准 | Opus 4.7 | Opus 4.6 | 关键对照 |
|---|---|---|---|
| SWE-bench Verified | 87.6% | 80.8% | Gemini 3.1 Pro 80.6% |
| SWE-bench Pro | 64.3% | 53.4% | GPT-5.4 57.7%;Gemini 3.1 Pro 54.2% |
| Terminal-Bench 2.0 | 69.4% | 65.4% | GPT-5.4 75.1%;Gemini 3.1 Pro 68.5% |
| MCP-Atlas | 77.3% | 75.8% | GPT-5.4 68.1%;Gemini 3.1 Pro 73.9% |
| Finance Agent v1.1 | 64.4% | 60.1% | GPT-5.4 Pro 61.5%;Gemini 3.1 Pro 59.7% |
| OSWorld-Verified | 78.0% | 72.7% | GPT-5.4 75.0% |
| BrowseComp | 79.3% | 83.7% | GPT-5.4 Pro 89.3%;Gemini 3.1 Pro 85.9% |
| GPQA Diamond | 94.2% | 91.3% | Gemini 3.1 Pro 94.3% |
| CharXiv 无工具/有工具 | 82.1% / 91.0% | 69.1% / 84.7% | Mythos Preview 86.1% / 93.2% |
Vellum 还记录官方迁移提示:4.7 的 tokenizer 可能让同样文本变成约 1.0–1.35× token;高 effort 的长 Agent turn 也可能增加输出 token。
如果工作流的瓶颈是复杂代码、工具调用、屏幕理解或专业分析,Opus 4.7 的提升值得进行 A/B 迁移;如果瓶颈是深度网页搜索,79.3% 的 BrowseComp 低于 4.6 的 83.7%,应考虑保留 4.6 或比较其他模型。
文章主要是官方结果的二次解释,不是 Vellum 自己按同一 harness 复跑的独立 benchmark。
官方合作方数字(CursorBench、93-task coding、visual acuity 等)缺少完整任务和原始输出,不能与公开数据等权。
选型结论依赖具体工具、上下文、effort 和 token 预算;文章没有提供统一的 API 参数表。
从文章列出的四类任务各选业务样本:仓库 issue、多工具流程、视觉图表、网页研究。
固定相同 prompt、工具 schema、权限、effort 和上下文上限,分别运行 Opus 4.6 与 4.7。
记录任务成功、测试通过、工具错误、token、延迟、事实错误和人工修订量。
单独查看 BrowseComp 类研究任务,避免编码高分把网页研究回归平均掉。
用真实流量估算 tokenizer 变化后的每任务成本,再决定升级或分流。
Vellum 原文逐项解释 SWE-bench Pro、MCP-Atlas、OSWorld、BrowseComp、GPQA、HLE 和 CharXiv,并明确指出 BrowseComp 从 83.7% 降至 79.3%;其余表格数据来自 Anthropic system card 的报告。
Vellum 的总判断是 “a focused, high-performance upgrade”,而不是全面横扫;这个判断与表中编码/工具提升、BrowseComp 回落的分化相符。
Claude Opus 4.7