Claude Opus 4.7 可以概括为一次有重点的 4.6 升级:编码、工具调用、电脑操作和视觉能力更强,但公开 BrowseComp 结果反而下降。它不是所有任务都胜出的通用冠军,也不再是新项目默认的 Opus 目标。
这是 2026 年 9 月 20 日的判断锚点。Anthropic 实时模型页将 claude-opus-4-7 标为 Active(legacy),API 标准价格仍为每百万输入 token 5 美元、输出 token 25 美元,同时建议考虑 Opus 5。新项目要同时回答两个问题:4.7 是否适合当前工作负载,以及今天是否值得避开未来的迁移成本?本文没有登录后的 Tabbit 实测。
先看结论
公开证据最支持困难编码、工具编排、桌面操作和图表/界面理解。
当前目录列出 1M 上下文、128K 最大输出、自适应思考、默认
higheffort 和 2026 年 1 月知识截止时间。SWE-bench Verified 从 80.8% 升到 87.6%,BrowseComp 则从 83.7% 降到 79.3%。
Anthropic 说明 Claude 4.7 之后使用新版 tokenizer,同样文本大约会产生 30% 更多 token;单价不变,任务成本未必不变。
4.7 仍可通过 Anthropic API 及目录列出的云平台使用,但新生产集成应把 Opus 5 纳入对照。
Claude Opus 4.7 规格速览
Claude Opus 4.7 模型资源适合查看逐条提示词和测评来源;本文专注版本、获取和生命周期。
| 问题 | 2026-09-20 核对的目录信息 | 选型边界 |
|---|---|---|
| API 模型 ID | claude-opus-4-7 | 在日志中固定完整 ID,供应商别名可能不同。 |
| 发布/状态 | 2026-04-16 / Active(legacy) | 能用不等于当前家族端点。 |
| 上下文/最大输出 | 1M / 128K token | 目录上限,客户端和供应商可能更小。 |
| 输入/输出 | 文本和图片 / 文本 | 工具权限取决于路由和 harness。 |
| 思考/默认 effort | Adaptive / high | 要一起比较 effort、token 和完成质量。 |
| 标准 API 价格 | 输入 $5、输出 $25 / MTok | 缓存、Batch、云和订阅单独计算。 |
| 目录列出的平台 | Claude API、Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS | 地区、配额和工具仍需逐路由确认。 |
| 退休边界 | 不早于 2027-04-16 | “不早于”不是确定的最终日期。 |
提示词资源和测评资源保留来源级细节,不应被理解为生产成功率。
4.6 到 4.7:真正有变化的地方
Anthropic 将 4.7 定位为更擅长规划、使用工具并检查结果的工程模型。发布页还把图片最长边提高到 2,576 像素,约 3.75MP;这对密集图表和界面截图比对普通图片描述更有意义。
公开发布信息和Vellum 的基准解读共同支持四点:困难编码更强,多轮工具调用有增益,视觉推理提升明显;网络安全请求则有更严格的自动拦截。它们不支持“4.7 各方面都更好”。
基准表要按任务读
下表是 Anthropic 发布结果及 Vellum 对同一证据的整理,不是 Tabbit 测试,也不是你的应用成功率。
| 基准 | Opus 4.6 | Opus 4.7 | 选择含义 |
|---|---|---|---|
| SWE-bench Verified | 80.8% | 87.6% | 公开 issue 修复信号上升。 |
| SWE-bench Pro | 53.4% | 64.3% | 多语言困难版本提升更大。 |
| Terminal-Bench 2.0 | 65.4% | 69.4% | 命令行任务结果提升。 |
| MCP-Atlas | 75.8% | 77.3% | 多轮工具调用小幅提升。 |
| OSWorld-Verified | 72.7% | 78.0% | 电脑操作结果提升。 |
| BrowseComp | 83.7% | 79.3% | 网页研究信号回落。 |
| CharXiv,无工具/有工具 | 69.1% / 84.7% | 82.1% / 91.0% | 视觉推理是最明显的增益。 |
发布页没有公开每道题的完整输入、工具 schema、重复次数和置信区间。因此合理结论是:代码和工具型任务值得试用,研究 Agent 仍要保留引用与矛盾核查。
获取、价格与 token 边界
Anthropic 定价文档当前列出输入 $5、输出 $25 / MTok;5 分钟缓存写入 $6.25、1 小时缓存写入 $10、缓存命中 $0.50,Batch API 的输入和输出有 50% 折扣。这些是 API 规则,不是 Claude.ai 订阅报价。
Anthropic 还说明 Claude 4.7 及之后版本采用新版 tokenizer,同样文本大约增加 30% token,具体取决于内容和工作负载。把这个数字放在不变的标价旁,才是更准确的成本判断。
| 路由 | 已公开的边界 | 仍需确认 |
|---|---|---|
| Claude API | claude-opus-4-7、标准 token 价、自适应思考 | 组织限额、缓存、数据驻留和实际 token。 |
| Bedrock / Google Cloud / Microsoft Foundry | 目录列出对应模型 ID | 地区、端点溢价、配额、工具和云账单。 |
| Claude 产品 / Claude Code | 产品访问与 API 分开 | 计划、用量池、选择器和 effort。 |
| Tabbit Browser | 可能提供浏览器级工作流入口 | 选择器、有效上下文、延迟、成本和工具权限,本文未核验。 |
Claude Opus 4.8 总览解释下一版本的生命周期;Claude Sonnet 5 总览则用于比较低成本路线。不要把 API 单价和订阅席位或 Tabbit 可用性混在一起。
迁移前要验证的风险
自适应思考和高 effort 可能提高困难任务质量,也可能增加 token、等待和限额消耗。
Reddit 重度用户一方面称 4.7 更能遵循指令、代码更好,另一方面认为它比 4.6 更不稳定、更需要详细提示。这是个人工作流观察,不是普遍回归。
另一条讨论认为 4.7 的计划输出过密,阅读本身拖慢决策。评估时应记录审阅时间,而不是只看代码是否通过。
研究型 Agent 要特别留意 BrowseComp 回落。编码高分不能替代来源、引用和矛盾检查。
关于Agent 浏览器,模型的工具能力和浏览器的实际权限是两件事;不可逆的终端或页面操作仍应要求人工确认。浏览器自动化也不等于模型 API 已获得相同权限。
社区原声:分歧本身就是信号
三条可访问的 Reddit 原帖给出的不是统一评分,而是工作流边界。一位重度 Claude Code 用户写道,4.7 “better at instruction following”,但 “less consistent than 4.6”;另一位在路径规划评审中觉得输出难以理解;2026 年 8 月 27 日的一次代码审查对照则报告 4.7 的 8 条判断有 6 条被代码核实,另有 1 条夸大、1 条错误。
原文见重度使用对比、可读性讨论和代码审查对照。这些是个人报告,不是受控实验;本文没有合格的社区截图证据。
生命周期与迁移清单
Opus 5 迁移指南明确写道,从 4.7 或更早版本迁移不能只替换模型名。旧的采样与 prefill、手动 thinking、新 tokenizer 和响应块处理都要检查;工具循环还要原样保留 thinking blocks。
执行迁移时:固定 4.7 和目标版本的模型 ID;记录 effort、max_tokens、输入输出 token、缓存、工具调用、延迟和重试;分别跑编码、工具、视觉和网页研究任务;最后验证 adapter 和回滚路径。
| 目标 | 先评估什么 | 原因 |
|---|---|---|
| 困难仓库修复、工具编排 | 4.7 与 Opus 5 并跑 | 4.7 的公开增益最集中于此,但生命周期要求向前看。 |
| 密集截图、图表和 UI Agent | 视觉验收集 | CharXiv、OSWorld 上升,但实际 UI 权限仍不同。 |
| 网页研究 Agent | 带引用检查的对照任务 | BrowseComp 回落,不能用编码分数代替研究质量。 |
| 日常低成本编码 | Sonnet 5 | 参看Sonnet 5 页面的独立价格与 effort 证据。 |
| 新的高风险长程项目 | Opus 5 或 Fable 5.1 试点 | 参看Fable 5.1 分析,先评估当前路线。 |
Tabbit 能验证什么
Tabbit Browser 适合回答“能否在真实页面中查看来源并审阅动作结果”,而不只是“API 会生成什么”。Tabbit Browser 总览、AI 浏览器说明和浏览器自动化指南描述的是客户端工作流边界。
本文没有完成登录后的 Opus 4.7 任务,因此不宣称它一定出现在选择器中,也不宣称浏览器暴露 1M 上下文或与 Anthropic API 同样的价格。若你的账户能看到它,请先执行一个可回滚的研究任务,保存来源并按书面验收条件判断。
Verdict
Claude Opus 4.7 在困难编码、工具使用和视觉推理上是一次有意义的 4.6 升级,但 BrowseComp 回落、新 tokenizer 的成本边界和社区分歧都不支持“全部升级”。它仍值得做受控试点;新生产项目则应现在就把 Opus 5 纳入对照,并保留回滚路径。
来源
主要来源包括 Anthropic 的发布公告、Opus 4.7 模型页、定价文档、生命周期文档、Opus 5 迁移指南和系统卡。独立解读为Vellum 基准说明,社区链接见上文。
常见问题
Claude Opus 4.7 是什么?
Claude Opus 4.7 是 Anthropic 于 2026 年 4 月发布的 Opus 版本,重点面向困难软件工程、工具型 Agent 与高分辨率视觉任务。当前模型页列出 claude-opus-4-7、1M 上下文、128K 最大输出和自适应思考。
Claude Opus 4.7 相比 4.6 改了什么?
Anthropic 报告了编码、工具调用、电脑操作和视觉推理提升,但公开表格中的 BrowseComp 低于 4.6。新版 tokenizer 与 effort 设置也会影响任务成本,因此应在固定任务上迁移。
Claude Opus 4.7 多少钱?
当前 Claude Platform 页面列出的 API 价格是每百万输入 token 5 美元、每百万输出 token 25 美元,缓存与 Batch 另计。API 单价不等于 Claude 订阅、云厂商账单或 Tabbit 的可用性。
Claude Opus 4.7 还能用吗?
可以,实时模型页标为 Active(legacy),并写明最早不会早于 2027 年 4 月 16 日退休。Anthropic 同时建议考虑 Opus 5,因此新集成应先比较新路线。
应该从 Opus 4.7 迁移到 Opus 5 吗?
先用固定验收集测试,再检查 thinking 默认值、max_tokens、响应块处理、工具循环、tokenizer 变化和安全 fallback。生产迁移不能只替换模型 ID。
能在 Tabbit 中测试 Claude Opus 4.7 吗?
本文没有运行登录后的 Tabbit Opus 4.7 任务,因此不确认选择器、有效上下文、延迟、成本或工具权限。请在自己的实时账户中检查,并用一个可回滚任务验证。