Tabbit博客

Claude Opus 4.7:改了什么、适合什么,以及何时迁移

用来源核对 Claude Opus 4.7 的 4.6 升级、基准分化、API 获取、成本、生命周期与迁移检查。

本文目录
  1. 先看结论
  2. Claude Opus 4.7 规格速览
  3. 4.6 到 4.7:真正有变化的地方
  4. 基准表要按任务读
  5. 获取、价格与 token 边界
  6. 迁移前要验证的风险
  7. 社区原声:分歧本身就是信号
  8. 生命周期与迁移清单
  9. Tabbit 能验证什么
  10. Verdict
  11. 来源

Claude Opus 4.7 可以概括为一次有重点的 4.6 升级:编码、工具调用、电脑操作和视觉能力更强,但公开 BrowseComp 结果反而下降。它不是所有任务都胜出的通用冠军,也不再是新项目默认的 Opus 目标。

这是 2026 年 9 月 20 日的判断锚点。Anthropic 实时模型页将 claude-opus-4-7 标为 Active(legacy),API 标准价格仍为每百万输入 token 5 美元、输出 token 25 美元,同时建议考虑 Opus 5。新项目要同时回答两个问题:4.7 是否适合当前工作负载,以及今天是否值得避开未来的迁移成本?本文没有登录后的 Tabbit 实测。

先看结论

  • 公开证据最支持困难编码、工具编排、桌面操作和图表/界面理解。

  • 当前目录列出 1M 上下文、128K 最大输出、自适应思考、默认 high effort 和 2026 年 1 月知识截止时间。

  • SWE-bench Verified 从 80.8% 升到 87.6%,BrowseComp 则从 83.7% 降到 79.3%。

  • Anthropic 说明 Claude 4.7 之后使用新版 tokenizer,同样文本大约会产生 30% 更多 token;单价不变,任务成本未必不变。

  • 4.7 仍可通过 Anthropic API 及目录列出的云平台使用,但新生产集成应把 Opus 5 纳入对照。

Claude Opus 4.7 规格速览

Claude Opus 4.7 模型资源适合查看逐条提示词和测评来源;本文专注版本、获取和生命周期。

问题2026-09-20 核对的目录信息选型边界
API 模型 IDclaude-opus-4-7在日志中固定完整 ID,供应商别名可能不同。
发布/状态2026-04-16 / Active(legacy)能用不等于当前家族端点。
上下文/最大输出1M / 128K token目录上限,客户端和供应商可能更小。
输入/输出文本和图片 / 文本工具权限取决于路由和 harness。
思考/默认 effortAdaptive / high要一起比较 effort、token 和完成质量。
标准 API 价格输入 $5、输出 $25 / MTok缓存、Batch、云和订阅单独计算。
目录列出的平台Claude API、Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS地区、配额和工具仍需逐路由确认。
退休边界不早于 2027-04-16“不早于”不是确定的最终日期。

提示词资源测评资源保留来源级细节,不应被理解为生产成功率。

4.6 到 4.7:真正有变化的地方

Anthropic 将 4.7 定位为更擅长规划、使用工具并检查结果的工程模型。发布页还把图片最长边提高到 2,576 像素,约 3.75MP;这对密集图表和界面截图比对普通图片描述更有意义。

公开发布信息和Vellum 的基准解读共同支持四点:困难编码更强,多轮工具调用有增益,视觉推理提升明显;网络安全请求则有更严格的自动拦截。它们不支持“4.7 各方面都更好”。

基准表要按任务读

下表是 Anthropic 发布结果及 Vellum 对同一证据的整理,不是 Tabbit 测试,也不是你的应用成功率。

基准Opus 4.6Opus 4.7选择含义
SWE-bench Verified80.8%87.6%公开 issue 修复信号上升。
SWE-bench Pro53.4%64.3%多语言困难版本提升更大。
Terminal-Bench 2.065.4%69.4%命令行任务结果提升。
MCP-Atlas75.8%77.3%多轮工具调用小幅提升。
OSWorld-Verified72.7%78.0%电脑操作结果提升。
BrowseComp83.7%79.3%网页研究信号回落。
CharXiv,无工具/有工具69.1% / 84.7%82.1% / 91.0%视觉推理是最明显的增益。

发布页没有公开每道题的完整输入、工具 schema、重复次数和置信区间。因此合理结论是:代码和工具型任务值得试用,研究 Agent 仍要保留引用与矛盾核查。

获取、价格与 token 边界

Anthropic 定价文档当前列出输入 $5、输出 $25 / MTok;5 分钟缓存写入 $6.25、1 小时缓存写入 $10、缓存命中 $0.50,Batch API 的输入和输出有 50% 折扣。这些是 API 规则,不是 Claude.ai 订阅报价。

Anthropic 还说明 Claude 4.7 及之后版本采用新版 tokenizer,同样文本大约增加 30% token,具体取决于内容和工作负载。把这个数字放在不变的标价旁,才是更准确的成本判断。

路由已公开的边界仍需确认
Claude APIclaude-opus-4-7、标准 token 价、自适应思考组织限额、缓存、数据驻留和实际 token。
Bedrock / Google Cloud / Microsoft Foundry目录列出对应模型 ID地区、端点溢价、配额、工具和云账单。
Claude 产品 / Claude Code产品访问与 API 分开计划、用量池、选择器和 effort。
Tabbit Browser可能提供浏览器级工作流入口选择器、有效上下文、延迟、成本和工具权限,本文未核验。

Claude Opus 4.8 总览解释下一版本的生命周期;Claude Sonnet 5 总览则用于比较低成本路线。不要把 API 单价和订阅席位或 Tabbit 可用性混在一起。

迁移前要验证的风险

  • 自适应思考和高 effort 可能提高困难任务质量,也可能增加 token、等待和限额消耗。

  • Reddit 重度用户一方面称 4.7 更能遵循指令、代码更好,另一方面认为它比 4.6 更不稳定、更需要详细提示。这是个人工作流观察,不是普遍回归。

  • 另一条讨论认为 4.7 的计划输出过密,阅读本身拖慢决策。评估时应记录审阅时间,而不是只看代码是否通过。

  • 研究型 Agent 要特别留意 BrowseComp 回落。编码高分不能替代来源、引用和矛盾检查。

关于Agent 浏览器,模型的工具能力和浏览器的实际权限是两件事;不可逆的终端或页面操作仍应要求人工确认。浏览器自动化也不等于模型 API 已获得相同权限。

社区原声:分歧本身就是信号

三条可访问的 Reddit 原帖给出的不是统一评分,而是工作流边界。一位重度 Claude Code 用户写道,4.7 “better at instruction following”,但 “less consistent than 4.6”;另一位在路径规划评审中觉得输出难以理解;2026 年 8 月 27 日的一次代码审查对照则报告 4.7 的 8 条判断有 6 条被代码核实,另有 1 条夸大、1 条错误。

原文见重度使用对比可读性讨论代码审查对照。这些是个人报告,不是受控实验;本文没有合格的社区截图证据。

生命周期与迁移清单

Opus 5 迁移指南明确写道,从 4.7 或更早版本迁移不能只替换模型名。旧的采样与 prefill、手动 thinking、新 tokenizer 和响应块处理都要检查;工具循环还要原样保留 thinking blocks。

执行迁移时:固定 4.7 和目标版本的模型 ID;记录 effort、max_tokens、输入输出 token、缓存、工具调用、延迟和重试;分别跑编码、工具、视觉和网页研究任务;最后验证 adapter 和回滚路径。

目标先评估什么原因
困难仓库修复、工具编排4.7 与 Opus 5 并跑4.7 的公开增益最集中于此,但生命周期要求向前看。
密集截图、图表和 UI Agent视觉验收集CharXiv、OSWorld 上升,但实际 UI 权限仍不同。
网页研究 Agent带引用检查的对照任务BrowseComp 回落,不能用编码分数代替研究质量。
日常低成本编码Sonnet 5参看Sonnet 5 页面的独立价格与 effort 证据。
新的高风险长程项目Opus 5 或 Fable 5.1 试点参看Fable 5.1 分析,先评估当前路线。

Tabbit 能验证什么

Tabbit Browser 适合回答“能否在真实页面中查看来源并审阅动作结果”,而不只是“API 会生成什么”。Tabbit Browser 总览AI 浏览器说明浏览器自动化指南描述的是客户端工作流边界。

本文没有完成登录后的 Opus 4.7 任务,因此不宣称它一定出现在选择器中,也不宣称浏览器暴露 1M 上下文或与 Anthropic API 同样的价格。若你的账户能看到它,请先执行一个可回滚的研究任务,保存来源并按书面验收条件判断。

Tabbit Browser

Verdict

Claude Opus 4.7 在困难编码、工具使用和视觉推理上是一次有意义的 4.6 升级,但 BrowseComp 回落、新 tokenizer 的成本边界和社区分歧都不支持“全部升级”。它仍值得做受控试点;新生产项目则应现在就把 Opus 5 纳入对照,并保留回滚路径。

来源

主要来源包括 Anthropic 的发布公告Opus 4.7 模型页定价文档生命周期文档Opus 5 迁移指南系统卡。独立解读为Vellum 基准说明,社区链接见上文。

常见问题

Claude Opus 4.7 是什么?

Claude Opus 4.7 是 Anthropic 于 2026 年 4 月发布的 Opus 版本,重点面向困难软件工程、工具型 Agent 与高分辨率视觉任务。当前模型页列出 claude-opus-4-7、1M 上下文、128K 最大输出和自适应思考。

Claude Opus 4.7 相比 4.6 改了什么?

Anthropic 报告了编码、工具调用、电脑操作和视觉推理提升,但公开表格中的 BrowseComp 低于 4.6。新版 tokenizer 与 effort 设置也会影响任务成本,因此应在固定任务上迁移。

Claude Opus 4.7 多少钱?

当前 Claude Platform 页面列出的 API 价格是每百万输入 token 5 美元、每百万输出 token 25 美元,缓存与 Batch 另计。API 单价不等于 Claude 订阅、云厂商账单或 Tabbit 的可用性。

Claude Opus 4.7 还能用吗?

可以,实时模型页标为 Active(legacy),并写明最早不会早于 2027 年 4 月 16 日退休。Anthropic 同时建议考虑 Opus 5,因此新集成应先比较新路线。

应该从 Opus 4.7 迁移到 Opus 5 吗?

先用固定验收集测试,再检查 thinking 默认值、max_tokens、响应块处理、工具循环、tokenizer 变化和安全 fallback。生产迁移不能只替换模型 ID。

能在 Tabbit 中测试 Claude Opus 4.7 吗?

本文没有运行登录后的 Tabbit Opus 4.7 任务,因此不确认选择器、有效上下文、延迟、成本或工具权限。请在自己的实时账户中检查,并用一个可回滚任务验证。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。