官方发布把 Opus 4.7 定位为面向困难软件工程、长程 Agent 和高分辨率视觉的 4.6 升级,但 BrowseComp 回落和更高 token 消耗说明它不是所有任务的无条件替代品。
Anthropic Newsroom · 查看证据Claude Opus 4.7 · 测评与证据
Claude Opus 4.7,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
Vellum 对官方数据的整理显示 Opus 4.7 的优势集中在 SWE-bench Pro、MCP-Atlas、Finance Agent 和视觉推理,而 BrowseComp 是相对回归点,适合按工作流而非总榜选型。
Vellum · 查看证据社区反馈显示 Opus 4.7 的长会话质量和上下文记忆体感波动很大,既有人报告 debug/网站任务明显提速,也有人遇到过度复杂、遗忘、幻觉与 token/配额压力,因此必须在自己的 Claude Code 会话上验证。
Reddit r/ClaudeCode · 查看证据完整测评与相关内容
精选证据
Claude Opus 4.7:官方编码、视觉与 Agent 基准
官方发布把 Opus 4.7 定位为面向困难软件工程、长程 Agent 和高分辨率视觉的 4.6 升级,但 BrowseComp 回落和更高 token 消耗说明它不是所有任务的无条件替代品。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Opus-4.7;来源日期:2026-04-16。
- harness/任务
- 官方模型:Claude Opus 4.7,与 Opus 4.6、Gemini 3.1 Pro、GPT-5.4 等比较;部分图表还包含 Claude Mythos Preview。;任务/基准:SWE-bench Verified、SWE-bench Pro、Terminal-Bench 2.0、MCP-Atlas、Finance Agent v1.1、OSWorld-Verified、BrowseComp、GPQA Diamond、HLE、CharXiv、MMMLU。
- 样本/缺口
- 局限记录:早期合作方评价(例如内部 coding benchmark、CursorBench、Finance/Computer-use 案例)属于合作方或 Anthropic 选择性披露,不能替代公开数据集。;更新 tokenizer 和更高 effort 可能提高实际 token 用量;价格不变不代表每项任务成本不变。
Claude Opus 4.7:Vellum 跨模型基准与任务选型
Vellum 对官方数据的整理显示 Opus 4.7 的优势集中在 SWE-bench Pro、MCP-Atlas、Finance Agent 和视觉推理,而 BrowseComp 是相对回归点,适合按工作流而非总榜选型。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Opus-4.7;来源日期:2026-04-16。
- harness/任务
- 数据来源:Vellum 根据 Anthropic 官方 system card 和合作方资料整理基准表,并解释各 benchmark 任务含义。;比较模型:Opus 4.7/4.6、Claude Mythos Preview、GPT-5.4/5.4 Pro、Gemini 3.1 Pro。
- 样本/缺口
- 局限记录:官方合作方数字(CursorBench、93-task coding、visual acuity 等)缺少完整任务和原始输出,不能与公开数据等权。;选型结论依赖具体工具、上下文、effort 和 token 预算;文章没有提供统一的 API 参数表。
Claude Opus 4.7:Reddit ClaudeCode 发布后长会话体验
社区反馈显示 Opus 4.7 的长会话质量和上下文记忆体感波动很大,既有人报告 debug/网站任务明显提速,也有人遇到过度复杂、遗忘、幻觉与 token/配额压力,因此必须在自己的 Claude Code 会话上验证。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Opus-4.7;来源日期:2026-08-18。
- harness/任务
- 环境:社区用户的 Claude Code 长会话,具体仓库、模型快照、工具权限、effort、缓存状态和服务端分组未公开。;任务描述:SDR pipeline debug/fix、网站重构、vibe coding、简单修复和长会话代码工作。
- 样本/缺口
- 局限记录:同一帖子中正负反馈并存,且用户可能被不同服务端 rollout、负载或缓存状态分流;不能计算平均质量。;“缓存 bug”“增加 compute”等解释没有官方证据,本文不把它们当作因果结论。
全部来源
全部来源
Claude Opus 4.7:官方编码、视觉与 Agent 基准
官方发布把 Opus 4.7 定位为面向困难软件工程、长程 Agent 和高分辨率视觉的 4.6 升级,但 BrowseComp 回落和更高 token 消耗说明它不是所有任务的无条件替代品。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Opus-4.7;来源日期:2026-04-16。
- harness/任务
- 官方模型:Claude Opus 4.7,与 Opus 4.6、Gemini 3.1 Pro、GPT-5.4 等比较;部分图表还包含 Claude Mythos Preview。;任务/基准:SWE-bench Verified、SWE-bench Pro、Terminal-Bench 2.0、MCP-Atlas、Finance Agent v1.1、OSWorld-Verified、BrowseComp、GPQA Diamond、HLE、CharXiv、MMMLU。
- 样本/缺口
- 局限记录:早期合作方评价(例如内部 coding benchmark、CursorBench、Finance/Computer-use 案例)属于合作方或 Anthropic 选择性披露,不能替代公开数据集。;更新 tokenizer 和更高 effort 可能提高实际 token 用量;价格不变不代表每项任务成本不变。
Claude Opus 4.7:Vellum 跨模型基准与任务选型
Vellum 对官方数据的整理显示 Opus 4.7 的优势集中在 SWE-bench Pro、MCP-Atlas、Finance Agent 和视觉推理,而 BrowseComp 是相对回归点,适合按工作流而非总榜选型。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Opus-4.7;来源日期:2026-04-16。
- harness/任务
- 数据来源:Vellum 根据 Anthropic 官方 system card 和合作方资料整理基准表,并解释各 benchmark 任务含义。;比较模型:Opus 4.7/4.6、Claude Mythos Preview、GPT-5.4/5.4 Pro、Gemini 3.1 Pro。
- 样本/缺口
- 局限记录:官方合作方数字(CursorBench、93-task coding、visual acuity 等)缺少完整任务和原始输出,不能与公开数据等权。;选型结论依赖具体工具、上下文、effort 和 token 预算;文章没有提供统一的 API 参数表。
Claude Opus 4.7:Reddit ClaudeCode 发布后长会话体验
社区反馈显示 Opus 4.7 的长会话质量和上下文记忆体感波动很大,既有人报告 debug/网站任务明显提速,也有人遇到过度复杂、遗忘、幻觉与 token/配额压力,因此必须在自己的 Claude Code 会话上验证。
待验证:本次未能重新核实原文。
- 模型/版本
- Claude-Opus-4.7;来源日期:2026-08-18。
- harness/任务
- 环境:社区用户的 Claude Code 长会话,具体仓库、模型快照、工具权限、effort、缓存状态和服务端分组未公开。;任务描述:SDR pipeline debug/fix、网站重构、vibe coding、简单修复和长会话代码工作。
- 样本/缺口
- 局限记录:同一帖子中正负反馈并存,且用户可能被不同服务端 rollout、负载或缓存状态分流;不能计算平均质量。;“缓存 bug”“增加 compute”等解释没有官方证据,本文不把它们当作因果结论。