Claude Opus 4.8 是 Anthropic 于 2026 年 5 月发布的模型,面向复杂编码、浏览器智能体、工具调用和长上下文知识工作。它仍适合受控试用,但有一个重要条件:截至 2026 年 9 月 20 日,Claude Platform 已把它标为 Legacy,并建议考虑 Opus 5。
这就是今天的决策锚点。平台仍列出与 Opus 4.7 相同的标准价格——输入每百万 token 5 美元、输出 25 美元——以及 1M 上下文、128K 输出和 adaptive thinking。新集成需要同时问两个问题:4.8 能否解决任务,以及它的支持周期是否值得采用?先看 Claude Opus 4.8 模型资源,再确认实际入口。
关键结论
4.8 是 4.7 的后继版本,加入 effort 控制、Fast Mode 和 Claude Code 的 Dynamic Workflows。
官方目录列出
claude-opus-4-8、1M 上下文、128K 输出、adaptive thinking、默认 high effort 和 2026 年 1 月知识截止。独立早期评测在一个综合指数中领先,但引用的 Terminal-Bench 2.1 中 GPT-5.5 更高;必须保留 harness。
更高 effort、思考、长上下文和重试会改变单任务费用;$5/$25 不是任务预算。
它仍可用,但新生产集成应先比较 Opus 5 并记录迁移方案。
规格与获取
| 项目 | 2026-09-20 目录快照 | 决策边界 |
|---|---|---|
| API ID | claude-opus-4-8 | 在日志中固定完整 ID,提供商别名可能不同。 |
| 发布与状态 | 2026-05-28;Active (legacy) | 可用不等于当前家族终点。 |
| 上下文 / 最大输出 | 1M / 128K token | 目录上限,客户端或提供商可能更小。 |
| 输入 / 输出 | 文本、图片 / 文本 | 工具和浏览器权限取决于入口。 |
| thinking / effort | adaptive;默认 high;支持 extra/xhigh、max | 应按任务比较 effort。 |
| 标准 API 价格 | 输入 $5 / 输出 $25 / MTok | 缓存、Batch、Fast Mode、提供商和计划另计。 |
| 知识截止 | 2026 年 1 月 | 当前事实需要检索或来源核对。 |
| 退役 | 不早于 2027-05-28 | 新项目应问是否直接选择 Opus 5。 |
提示资源和评测资源适合查看原始条目,本文集中讨论生命周期与工作负载选择。
与 Opus 4.7 的变化
Anthropic 强调 4.8 在判断、未完成工作自报、指令遵循和工具效率上的改进,并称在其评估中,4.8 让代码缺陷未经提示通过的概率约低四倍。这是官方评估,不代表你的仓库无需测试。
三个产品变化值得关注:
Effort 控制:默认 high,困难或异步任务可用 extra/
xhigh和 max;低 effort 更快、消耗速率限制更慢。Fast Mode:官方描述同一模型约 2.5 倍速度,价格为输入 $10、输出 $50 / 百万 token。这是路线和价格选择,不是新模型 ID。
Dynamic Workflows:Claude Code Enterprise、Team 和 Max 的研究预览可规划大型任务、并行运行数百个子智能体并核验结果。
独立报告并非单向胜利。一位长期 Reddit 用户称 4.8 在 Playwright、Cloud CLI 和 Kubernetes CLI 上是明显更新,但在某些超大代码库中 GPT-5.5 更自主;另一条早期讨论则称 4.8 在修复坏代码时给出快速而自信但有问题的答案(来源;讨论)。这些只证明具体场景体验。
基准与安全:先看 harness
独立早期汇总给出混合结果:Artificial Analysis 综合 Intelligence Index 为 61.4,GPT-5.5 为 60.2;但引用的 Terminal-Bench 2.1 中,4.8 为 74.6,GPT-5.5 为 78.2。同一汇总的 SWE-Bench Pro 为 69.2,对 Opus 4.7 的 64.3;Finance Agent v2 为 53.9,低于 Gemini 3.5 Flash 的 57.9。
这些数据来自不同任务、日期和 harness。另一篇独立评测说明 Anthropic 的 SWE-bench 数字没有被独立复现,而它引用 Artificial Analysis 在 2026-08-03 的独立运行是 84.6% Terminal-Bench 2.1。不能把 74.6 和 84.6 合并成一个分数。
独立红队研究在 7,826 个有害意图和四类自动越狱攻击中,报告最强的 tree-of-attacks 对 Opus 4.8 的 11.5% 意图实现了突破。这是受控对抗实验,不是日常失败率,但说明模型分数不能替代应用层控制。本文不复现有害提示。
生命周期、价格和入口
当前平台页仍列出 4.8,但标为 legacy,并链接迁移 Opus 5;退役不早于 2027-05-28。Anthropic 列出 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS。Claude.ai 与 Claude Code 计划有自己的选择器、额度和功能门槛,不能从 API 目录反推。
| 入口或功能 | 已发布边界 | 不代表 |
|---|---|---|
| Claude API | claude-opus-4-8,$5/$25 / MTok | 订阅或浏览器暴露相同限制。 |
| AWS / Google Cloud / Microsoft Foundry | 提供商自己的 ID 和条款 | 地区、额度和工具与 Anthropic 相同。 |
| Claude.ai / Claude Code | effort 和产品访问 | 订阅包含 API 额度。 |
| Fast Mode | 研究预览,约 2.5 倍速度,$10/$50 / MTok | 所有计划或提供商都有。 |
| Prompt caching | 缓存写入和读取单独计价 | 长任务自动便宜。 |
| Batch API | 目录列出输入和输出 50% 折扣 | 交互式工具任务遵循 Batch 语义。 |
| Dynamic Workflows | Enterprise、Team、Max 的 Claude Code 研究预览 | 所有用户都能运行数百智能体。 |
价格只是使用边界,不是预测。高 effort 任务可能增加 thinking token、缓存读取、重试、工具和子智能体调用。应测量每个已接受结果的成本,不要混淆 API、Claude.ai/Claude Code 计划、提供商加价、Fast Mode 与 Tabbit。
如果要比较相邻家族,请分别阅读 Claude Sonnet 5 总览和 Claude Fable 5.1 评测;它们的 effort、价格和生命周期证据不能直接套给 Opus 4.8。
身份与场景自检
记录完整模型 ID、客户端、提供商、地区、日期、effort 和工具。定义输入文件、期望输出、验收测试和停止条件。代码要跑现有测试并检查 diff;浏览器或终端智能体要记录工具调用,并在不可逆操作前请求确认;研究任务要有引用和矛盾检查。
社区也提示了上下文风险:一位 Reddit 用户称启用 4.8 thinking 时每轮可能产生最多 900,000 个缓存 token,而 4.7 为 14,000–34,000;另一位大型代码库用户描述了数百 GB 级别的长期会话(来源)。这是用户测量,不改写官方 1M 目录上限,只说明应在自己的 harness 测量 effort 和上下文。
本文没有用已登录账户在 Tabbit Browser 实测 Opus 4.8,因此不声称选择器、有效上下文、延迟、提供商路由、订阅权限、工具或费用。智能体浏览器指南、浏览器自动化指南和AI 浏览器指南解释客户端边界;Tabbit Browser 总览不是 API 或提供商测试。
结论
Claude Opus 4.8 仍值得用于复杂编码、工具分析和浏览器智能体的受控试用。4.7 改进有意义,但独立证据受 harness 影响,且当前目录已标为 legacy。用固定验收测试比较 Opus 5,在不可逆操作周围保留人工确认。
来源与常见问题
主要来源是 Anthropic 的发布说明、平台模型页、价格文档和系统卡,以及 Digital Applied、ThePlanetTools、红队研究。社区链接和采集限制已记入内部研究稿。
Opus 4.8 仍可用吗?
可以,但目录已标为 active、legacy,并建议考虑 Opus 5;退役时间不早于 2027 年 5 月 28 日。
每个客户端都能提供 1M 上下文吗?
不能。那是模型目录上限,提供商、计划、界面或工具包装层可能提供更小窗口。
应该使用 high、extra 还是 max?
从能通过验收测试的最低档开始。更高 effort 可能改善难题,也可能增加 token、等待时间和额度消耗。
Fast Mode 是另一个模型吗?
不是。Anthropic 将其描述为同一模型的更快路线,价格为 $10/$50 / 百万 token,是否可用取决于计划和提供商。
4.8 比 4.7 更安全吗?
Anthropic 报告 misaligned behavior 低于 4.7,但独立红队仍发现自适应攻击面;应用层控制和人工确认不能省略。
能在 Tabbit 用吗?
本文没有核验已登录 Tabbit 会话。查看自己的选择器,并把一次成功任务当作本地观察,不要当作平台保证。
常见问题
Claude Opus 4.8 是什么?
Claude Opus 4.8 是 Anthropic 于 2026 年 5 月发布的 Opus 模型,面向复杂编码、工具调用、浏览器智能体和长上下文知识工作。API ID 为 claude-opus-4-8,模型页列出 1M 上下文和 128K 最大输出。
Claude Opus 4.8 仍是当前模型吗?
它仍可使用,但 2026 年 9 月 20 日检查的 Claude Platform 页面已标为 Legacy,并建议考虑 Claude Opus 5。页面给出的退役时间不早于 2027 年 5 月 28 日。
Claude Opus 4.8 如何计费?
标准 API 输入为每百万 token 5 美元,输出为 25 美元。Fast Mode 列为 10 和 50 美元;缓存、Batch、提供商与消费者计划另计。
Opus 4.8 支持哪些 effort?
Anthropic 文档列出 adaptive thinking,默认 effort 为 high,并支持 extra 或 xhigh、max。较低 effort 更快且消耗速率限制更慢,较高 effort 可能使用更多 token。
Opus 4.8 与 4.7 有什么变化?
Anthropic 强调判断、指令遵循、工具效率和自检改进,并增加 effort、Fast Mode 与 Dynamic Workflows。独立早期评测按 harness 呈现混合结果,不是所有任务都获胜。
能在 Tabbit 中使用 Claude Opus 4.8 吗?
本文没有用已登录 Tabbit 账户实测 Opus 4.8,因此不声称选择器、有效上下文、延迟、费用或工具权限。请查看实时选择器并验证一个可回滚的小任务。