Anthropic 将 Opus 4.8 定位为长程编码、Agent 和专业工作上的稳定升级:默认高 effort、可用 xhigh/max,工具与长任务更可靠,但应把价格、token、工具 harness 和安全边界纳入复核。
适合的任务:长程编码、浏览器/电脑 Agent、专业知识工作、复杂分析、需要识别自身不确定性的工作流。
不适合的任务:只看单一榜单分数的选型、没有验证环节的高风险自动决策,以及对成本极敏感的所有任务。
适用的模型版本:Claude Opus 4.8,API ID claude-opus-4-8。
适用的客户端、Agent 或 API:Claude、Claude Code、Cowork、Claude API;动态工作流为 Claude Code Enterprise、Team、Max 的研究预览功能。
推荐的推理档位和参数:官方默认 high;困难任务和长时间异步工作流推荐 extra/xhigh,最高档 max 需权衡 token 和可能的过度思考。常规价格为输入 $5/百万 token、输出 $25/百万 token;fast mode 为 $10/$50。
模型/版本:Claude Opus 4.8;官方发布页对比 Opus 4.7 及其他模型,并链接到系统卡。
工具/客户端:Claude Code、Claude API、客户端 effort 控制;动态工作流可并行运行大量子 Agent。
测评来源:Anthropic 发布的能力评估、系统卡和早期测试者反馈;发布页未给出全部测试输入、随机种子或每项完整配置。
发布页说明 Opus 4.8 默认高 effort;用户可选 xhigh 或 max。
Messages API 新增可在 messages 数组中插入 system entry,可在任务中更新权限、token 预算或环境上下文而不必走 user turn。
动态工作流可规划工作、运行数百个并行子 Agent,并在报告前验证输出;官方示例是数十万行代码规模的迁移。
官方发布页称 Opus 4.8 在 Online-Mind2Web 得分 84%,并将其描述为电脑使用和浏览器 Agent 能力的显著提升。
官方评估称它比前代约 少四倍 让自己编写的代码缺陷“无提示地通过”;这是错误未被指出的相对风险描述,不等于所有项目中错误率固定下降四倍。
发布页引用早期测试者:在 Super-Agent benchmark 上完成全部案例;CursorBench 上工具调用步骤更少;Legal Agent Benchmark 首次超过 10% overall all-pass;这些是合作方/客户反馈,完整实验配置未在该页面公开。
官方定价:普通模式输入 $5/百万、输出 $25/百万;fast mode 输入 $10/百万、输出 $50/百万,fast mode 速度约为 2.5×。
Opus 4.8 的可用价值不只在榜单分数,还在长程任务的自我质疑、工具调用效率、上下文协作和可调 effort。实际系统应将“发现问题—验证—执行”拆分,并用任务集测量 token、延迟、工具步数和失败恢复,而不是只复述官方宣传。
这是模型厂商发布材料;部分结果来自 Anthropic 内部评测或合作方自报,不能替代独立复现。
发布页未展示所有 benchmark 的完整输入、样本量、置信区间、运行成本和 harness;详细数字应以链接的系统卡和独立对照为准。
“四倍更不易漏报缺陷”是相对官方评估结论,不能外推为通用生产质量保证。
动态工作流、fast mode 和 effort 的可用性、额度与价格会随客户端/计划变化;上线前应再次核对。
在相同代码仓库、工具定义、上下文和 max_tokens 下,用 Opus 4.8 与 Opus 4.7 各运行一组长程编码任务。
分别测试 high、xhigh、max,记录成功率、token、总耗时、工具调用次数、人工接管次数和未发现缺陷数。
使用同一测试集和同一审查规则,将“发现”和“验证”分开,记录 recall、precision 和 F1。
对浏览器 Agent 记录 Online-Mind2Web 类任务的 pass@1、恢复失败次数和每任务成本;不要混用不同 harness 的榜单数字。
官方页面把 Opus 4.8 描述为“modest but tangible improvement”,同时把默认高 effort、动态工作流、effort 控制和 Messages API system entry 作为配套变化。该组合说明部署配置和工作流设计会显著影响结果。
Claude Opus 4.8