Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Opus 4.8 · 媒体来源 · 厂商自报

Claude Opus 4.8:官方发布能力、Agent 工作流与诚实性边界

Anthropic 的 Opus 4.8 发布页强调 Agent 判断、effort 控制与动态工作流改进;测试者引述和厂商评测不能证明独立生产成功率。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源厂商自报编辑日期 2026-09-20

测试条件速查

条件
模型/版本:claude-opus-4-8;精确快照以原文为准。
条件
任务/工具:编码、电脑使用和 Agent 评测;完整 harness 与重复次数未全部公开。
条件
样本/日期:内部与合作方结果按原文披露;本轮重开 2026-09-20。

关键数据与适用场景

一句话结论

Anthropic 将 Opus 4.8 定位为长程编码、Agent 和专业工作上的稳定升级:默认高 effort、可用 xhigh/max,工具与长任务更可靠,但应把价格、token、工具 harness 和安全边界纳入复核。

适用场景

  • 适合的任务:长程编码、浏览器/电脑 Agent、专业知识工作、复杂分析、需要识别自身不确定性的工作流。

  • 不适合的任务:只看单一榜单分数的选型、没有验证环节的高风险自动决策,以及对成本极敏感的所有任务。

  • 适用的模型版本:Claude Opus 4.8,API ID claude-opus-4-8。

  • 适用的客户端、Agent 或 API:Claude、Claude Code、Cowork、Claude API;动态工作流为 Claude Code Enterprise、Team、Max 的研究预览功能。

  • 推荐的推理档位和参数:官方默认 high;困难任务和长时间异步工作流推荐 extra/xhigh,最高档 max 需权衡 token 和可能的过度思考。常规价格为输入 $5/百万 token、输出 $25/百万 token;fast mode 为 $10/$50。

测试环境

  • 模型/版本:Claude Opus 4.8;官方发布页对比 Opus 4.7 及其他模型,并链接到系统卡。

  • 工具/客户端:Claude Code、Claude API、客户端 effort 控制;动态工作流可并行运行大量子 Agent。

  • 测评来源:Anthropic 发布的能力评估、系统卡和早期测试者反馈;发布页未给出全部测试输入、随机种子或每项完整配置。

输入/配置

  • 发布页说明 Opus 4.8 默认高 effort;用户可选 xhigh 或 max。

  • Messages API 新增可在 messages 数组中插入 system entry,可在任务中更新权限、token 预算或环境上下文而不必走 user turn。

  • 动态工作流可规划工作、运行数百个并行子 Agent,并在报告前验证输出;官方示例是数十万行代码规模的迁移。

结果数据

  • 官方发布页称 Opus 4.8 在 Online-Mind2Web 得分 84%,并将其描述为电脑使用和浏览器 Agent 能力的显著提升。

  • 官方评估称它比前代约 少四倍 让自己编写的代码缺陷“无提示地通过”;这是错误未被指出的相对风险描述,不等于所有项目中错误率固定下降四倍。

  • 发布页引用早期测试者:在 Super-Agent benchmark 上完成全部案例;CursorBench 上工具调用步骤更少;Legal Agent Benchmark 首次超过 10% overall all-pass;这些是合作方/客户反馈,完整实验配置未在该页面公开。

  • 官方定价:普通模式输入 $5/百万、输出 $25/百万;fast mode 输入 $10/百万、输出 $50/百万,fast mode 速度约为 2.5×。

结论

Opus 4.8 的可用价值不只在榜单分数,还在长程任务的自我质疑、工具调用效率、上下文协作和可调 effort。实际系统应将“发现问题—验证—执行”拆分,并用任务集测量 token、延迟、工具步数和失败恢复,而不是只复述官方宣传。

局限

  • 这是模型厂商发布材料;部分结果来自 Anthropic 内部评测或合作方自报,不能替代独立复现。

  • 发布页未展示所有 benchmark 的完整输入、样本量、置信区间、运行成本和 harness;详细数字应以链接的系统卡和独立对照为准。

  • “四倍更不易漏报缺陷”是相对官方评估结论,不能外推为通用生产质量保证。

  • 动态工作流、fast mode 和 effort 的可用性、额度与价格会随客户端/计划变化;上线前应再次核对。

复现步骤

  1. 在相同代码仓库、工具定义、上下文和 max_tokens 下,用 Opus 4.8 与 Opus 4.7 各运行一组长程编码任务。

  2. 分别测试 high、xhigh、max,记录成功率、token、总耗时、工具调用次数、人工接管次数和未发现缺陷数。

  3. 使用同一测试集和同一审查规则,将“发现”和“验证”分开,记录 recall、precision 和 F1。

  4. 对浏览器 Agent 记录 Online-Mind2Web 类任务的 pass@1、恢复失败次数和每任务成本;不要混用不同 harness 的榜单数字。

来源摘录或观察(仅做合规短引)

官方页面把 Opus 4.8 描述为“modest but tangible improvement”,同时把默认高 effort、动态工作流、effort 控制和 Messages API system entry 作为配套变化。该组合说明部署配置和工作流设计会显著影响结果。

能支持的判断

  • 支持在 Anthropic 披露设置下讨论能力方向、电脑使用观察与安全边界。

不能支持的判断

  • 不支持把厂商或合作方结果外推为独立生产成功率。
  • 动态价格、配额与可用性需重新核对。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Anthropic Newsroom · Anthropic · 原文发布日期 2026-05-28 · 本站编辑日期 2026-09-20

打开原始来源

Claude Opus 4.8

在 Tabbit 中比较 Claude Opus 4.8

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Opus 4.8 是什么:变化、获取方式与 Legacy 状态

用官方与独立来源说明 Claude Opus 4.8 的 effort、上下文、价格、提供商、4.7 变化、安全边界与当前生命周期。

相关评测

Claude Opus 4.8:Vellum 跨模型基准对照与 Harness 边界Vellum 以列出的基准任务和模型选型比较 Claude Opus 4.8;不同 harness 混在一起,不能合并成单一跨任务排名。Claude Opus 4.8:努力档位、工具调用与代码审查提示模式按“Claude Opus 4.8:努力档位、工具调用与代码审查提示模式”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Opus 4.8:Max 努力档位的高风险任务提示按“Claude Opus 4.8:Max 努力档位的高风险任务提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。