Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Opus 4.8

Claude Opus 4.8:官方发布能力、Agent 工作流与诚实性边界

原始来源

Anthropic Newsroom

作者Anthropic

原文日期2026-05-28

Tabbit 整理2026-08-19

查看原文

一句话结论

Anthropic 将 Opus 4.8 定位为长程编码、Agent 和专业工作上的稳定升级:默认高 effort、可用 xhigh/max,工具与长任务更可靠,但应把价格、token、工具 harness 和安全边界纳入复核。

适用场景

  • 适合的任务:长程编码、浏览器/电脑 Agent、专业知识工作、复杂分析、需要识别自身不确定性的工作流。

  • 不适合的任务:只看单一榜单分数的选型、没有验证环节的高风险自动决策,以及对成本极敏感的所有任务。

  • 适用的模型版本:Claude Opus 4.8,API ID claude-opus-4-8。

  • 适用的客户端、Agent 或 API:Claude、Claude Code、Cowork、Claude API;动态工作流为 Claude Code Enterprise、Team、Max 的研究预览功能。

  • 推荐的推理档位和参数:官方默认 high;困难任务和长时间异步工作流推荐 extra/xhigh,最高档 max 需权衡 token 和可能的过度思考。常规价格为输入 $5/百万 token、输出 $25/百万 token;fast mode 为 $10/$50。

测试环境

  • 模型/版本:Claude Opus 4.8;官方发布页对比 Opus 4.7 及其他模型,并链接到系统卡。

  • 工具/客户端:Claude Code、Claude API、客户端 effort 控制;动态工作流可并行运行大量子 Agent。

  • 测评来源:Anthropic 发布的能力评估、系统卡和早期测试者反馈;发布页未给出全部测试输入、随机种子或每项完整配置。

输入/配置

  • 发布页说明 Opus 4.8 默认高 effort;用户可选 xhigh 或 max。

  • Messages API 新增可在 messages 数组中插入 system entry,可在任务中更新权限、token 预算或环境上下文而不必走 user turn。

  • 动态工作流可规划工作、运行数百个并行子 Agent,并在报告前验证输出;官方示例是数十万行代码规模的迁移。

结果数据

  • 官方发布页称 Opus 4.8 在 Online-Mind2Web 得分 84%,并将其描述为电脑使用和浏览器 Agent 能力的显著提升。

  • 官方评估称它比前代约 少四倍 让自己编写的代码缺陷“无提示地通过”;这是错误未被指出的相对风险描述,不等于所有项目中错误率固定下降四倍。

  • 发布页引用早期测试者:在 Super-Agent benchmark 上完成全部案例;CursorBench 上工具调用步骤更少;Legal Agent Benchmark 首次超过 10% overall all-pass;这些是合作方/客户反馈,完整实验配置未在该页面公开。

  • 官方定价:普通模式输入 $5/百万、输出 $25/百万;fast mode 输入 $10/百万、输出 $50/百万,fast mode 速度约为 2.5×。

结论

Opus 4.8 的可用价值不只在榜单分数,还在长程任务的自我质疑、工具调用效率、上下文协作和可调 effort。实际系统应将“发现问题—验证—执行”拆分,并用任务集测量 token、延迟、工具步数和失败恢复,而不是只复述官方宣传。

局限

  • 这是模型厂商发布材料;部分结果来自 Anthropic 内部评测或合作方自报,不能替代独立复现。

  • 发布页未展示所有 benchmark 的完整输入、样本量、置信区间、运行成本和 harness;详细数字应以链接的系统卡和独立对照为准。

  • “四倍更不易漏报缺陷”是相对官方评估结论,不能外推为通用生产质量保证。

  • 动态工作流、fast mode 和 effort 的可用性、额度与价格会随客户端/计划变化;上线前应再次核对。

复现步骤

  1. 在相同代码仓库、工具定义、上下文和 max_tokens 下,用 Opus 4.8 与 Opus 4.7 各运行一组长程编码任务。

  2. 分别测试 high、xhigh、max,记录成功率、token、总耗时、工具调用次数、人工接管次数和未发现缺陷数。

  3. 使用同一测试集和同一审查规则,将“发现”和“验证”分开,记录 recall、precision 和 F1。

  4. 对浏览器 Agent 记录 Online-Mind2Web 类任务的 pass@1、恢复失败次数和每任务成本;不要混用不同 harness 的榜单数字。

来源摘录或观察(仅做合规短引)

官方页面把 Opus 4.8 描述为“modest but tangible improvement”,同时把默认高 effort、动态工作流、effort 控制和 Messages API system entry 作为配套变化。该组合说明部署配置和工作流设计会显著影响结果。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Opus 4.8

在 Tabbit 中使用并对比模型

Claude Opus 4.8

相关测评

媒体Vellum2026-05-28

Claude Opus 4.8:Vellum 跨模型基准对照与 Harness 边界

Claude Opus 4.8

相关提示词

媒体Anthropic Claude Platform Docs

Claude Opus 4.8:努力档位、工具调用与代码审查提示模式

社区Reddit / r/PromptEngineering2026-05-28

Claude Opus 4.8:Max 努力档位的高风险任务提示