Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Sonnet 5

Claude Sonnet 5 官方发布:Agent 能力、成本档位与安全边界

原始来源

Anthropic 官方博客

作者Anthropic

原文日期2026-06-30

Tabbit 整理2026-08-19

查看原文

测试环境

  • 模型:Claude Sonnet 5,与 Sonnet 4.6、Opus 4.8 对比。

  • 评测:官方展示 BrowseComp(Agentic Search)与 OSWorld-Verified(computer use),并在系统卡中报告更多能力与安全评估。

  • 推理控制:effort 档位;官方图表比较不同 effort 下的成本-性能。

  • 价格:输入 $2 / 百万 token,输出 $10 / 百万 token;官方称该引入价在 8 月 10 日改为永久价格。

输入/配置

  • API 模型名:claude-sonnet-5。

  • 可用范围:Claude Free/Pro 默认模型,Max、Team、Enterprise 可用,也可经 Claude API 调用。

  • Agent 评测使用工具调用、长任务和不同 effort 档位;完整数值应以官方图表和 System Card 为准。

结果数据

  • 官方结论是 Sonnet 5 在 agentic reasoning、工具使用、编码和知识工作上明显优于 Sonnet 4.6,部分高 effort 任务可接近 Opus 4.8。

  • 在 BrowseComp 与 OSWorld-Verified 的官方成本-性能图中,Sonnet 5 提供比 Opus 4.8 更宽的成本选择;官方特别强调 medium effort 的成本效率。

  • 官方安全评估称 Sonnet 5 的不良行为、幻觉、谄媚和提示注入劫持率总体低于 Sonnet 4.6。

  • 网络安全边界:在 Firefox 漏洞利用评估中,Sonnet 5 与 Sonnet 4.6 都没有完成可工作的 exploit(均为 0%),Sonnet 5 的部分成功率略高;因此发布时启用了网络安全护栏。

结论

官方定位是“更 Agent 化的 Sonnet”:适合多步编码、工具调用、浏览器/终端型工作流,并以 effort 档位换取成本与完成率的选择空间。官方同时明确其危险网络能力低于 Opus 级模型,但不能因此省略安全护栏。

局限

  • 官方材料是厂商自测和合作伙伴反馈,不是独立复现实验;BrowseComp、OSWorld 等具体配置与完整分数应以 System Card 为准。

  • “接近 Opus 4.8”取决于任务、effort 与预算,不能泛化为所有文本或代码任务的等价。

  • 价格和默认行为可能仍随 API 产品变更;采集时以页面 2026-08-10 更新为准。

复现步骤

  1. 使用同一任务集,分别调用 Sonnet 5 的 medium、high、xhigh effort。

  2. 固定工具定义、超时、最大总 token 和重试规则,记录成功率、工具调用、输入/输出 token 与墙钟时间。

  3. 用 Sonnet 4.6 与 Opus 4.8 在同一 harness 重跑,不混用不同系统提示词或不同工具权限。

  4. 对代码/网络安全任务单独保留护栏、授权和人工复核记录,不以“未完成 exploit”推导为无风险。

原始证据与数据

  • 官方 API 价格:输入 $2/M,输出 $10/M;官方页面说明该价格在 8 月 10 日由引入价改为永久价格。

  • 官方将 Sonnet 5 描述为在复杂多步任务中更能持续执行、自检和完成交付。

  • 官方安全评估同时报告了更低的整体不良行为率与仍需启用网络安全护栏的边界。

来源摘录或观察(仅做合规短引)

  • 官方定位短句:“Our most agentic Sonnet yet”。

  • 官方发布页把 effort 视为成本/性能调节杆,而不是单一固定能力等级。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 5

在 Tabbit 中使用并对比模型

Claude Sonnet 5

相关测评

社区Reddit,r/ClaudeAI2026-06-30

Reddit 社区:Claude Sonnet 5 发布后任务体验与成本争议

媒体Endor Labs2026-07-02

Endor Labs 独立评测:Claude Sonnet 5 搭配 Claude Code 的功能正确性与安全修复表现

媒体CodeRabbit 官方博客2026-06-30

CodeRabbit 生产实测:Claude Sonnet 5 代码编写与 PR 审查质量深度对比

媒体Vellum 官方博客2026-06-30

Vellum 基准横评:Claude Sonnet 5 六大基准得分、Tokenizer 变化与成本分析

Claude Sonnet 5

相关提示词

媒体Anthropic Claude Platform Docs2026-06-30

Claude Sonnet 5 官方提示方法:努力档位、工具调用与代码审查

媒体PromptsRush2026-07-15

PromptsRush:Claude Sonnet 5 生产级 Agent 任务分解与系统提示词模板

媒体Cursor Docs2026-07-01

Cursor 官方文档:Claude Sonnet 5 模型集成、用量池与 Agent 工具配置

社区Reddit,r/claude2026-07-30

Reddit 社区:Claude Sonnet 5 响应截断与思考 Token 参数配置排查指南