Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
社区Claude Sonnet 5.5

Arena.ai Code Arena:Claude Sonnet 5.5 High 的 WebDev 真实任务排名

原始来源

X / Arena.ai

作者Arena.ai(@arena)

原文日期2026-09-30

Tabbit 整理2026-09-30

查看原文

一句话结论

Arena.ai 公布的 Code Arena: WebDev 实测中,Claude Sonnet 5.5(High)以 1699 分排名第 4,并以混合 $8/Mtoken 的价格进入成本效率帕累托前沿;相对 Sonnet 5(High)提升 159 分,但该帖子没有公开完整样本、评分方法和运行配置。

适用场景

  • 适合的任务:以 WebDev 为代表的真实代码生成与网页开发任务;可作为 Sonnet 5.5 High 是否值得进入候选模型池的外部信号。

  • 不适合的任务:把单个 Code Arena 子榜直接外推到跨文件重构、长程 Agent、生产稳定性或其他编程语言。

  • 适用的模型版本:Claude Sonnet 5.5(High),X 帖子 2026-09-30 的 Arena 评测快照。

  • 适用的客户端、Agent 或 API:Arena.ai Code Arena: WebDev;帖子未公开模型 provider、完整 harness、每题 prompt 或 API 参数。

  • 推荐的推理档位和参数:帖子只报告 High 档。复测时应固定 High、模型 snapshot、工具权限、上下文、输出上限和计费口径。

测试环境与输入/配置

  • 评测平台:Arena.ai 的 Code Arena: WebDev,帖子将其描述为 real-world results,并报告总榜及子领域排名。

  • 模型配置:Claude Sonnet 5.5(High);对照为 Sonnet 5(High)、Claude Fable 5.1(Max)和 GPT-6 Astra(Max)。

  • 价格口径:帖子使用 blended $8 per Mtoken,且称 Sonnet 5.5 High 比整体排名第 3 的 Fable 5.1 Max 和第 2 的 GPT-6 Astra Max 便宜 80%。

  • 原帖状态:原帖正文在 X 中可见,已切换“显示原文”核对英文内容;帖子附有帕累托位置图,图中标注 Code Arena: WebDev 榜单来源 URL,但原帖未提供可点击的榜单链接。

  • 时间快照:X 显示发布时间为 2026-09-30 02:15(页面本地显示);采集时帖子约 9.2 万次观看,互动数会动态变化。

结果数据

指标Claude Sonnet 5.5(High)对照或变化
Code Arena: WebDev 总分1699 分第 4 名
Sonnet 5(High)1540 分第 37 名;Sonnet 5.5 High 提升 +159 分
Reference-Based Design第 4 名Sonnet 5 High 为第 38 名
Simulations第 4 名Sonnet 5 High 为第 37 名
Gaming第 4 名Sonnet 5 High 为第 36 名
混合价格$8/MtokenArena.ai 称其凭借成本效率重塑 WebDev 帕累托前沿

结论

这条 Arena.ai 一手通报支持一个范围明确的判断:Claude Sonnet 5.5 High 在 Code Arena: WebDev 的真实任务榜中进入前四,并相对 Sonnet 5 High 有明显排名和分数提升;在该帖子给出的混合价格口径下,它同时具备较好的成本效率。结论只覆盖 WebDev 榜和 High 配置,不能替代自有代码库、跨文件修改、测试修复和长程 Agent 的集测。

局限

  • X 帖子没有公开 Code Arena: WebDev 的完整任务集、样本量、评分者数量、Elo 或其他分数计算公式、随机化方式和置信区间。

  • 1699 分和第 4 名是动态榜单快照;模型加入、样本更新或榜单重算都可能改变名次。

  • 帖子使用 blended $8/Mtoken 的成本口径,但没有公开输入/输出 token 比例、缓存命中、provider、工具调用和每任务成本分布,不能据此直接预算生产费用。

  • WebDev 榜不能代表终端 Agent、跨文件重构、代码安全、测试覆盖、非 Web 编程或多轮项目维护能力。

  • 帖子引用的“便宜 80%”是相对 Fable 5.1 Max 与 GPT-6 Astra Max 的整体对照表述,未提供完整价格计算过程,应按同一 provider 和同一任务集复核。

复现步骤

  1. 固定 Arena.ai 当前可用的 Code Arena: WebDev 数据版本、模型 snapshot、High 档和计费 provider,并记录榜单抓取时间。

  2. 使用自有的 WebDev 任务集补充复测,覆盖参考实现、模拟/交互、游戏和跨文件网页任务;保存完整 prompt、仓库版本、工具轨迹和生成结果。

  3. 在同一 harness 中比较 Sonnet 5.5 High、Sonnet 5 High 及其他候选模型,统一超时、上下文、输出上限、温度和重试策略。

  4. 分别计算任务成功率、人工偏好、测试通过率、修复轮次、输入输出 token、延迟和实际成本,不把 1699 分当作自己的复测结果。

  5. 将榜单排名、分数和价格按采集时间存档;若榜单更新,保留旧快照并说明变化原因。

来源摘录或观察(仅做合规短引)

Arena.ai 原帖把 Sonnet 5.5 High 概括为 “1699 pts” 的 WebDev 第 4 名,并强调其成本效率;这组数字只对应该榜单和 2026-09-30 的快照。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 5.5

在 Tabbit 中使用并对比模型

Claude Sonnet 5.5

相关测评

媒体Anthropic 官方网站

Claude Sonnet 5.5 官方能力基准与适用边界

媒体Artificial Analysis2026-09-28

Artificial Analysis:Claude Sonnet 5.5 的智能指数与 Agent 任务独立测评

媒体CodeRabbit 官方博客2026-09-28

CodeRabbit:Claude Sonnet 5.5 与 Sonnet 5、Opus 5.5 的代码审查比较

媒体Bito 官方博客2026-09-29

Bito:Claude Sonnet 5.5 与 Sonnet 5 的四次 Agent 编码任务对比

Claude Sonnet 5.5

相关提示词

媒体Claude Platform Docs

Anthropic 官方提示指南:Claude Sonnet 5.5 的 effort、主动性与工具调用

媒体Claude Platform Docs

Anthropic 官方迁移指南:Claude Sonnet 5.5 API 配置与 breaking changes

媒体Claude Platform Docs2026-09-28

Anthropic 官方模型概览:Claude Sonnet 5.5 当前配置

社区GitHub(由 Reddit r/ClaudeAI 帖子提供的原始文件)

社区配置:面向 Claude Sonnet 5.5 的 CLAUDE.md 工作规则