Arena.ai 公布的 Code Arena: WebDev 实测中,Claude Sonnet 5.5(High)以 1699 分排名第 4,并以混合 $8/Mtoken 的价格进入成本效率帕累托前沿;相对 Sonnet 5(High)提升 159 分,但该帖子没有公开完整样本、评分方法和运行配置。
适合的任务:以 WebDev 为代表的真实代码生成与网页开发任务;可作为 Sonnet 5.5 High 是否值得进入候选模型池的外部信号。
不适合的任务:把单个 Code Arena 子榜直接外推到跨文件重构、长程 Agent、生产稳定性或其他编程语言。
适用的模型版本:Claude Sonnet 5.5(High),X 帖子 2026-09-30 的 Arena 评测快照。
适用的客户端、Agent 或 API:Arena.ai Code Arena: WebDev;帖子未公开模型 provider、完整 harness、每题 prompt 或 API 参数。
推荐的推理档位和参数:帖子只报告 High 档。复测时应固定 High、模型 snapshot、工具权限、上下文、输出上限和计费口径。
评测平台:Arena.ai 的 Code Arena: WebDev,帖子将其描述为 real-world results,并报告总榜及子领域排名。
模型配置:Claude Sonnet 5.5(High);对照为 Sonnet 5(High)、Claude Fable 5.1(Max)和 GPT-6 Astra(Max)。
价格口径:帖子使用 blended $8 per Mtoken,且称 Sonnet 5.5 High 比整体排名第 3 的 Fable 5.1 Max 和第 2 的 GPT-6 Astra Max 便宜 80%。
原帖状态:原帖正文在 X 中可见,已切换“显示原文”核对英文内容;帖子附有帕累托位置图,图中标注 Code Arena: WebDev 榜单来源 URL,但原帖未提供可点击的榜单链接。
时间快照:X 显示发布时间为 2026-09-30 02:15(页面本地显示);采集时帖子约 9.2 万次观看,互动数会动态变化。
| 指标 | Claude Sonnet 5.5(High) | 对照或变化 |
|---|---|---|
| Code Arena: WebDev 总分 | 1699 分 | 第 4 名 |
| Sonnet 5(High) | 1540 分 | 第 37 名;Sonnet 5.5 High 提升 +159 分 |
| Reference-Based Design | 第 4 名 | Sonnet 5 High 为第 38 名 |
| Simulations | 第 4 名 | Sonnet 5 High 为第 37 名 |
| Gaming | 第 4 名 | Sonnet 5 High 为第 36 名 |
| 混合价格 | $8/Mtoken | Arena.ai 称其凭借成本效率重塑 WebDev 帕累托前沿 |
这条 Arena.ai 一手通报支持一个范围明确的判断:Claude Sonnet 5.5 High 在 Code Arena: WebDev 的真实任务榜中进入前四,并相对 Sonnet 5 High 有明显排名和分数提升;在该帖子给出的混合价格口径下,它同时具备较好的成本效率。结论只覆盖 WebDev 榜和 High 配置,不能替代自有代码库、跨文件修改、测试修复和长程 Agent 的集测。
X 帖子没有公开 Code Arena: WebDev 的完整任务集、样本量、评分者数量、Elo 或其他分数计算公式、随机化方式和置信区间。
1699 分和第 4 名是动态榜单快照;模型加入、样本更新或榜单重算都可能改变名次。
帖子使用 blended $8/Mtoken 的成本口径,但没有公开输入/输出 token 比例、缓存命中、provider、工具调用和每任务成本分布,不能据此直接预算生产费用。
WebDev 榜不能代表终端 Agent、跨文件重构、代码安全、测试覆盖、非 Web 编程或多轮项目维护能力。
帖子引用的“便宜 80%”是相对 Fable 5.1 Max 与 GPT-6 Astra Max 的整体对照表述,未提供完整价格计算过程,应按同一 provider 和同一任务集复核。
固定 Arena.ai 当前可用的 Code Arena: WebDev 数据版本、模型 snapshot、High 档和计费 provider,并记录榜单抓取时间。
使用自有的 WebDev 任务集补充复测,覆盖参考实现、模拟/交互、游戏和跨文件网页任务;保存完整 prompt、仓库版本、工具轨迹和生成结果。
在同一 harness 中比较 Sonnet 5.5 High、Sonnet 5 High 及其他候选模型,统一超时、上下文、输出上限、温度和重试策略。
分别计算任务成功率、人工偏好、测试通过率、修复轮次、输入输出 token、延迟和实际成本,不把 1699 分当作自己的复测结果。
将榜单排名、分数和价格按采集时间存档;若榜单更新,保留旧快照并说明变化原因。
Arena.ai 原帖把 Sonnet 5.5 High 概括为 “1699 pts” 的 WebDev 第 4 名,并强调其成本效率;这组数字只对应该榜单和 2026-09-30 的快照。
Claude Sonnet 5.5