Claude Sonnet 4.6 · 社区来源 · 编辑分析
Harvey 在法律代理基准 LAB 上给 Claude Sonnet 4.6 记全通过率 4.2%,低于 Opus 4.6 的 6.6%;同一榜上,后训练后的 NVIDIA Nemotron 3 Ultra 达到 5.8%,并声称运行成本是 Sonnet/Opus 的 1/8 到 1/50。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
Harvey 在法律代理基准 LAB 上给 Claude Sonnet 4.6 记全通过率 4.2%,低于 Opus 4.6 的 6.6%;同一榜上,后训练后的 NVIDIA Nemotron 3 Ultra 达到 5.8%,并声称运行成本是 Sonnet/Opus 的 1/8 到 1/50。
基准:Harvey Legal Agent Bench(LAB)。
指标:full-pass / 全通过率。
对照:Nemotron 3 Ultra 基线 0% → 后训练 5.8%;Sonnet 4.6 4.2%;Opus 4.6 6.6%。
附加观察:留出任务在训练前约 70% 通过(因遗漏足够评分维度),训练后约 95%。该 70%/95% 说的是 Nemotron 后训练前后,不是 Sonnet。
X 帖未公开 LAB 题目、评分维度、Sonnet 的 prompt、工具集、effort 或是否启用法律检索插件。Trajectory 帖称整个后训练在 Nemotron 3 Ultra 发布后不到 24 小时完成。
| 模型 | LAB 全通过率 |
|---|---|
| Nemotron 3 Ultra(未后训练) | 0% |
| Claude Sonnet 4.6 | 4.2% |
| Nemotron 3 Ultra(法律后训练) | 5.8% |
| Claude Opus 4.6 | 6.6% |
Harvey 还写:后训练后的开源权重模型达到与领先闭源模型相近的质量,运行成本为 Sonnet 4.6 与 Opus 4.6 每 token 价格的 1/8 到 1/50。
法律代理“全通过”非常苛刻:Sonnet 4.6 的 4.2% 不表示它不能做法律辅助,而表示在 Harvey 的全维度通过标准下,它明显弱于 Opus 4.6,也弱于专门后训练的 Nemotron。适合把 Sonnet 4.6 用于法律草稿/检索辅助,不适合当作 LAB 意义上的自动过关代理。高风险法律交付仍应走 Opus 或领域后训练模型,并保留律师复核。
全通过率不是部分正确率;4.2% 与日常“能写出可用备忘录”不是同一指标。
未公开逐题结果和 Sonnet 配置。
成本 1/8–1/50 是作者对 Nemotron vs Claude 单价的陈述,不是 LAB 分数。
不能把 LAB 与 IDP 文档抽取或 SWE 编码混为一谈。
若 Harvey/Trajectory 后续公开 LAB 子集,固定同一评分维度跑 claude-sonnet-4-6 与 claude-opus-4-6。
分别报告全通过、部分通过、引用错误和遗漏评分维度。
记录检索工具、jurisdictions 和是否允许联网。
法律结论必须由有资质的人复核,模型分数不能替代。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X · Harvey(@harvey),引用 Trajectory(@trajectorylabs) · 原文发布日期 2026-06-11 · 本站编辑日期 2026-09-20
打开原始来源Claude Sonnet 4.6
下载 Tabbit 客户端后检查模型可用性