Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区Claude Sonnet 4.6

Harvey Legal Agent Bench:Sonnet 4.6 全通过率 4.2%

原始来源

X

作者Harvey(@harvey),引用 Trajectory(@trajectorylabs)

原文日期2026-06-11

Tabbit 整理2026-08-20

查看原文

一句话结论

Harvey 在法律代理基准 LAB 上给 Claude Sonnet 4.6 记全通过率 4.2%,低于 Opus 4.6 的 6.6%;同一榜上,后训练后的 NVIDIA Nemotron 3 Ultra 达到 5.8%,并声称运行成本是 Sonnet/Opus 的 1/8 到 1/50。

测试环境

  • 基准:Harvey Legal Agent Bench(LAB)。

  • 指标:full-pass / 全通过率。

  • 对照:Nemotron 3 Ultra 基线 0% → 后训练 5.8%;Sonnet 4.6 4.2%;Opus 4.6 6.6%。

  • 附加观察:留出任务在训练前约 70% 通过(因遗漏足够评分维度),训练后约 95%。该 70%/95% 说的是 Nemotron 后训练前后,不是 Sonnet。

输入/配置

X 帖未公开 LAB 题目、评分维度、Sonnet 的 prompt、工具集、effort 或是否启用法律检索插件。Trajectory 帖称整个后训练在 Nemotron 3 Ultra 发布后不到 24 小时完成。

结果数据

模型LAB 全通过率
Nemotron 3 Ultra(未后训练)0%
Claude Sonnet 4.64.2%
Nemotron 3 Ultra(法律后训练)5.8%
Claude Opus 4.66.6%

Harvey 还写:后训练后的开源权重模型达到与领先闭源模型相近的质量,运行成本为 Sonnet 4.6 与 Opus 4.6 每 token 价格的 1/8 到 1/50。

结论

法律代理“全通过”非常苛刻:Sonnet 4.6 的 4.2% 不表示它不能做法律辅助,而表示在 Harvey 的全维度通过标准下,它明显弱于 Opus 4.6,也弱于专门后训练的 Nemotron。适合把 Sonnet 4.6 用于法律草稿/检索辅助,不适合当作 LAB 意义上的自动过关代理。高风险法律交付仍应走 Opus 或领域后训练模型,并保留律师复核。

局限

  • 全通过率不是部分正确率;4.2% 与日常“能写出可用备忘录”不是同一指标。

  • 未公开逐题结果和 Sonnet 配置。

  • 成本 1/8–1/50 是作者对 Nemotron vs Claude 单价的陈述,不是 LAB 分数。

  • 不能把 LAB 与 IDP 文档抽取或 SWE 编码混为一谈。

复现步骤

  1. 若 Harvey/Trajectory 后续公开 LAB 子集,固定同一评分维度跑 claude-sonnet-4-6 与 claude-opus-4-6。

  2. 分别报告全通过、部分通过、引用错误和遗漏评分维度。

  3. 记录检索工具、jurisdictions 和是否允许联网。

  4. 法律结论必须由有资质的人复核,模型分数不能替代。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 4.6

在 Tabbit 中使用并对比模型

Claude Sonnet 4.6

相关测评

媒体Anthropic News / Introducing Sonnet 4.62026-02-17

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准

媒体BenchLM2026-08-17

BenchLM 对 Claude Sonnet 4.6 的公开证据账本

媒体IDP Leaderboard2026-03

IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平

媒体Artificial Analysis

Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37

Claude Sonnet 4.6

相关提示词

媒体Claude Platform Docs / Prompting best practices

Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示

媒体Claude Platform Docs / Effort 与 Prompting best practices

Claude Sonnet 4.6 的 effort 与工具触发配置

媒体Anthropic Platform Docs / Computer Use API Reference2026-02-17

Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流

媒体Anthropic Platform Docs / Context Management & Compaction2026-02-17

Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置