在 Vals AI 的 Harvey's Legal Agent Benchmark v1 held-out test set 上,Gemini 3.8 Flash 的严格 Task Pass Rate 为 10.00% ± 2.42%,59 个系统中排名第 11;页面同时显示 Criteria Pass Rate 为 90.19% ± 0.36%。它能通过大部分单项标准,但只有少数任务做到全部标准通过,不能把 10% 解读为通用法律能力或可直接交付的法律准确率。
任务对象:使用文件和工具完成法律工作,而不是回答孤立的法律问答;输入可包含文档、表格、演示文稿和文件系统材料。
数据切分:页面说明当前有 public set 与 held-out test set;本页结果来自 held-out set。页面的 fallback 辅助说明以 120 tasks 为分母,本文将其记录为当前运行的任务规模,但页面正文未逐项公开任务清单。
覆盖范围:页面图表提供 24 个 task types,可见类别包括 Intellectual Property、Corporate M&A、Data Privacy/Cybersecurity、Banking Finance、Capital Markets、Corporate Governance、International Trade Sanctions、Real Estate 和 Energy/Natural Resources 等。
适合观察:长链路文件检索、跨材料综合、法律分析和 review-ready work product 的端到端任务完成度。
不适合外推:中文法律语境、开放网络法律检索、任意自建 Agent、单轮问答、真实客户交付或律师执业结论。
Vals AI 说明其采用 Harvey 的生成与评分协议,并在关闭互联网访问的环境中运行。每个任务要求 Agent 对任务专属标准产出法律工作;页面记录的共享 Agent harness 包括:
工具(6 个):Read File、Edit File、Write File、Glob、Bash、Grep。
技能(3 个):docx、pptx、xlsx。
评分:两名 LLM judge 分别计算 task pass rate;只有该任务的 100% criteria 全部通过才算任务通过,最终分数是两名 judge task pass rate 的平均值。
评审器:GPT 5.5(medium reasoning)与 Claude Sonnet 4.6(未修改)。
基础设施:Vals AI 使用其 model library 和 Valkyrie Agent benchmark framework;页面称这些是基础设施变更,不改变模型性能口径。
页面内嵌结果数据给出的运行参数为:Google provider、temperature 1、reasoning effort high、max output tokens 65,536;top_p 与模型专属 harness 未报告。页面没有披露 Gemini 的 API snapshot、system prompt、随机种子、重试策略或完整调用日志。
| 评分口径 | Gemini 3.8 Flash | 页面排名 | 每测试成本 | 输入/输出单价 | 页面耗时 |
|---|---|---|---|---|---|
| Task Pass Rate(all-pass) | 10.00% ± 2.42% | 11 / 59 | $3.66 | $1.50 / $7.50 每百万 token | 29 分 21 秒 |
| Criteria Pass Rate | 90.19% ± 0.36% | 页面未单独给出 | $3.66 | $1.50 / $7.50 每百万 token | 29 分 21 秒 |
页面同一 Overall 表中的相邻结果为:Kimi K3 10.83%(第 9 名)、Qwen 3.8 Max 10.42%(第 10 名)、Claude Opus 4.8 9.58%(第 12 名)、Gemini 3.7 Flash 8.75%(第 13 名)。这是同一页面快照的相对位置,不代表差异已达到统计显著性。
标准级通过率高,任务级完成率低:90.19% 的 criteria pass rate 与 10.00% 的 all-pass task rate 之间存在明显落差;漏掉一个必要标准就无法获得整题通过,因此不能用前者替代端到端任务成功率。
排名只对该实验口径成立:第 11/59 是 Vals AI held-out set、六工具、三技能、双评审器和页面参数组合下的名次,不是 Gemini 3.8 Flash 在所有法律基准中的总排名。
工具使用是成绩组成部分:文件格式处理、Bash/Read File 等调用和技能说明共同构成 Agent 环境;脱离该 harness 的裸模型请求不应直接套用 10.00%。
私有任务不可完全复现:held-out set 的逐题输入、材料、rubric 和 Gemini 逐题输出没有在页面公开;120 tasks 只能从页面辅助说明看到,不能据此重建题集。
严格 all-pass 不是部分正确率:一项 criteria 失败会使整题不通过;10.00% 不等于只有 10% 的法律内容正确。
参数仍不完整:页面给出 provider、temperature、reasoning effort 和 max output tokens,但未给出 API snapshot、prompt、top_p 具体值、seed、重试/失败处理和模型专属 harness。
无互联网条件限制外推:该运行关闭互联网访问,结果更接近封闭 client-matter 文件工作,不覆盖在线法律检索或实时法规更新。
动态快照:页面标注 UPDATED 9/5/2026;模型列表、价格、耗时、排名和任务数据可能继续变化,本文数字仅对应 2026-09-08 采集快照。
评审器误差:最终分数是 GPT 5.5 与 Claude Sonnet 4.6 两名 LLM judge 的平均,页面未提供 Gemini 的逐 judge 分数或人工复核差异。
固定 Harvey LAB v1 的同一 held-out/public split、120 tasks 分母、任务材料、rubric 和停止条件;若只能访问 public set,应单独标为公开集实验。
固定 google/gemini-3.8-flash、Google provider、temperature 1、reasoning effort high、max output tokens 65,536,并记录实际 API snapshot、top_p、prompt、重试和失败处理。
使用同样的六工具、docx/pptx/xlsx 技能与无互联网环境,保留每次调用轨迹和最终文件。
用 GPT 5.5 medium 与未修改的 Claude Sonnet 4.6 分别按二值 criteria 评分,报告两名 judge 的 task pass rate、criteria pass rate 和平均值;不要把 Criteria Pass Rate 当作 All-Pass。
Vals AI Harvey's Legal Agent Benchmark 原始页面:https://www.vals.ai/benchmarks/hlab。页面显示 v1、UPDATED 9/5/2026、held-out test set、59 个系统、6 个工具、3 个技能、双 LLM judge 和关闭互联网的运行条件。
同页 Overall 结果表内,google/gemini-3.8-flash 为 10.00% ± 2.42%、第 11/59、$3.656207/test、1760.877 秒;页面内嵌 Criteria Pass Rate 数据为 90.187% ± 0.358%,本文按展示精度四舍五入。
Vals AI 将该基准概括为测试 Agent “complete legal work using documents, spreadsheets, presentations, and file-system tools”。这准确限定了本文结论:测的是带文件与工具的端到端法律 Agent 任务,不是通用法律问答。
Gemini 3.8 Flash