Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Gemini 3.8 Flash

Gemini 3.8 Flash:Vals AI Harvey 法律 Agent 基准复测

原始来源

Vals AI

作者Vals AI

原文日期2026-09-05

Tabbit 整理2026-09-08

查看原文

一句话结论

在 Vals AI 的 Harvey's Legal Agent Benchmark v1 held-out test set 上,Gemini 3.8 Flash 的严格 Task Pass Rate 为 10.00% ± 2.42%,59 个系统中排名第 11;页面同时显示 Criteria Pass Rate 为 90.19% ± 0.36%。它能通过大部分单项标准,但只有少数任务做到全部标准通过,不能把 10% 解读为通用法律能力或可直接交付的法律准确率。

任务集与适用范围

  • 任务对象:使用文件和工具完成法律工作,而不是回答孤立的法律问答;输入可包含文档、表格、演示文稿和文件系统材料。

  • 数据切分:页面说明当前有 public set 与 held-out test set;本页结果来自 held-out set。页面的 fallback 辅助说明以 120 tasks 为分母,本文将其记录为当前运行的任务规模,但页面正文未逐项公开任务清单。

  • 覆盖范围:页面图表提供 24 个 task types,可见类别包括 Intellectual Property、Corporate M&A、Data Privacy/Cybersecurity、Banking Finance、Capital Markets、Corporate Governance、International Trade Sanctions、Real Estate 和 Energy/Natural Resources 等。

  • 适合观察:长链路文件检索、跨材料综合、法律分析和 review-ready work product 的端到端任务完成度。

  • 不适合外推:中文法律语境、开放网络法律检索、任意自建 Agent、单轮问答、真实客户交付或律师执业结论。

方法与工具

Vals AI 说明其采用 Harvey 的生成与评分协议,并在关闭互联网访问的环境中运行。每个任务要求 Agent 对任务专属标准产出法律工作;页面记录的共享 Agent harness 包括:

  • 工具(6 个):Read File、Edit File、Write File、Glob、Bash、Grep。

  • 技能(3 个):docx、pptx、xlsx。

  • 评分:两名 LLM judge 分别计算 task pass rate;只有该任务的 100% criteria 全部通过才算任务通过,最终分数是两名 judge task pass rate 的平均值。

  • 评审器:GPT 5.5(medium reasoning)与 Claude Sonnet 4.6(未修改)。

  • 基础设施:Vals AI 使用其 model library 和 Valkyrie Agent benchmark framework;页面称这些是基础设施变更,不改变模型性能口径。

Gemini 3.8 Flash 页面参数

页面内嵌结果数据给出的运行参数为:Google provider、temperature 1、reasoning effort high、max output tokens 65,536;top_p 与模型专属 harness 未报告。页面没有披露 Gemini 的 API snapshot、system prompt、随机种子、重试策略或完整调用日志。

结果数据

评分口径Gemini 3.8 Flash页面排名每测试成本输入/输出单价页面耗时
Task Pass Rate(all-pass)10.00% ± 2.42%11 / 59$3.66$1.50 / $7.50 每百万 token29 分 21 秒
Criteria Pass Rate90.19% ± 0.36%页面未单独给出$3.66$1.50 / $7.50 每百万 token29 分 21 秒

页面同一 Overall 表中的相邻结果为:Kimi K3 10.83%(第 9 名)、Qwen 3.8 Max 10.42%(第 10 名)、Claude Opus 4.8 9.58%(第 12 名)、Gemini 3.7 Flash 8.75%(第 13 名)。这是同一页面快照的相对位置,不代表差异已达到统计显著性。

结论

  1. 标准级通过率高,任务级完成率低:90.19% 的 criteria pass rate 与 10.00% 的 all-pass task rate 之间存在明显落差;漏掉一个必要标准就无法获得整题通过,因此不能用前者替代端到端任务成功率。

  2. 排名只对该实验口径成立:第 11/59 是 Vals AI held-out set、六工具、三技能、双评审器和页面参数组合下的名次,不是 Gemini 3.8 Flash 在所有法律基准中的总排名。

  3. 工具使用是成绩组成部分:文件格式处理、Bash/Read File 等调用和技能说明共同构成 Agent 环境;脱离该 harness 的裸模型请求不应直接套用 10.00%。

局限与复现边界

  • 私有任务不可完全复现:held-out set 的逐题输入、材料、rubric 和 Gemini 逐题输出没有在页面公开;120 tasks 只能从页面辅助说明看到,不能据此重建题集。

  • 严格 all-pass 不是部分正确率:一项 criteria 失败会使整题不通过;10.00% 不等于只有 10% 的法律内容正确。

  • 参数仍不完整:页面给出 provider、temperature、reasoning effort 和 max output tokens,但未给出 API snapshot、prompt、top_p 具体值、seed、重试/失败处理和模型专属 harness。

  • 无互联网条件限制外推:该运行关闭互联网访问,结果更接近封闭 client-matter 文件工作,不覆盖在线法律检索或实时法规更新。

  • 动态快照:页面标注 UPDATED 9/5/2026;模型列表、价格、耗时、排名和任务数据可能继续变化,本文数字仅对应 2026-09-08 采集快照。

  • 评审器误差:最终分数是 GPT 5.5 与 Claude Sonnet 4.6 两名 LLM judge 的平均,页面未提供 Gemini 的逐 judge 分数或人工复核差异。

复现建议

  1. 固定 Harvey LAB v1 的同一 held-out/public split、120 tasks 分母、任务材料、rubric 和停止条件;若只能访问 public set,应单独标为公开集实验。

  2. 固定 google/gemini-3.8-flash、Google provider、temperature 1、reasoning effort high、max output tokens 65,536,并记录实际 API snapshot、top_p、prompt、重试和失败处理。

  3. 使用同样的六工具、docx/pptx/xlsx 技能与无互联网环境,保留每次调用轨迹和最终文件。

  4. 用 GPT 5.5 medium 与未修改的 Claude Sonnet 4.6 分别按二值 criteria 评分,报告两名 judge 的 task pass rate、criteria pass rate 和平均值;不要把 Criteria Pass Rate 当作 All-Pass。

原始证据与数据

  • Vals AI Harvey's Legal Agent Benchmark 原始页面:https://www.vals.ai/benchmarks/hlab。页面显示 v1、UPDATED 9/5/2026、held-out test set、59 个系统、6 个工具、3 个技能、双 LLM judge 和关闭互联网的运行条件。

  • 同页 Overall 结果表内,google/gemini-3.8-flash 为 10.00% ± 2.42%、第 11/59、$3.656207/test、1760.877 秒;页面内嵌 Criteria Pass Rate 数据为 90.187% ± 0.358%,本文按展示精度四舍五入。

来源摘录或观察(仅做合规短引)

Vals AI 将该基准概括为测试 Agent “complete legal work using documents, spreadsheets, presentations, and file-system tools”。这准确限定了本文结论:测的是带文件与工具的端到端法律 Agent 任务,不是通用法律问答。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.8 Flash

在 Tabbit 中使用并对比模型

Gemini 3.8 Flash

相关测评

官方Google Blog(The Keyword)2026-09-02

Gemini 3.8 Flash:Google 官方发布基准与复现边界

媒体Artificial Analysis(官网模型页、方法论与发布文章;X 官方账号用于发现并核对发布帖)2026-09-02

Gemini 3.8 Flash:Artificial Analysis 智能、速度、价格与延迟

媒体AI IQ(AIIQ,Liberated Software LLC)2026-09-02

Gemini 3.8 Flash:AI IQ 能力基准与任务边界

媒体Vals AI2026-09-05

Vals AI Finance Agent v2:Gemini 3.8 Flash 的专业金融 Agent 基准

Gemini 3.8 Flash

相关提示词

官方Google AI for Developers / Google DeepMind2026-09-02

Gemini 3.8 Flash:Google 官方模型参数与 API 配置

官方Google AI for Developers2026-06-10

Gemini 3.8 Flash:Google 官方结构化提示与 Agent 工作流

官方Google AI for Developers

Gemini 3.8 Flash:Google 官方函数调用配置与工具工作流

官方Google AI for Developers2026-09-02

Gemini 3.8 Flash:Google 官方结构化输出配置