Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Gemini 3.8 Flash

Vals AI Finance Agent v2:Gemini 3.8 Flash 的专业金融 Agent 基准

原始来源

Vals AI

作者Vals AI

原文日期2026-09-05

Tabbit 整理2026-09-08

查看原文

一句话结论

在 Vals AI Finance Agent v2 的整体任务上,Gemini 3.8 Flash 的 Partial Credit 为 61.44% ± 0.13,在页面列出的 58 个系统中排名第 1;严格 All-Pass 为 49.69% ± 0.42,排名第 2。它适合评估“从公开公司文件中检索、核对并完成多步金融分析”的 Agent,不应解读为通用智能或生产投研准确率。

适用场景

  • 适合观察的任务:公开公司 filings 上的定量/定性分析、市场分析、盈利分析、披露分析、可比公司、先例交易、调整和金融建模。

  • 不适合直接推断的任务:通用问答、非金融领域、实时交易决策、没有同等工具和文件上下文的 Agent,以及生产系统的稳定性或合规性。

  • 适用的模型版本:Vals AI 模型页中的 Gemini 3.8 Flash;不要延伸到 Gemini 3.7 Flash、Gemini 3.8 Flash Cyber 或其他 provider/推理档位。

  • 适用的客户端、Agent 或 API:Vals AI Finance Agent v2 的 shared default harness;不是 Gemini App 或任意自建 Agent 的端到端成绩。

  • 推荐参数:模型页显示的页面默认值为 Google provider、temperature 1、top-p/top-k DEFAULT、max output 65,536、reasoning effort HIGH;页面同时警告不同 benchmark 可能使用不同 provider/参数,复测时不能把这些页面默认值当作 Finance Agent v2 的完整运行日志。

测试环境与方法

  • 目标工作:模拟入门级金融分析师,回答基于公开公司 filings 的困难问题;题目通常要求跨多份 filing 或数据源找证据、应用金融惯例,并保持中间数字的精确性。

  • Shared default harness:每个 Agent 可使用六个工具:edgar_search(SEC EDGAR API)、web_search、parse_html_page、retrieve_information、calculator 和 price_history。

  • 时间限制:每题 2 小时;超时记为 0 分。

  • 运行与统计:每个模型运行 3 次;页面报告三次运行均值及标准误(SEM)。

  • 评分:每题由带权检查项组成,并设有 dealbreaker(关键事实/数字)。Partial Credit 是 dealbreaker 门控、按严重度加权的每题平均;关键项失败则该题得 0。All-Pass 只有所有检查项通过才为 100%,否则为 0。

  • 评审器:Vals AI 页面列出三名 LLM 评审器:GPT-5.4、Gemini-3.1-Pro 和 Claude Sonnet 4.6。

  • 题目设计:要求确定答案、多源综合、领域特异性和 forensic precision(关键事实可能藏在脚注、MD&A 限定语或会计政策披露中)。

样本与覆盖范围

Finance Agent v2 共 927 道专家审核题,拆为:

数据部分规模可用性
Public27开源样本与 Agent harness 可访问
Private Validation450需授权/许可
Test450保持私有;页面公布结果只基于此部分

题目分成 9 个分析类别:General Qualitative Analysis、General Quantitative Analysis、Market Analysis、Comparables、Precedents、Adjustments、Earnings Analysis、Disclosure Analysis、Financial Modeling。页面显示的类别最高准确率从 General Qualitative 的 83.4% 到 Financial Modeling 的 34.5%,说明该基准覆盖从检索总结到多步建模的难度跨度;这些是类别领先模型的结果,不是 Gemini 3.8 Flash 的逐类别成绩。

Gemini 3.8 Flash 结果

Finance Agent v2 / Overall

评分口径准确率页面排名每测试成本输入/输出单价页面耗时
Partial Credit61.44% ± 0.131 / 58$2.00$1.50 / $7.50 每百万 token3 分 21 秒
All-Pass49.69% ± 0.422 / 58$2.00$1.50 / $7.50 每百万 token3 分 21 秒

Vals AI 模型页也把 Finance Agent (v2) 列为 61.44% ± 0.13、1/58;该页总览的 Vals Index 是另一个聚合指标,不能替换 Finance Agent v2 的专项分数。

结论

  1. 专业金融 Agent 表现强:在 Vals AI 的 Finance Agent v2 Overall 表中,Gemini 3.8 Flash 以 61.44% Partial Credit 排名第一;相邻第二名 Muse Spark 1.2 为 60.60% ± 0.28,差距很小,不宜据此宣称跨任务全面领先。

  2. 严格正确率仍有限:All-Pass 下降到 49.69%,且排名为第二;Partial Credit 与 All-Pass 的落差说明模型可能抓住关键点,但仍会漏掉外围检查项或精确数字。

  3. 成本要按完整测试看:页面记录每测试 $2.00,另列输入/输出价格 $1.50/$7.50 每百万 token;这不是任意 API 请求的固定账单,也不代表换 provider 后成本不变。

局限与边界

  • 不能完整逐题复现:公开部分只有 27 题;450 道 Test 题保持私有,页面公布的 61.44%/49.69% 不能仅凭公开集重算。

  • harness 影响很大:六个工具、文件抓取、检索方式、计算器调用和停止条件都是成绩组成部分;脱离该 harness 的 Gemini 3.8 Flash 不应套用此分数。

  • 评分不是单一正确率:Partial Credit 受到 dealbreaker 和严重度加权影响,All-Pass 则是全检查项通过的二值口径;两者不应混为一个“准确率”。

  • 动态快照:页面标注 UPDATED 9/5/2026;模型列表、价格、排名和模型可用性可能变化,本文数字只对应 2026-09-08 采集到的页面快照。

  • 问题范围有限:题目围绕公开公司 filings 和金融分析师工作,不覆盖视觉理解、一般代码能力、中文本地化投研、合规判断或真实投资回报。

  • 页面参数不是完整运行日志:模型页的默认 provider/temperature/reasoning 设置不能证明 benchmark 每一次运行都使用完全相同的配置;应以 Vals AI benchmark 页面和目标运行日志为准。

复现条件与步骤

  1. 固定 Vals AI Finance Agent v2 页面版本、模型精确名称 Gemini 3.8 Flash、provider、temperature、top-p/top-k、max output tokens、reasoning effort 和价格快照。

  2. 使用 shared default harness 的六个工具与两小时单题上限;保留每次搜索、页面解析、信息检索、计算器和价格历史调用轨迹。

  3. 先用公开 27 题检查接入,再申请同一 Test split;不要用公开题或自拟题宣称复现页面的 450 题成绩。

  4. 每题运行 3 次,用同一检查项权重、dealbreaker 门控、严重度规则和三评审器设置计算 Partial Credit 与 All-Pass,并报告均值和 SEM。

  5. 同时记录每测试成本、输入/输出 token、完整耗时、超时、工具错误和 fallback;若 provider 或 harness 不同,单独命名为新实验,不与本页排名合并。

原始证据与数据

  • Vals AI Finance Agent v2 原始页面:https://www.vals.ai/benchmarks/fabv2;页面显示 UPDATED 9/5/2026、927 道专家审核题、shared harness、6 个工具、2 小时限制、3 次运行,以及 Partial Credit/All-Pass 的定义。

  • 同一页面的 Overall 表:Gemini 3.8 Flash 为 Partial Credit 61.44% ± 0.13、1/58、$2.00/test、3m21s;切换到 All-Pass 后为 49.69% ± 0.42、2/58。

  • Vals AI 原始模型页:https://www.vals.ai/models/google_gemini-3.8-flash;页面列出模型发布日、Google provider、token 价格、Finance Agent (v2) 的 61.44% ± 0.13 与 1/58,并提供页面默认超参数。

来源摘录或观察(仅做合规短引)

Vals AI 将 Finance Agent v2 概括为 “Evaluating agents on core financial analyst tasks”。这句话准确限定了测试对象:它是专业金融分析工作流基准,不是 Gemini 3.8 Flash 的通用能力总评。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.8 Flash

在 Tabbit 中使用并对比模型

Gemini 3.8 Flash

相关测评

官方Google Blog(The Keyword)2026-09-02

Gemini 3.8 Flash:Google 官方发布基准与复现边界

媒体Artificial Analysis(官网模型页、方法论与发布文章;X 官方账号用于发现并核对发布帖)2026-09-02

Gemini 3.8 Flash:Artificial Analysis 智能、速度、价格与延迟

媒体AI IQ(AIIQ,Liberated Software LLC)2026-09-02

Gemini 3.8 Flash:AI IQ 能力基准与任务边界

媒体SimpleBench 官方榜单与项目

SimpleBench:Gemini 3.8 Flash 的日常推理与语言陷阱基准

Gemini 3.8 Flash

相关提示词

官方Google AI for Developers / Google DeepMind2026-09-02

Gemini 3.8 Flash:Google 官方模型参数与 API 配置

官方Google AI for Developers2026-06-10

Gemini 3.8 Flash:Google 官方结构化提示与 Agent 工作流

官方Google AI for Developers

Gemini 3.8 Flash:Google 官方函数调用配置与工具工作流

官方Google AI for Developers2026-09-02

Gemini 3.8 Flash:Google 官方结构化输出配置