在 Vals AI Finance Agent v2 的整体任务上,Gemini 3.8 Flash 的 Partial Credit 为 61.44% ± 0.13,在页面列出的 58 个系统中排名第 1;严格 All-Pass 为 49.69% ± 0.42,排名第 2。它适合评估“从公开公司文件中检索、核对并完成多步金融分析”的 Agent,不应解读为通用智能或生产投研准确率。
适合观察的任务:公开公司 filings 上的定量/定性分析、市场分析、盈利分析、披露分析、可比公司、先例交易、调整和金融建模。
不适合直接推断的任务:通用问答、非金融领域、实时交易决策、没有同等工具和文件上下文的 Agent,以及生产系统的稳定性或合规性。
适用的模型版本:Vals AI 模型页中的 Gemini 3.8 Flash;不要延伸到 Gemini 3.7 Flash、Gemini 3.8 Flash Cyber 或其他 provider/推理档位。
适用的客户端、Agent 或 API:Vals AI Finance Agent v2 的 shared default harness;不是 Gemini App 或任意自建 Agent 的端到端成绩。
推荐参数:模型页显示的页面默认值为 Google provider、temperature 1、top-p/top-k DEFAULT、max output 65,536、reasoning effort HIGH;页面同时警告不同 benchmark 可能使用不同 provider/参数,复测时不能把这些页面默认值当作 Finance Agent v2 的完整运行日志。
目标工作:模拟入门级金融分析师,回答基于公开公司 filings 的困难问题;题目通常要求跨多份 filing 或数据源找证据、应用金融惯例,并保持中间数字的精确性。
Shared default harness:每个 Agent 可使用六个工具:edgar_search(SEC EDGAR API)、web_search、parse_html_page、retrieve_information、calculator 和 price_history。
时间限制:每题 2 小时;超时记为 0 分。
运行与统计:每个模型运行 3 次;页面报告三次运行均值及标准误(SEM)。
评分:每题由带权检查项组成,并设有 dealbreaker(关键事实/数字)。Partial Credit 是 dealbreaker 门控、按严重度加权的每题平均;关键项失败则该题得 0。All-Pass 只有所有检查项通过才为 100%,否则为 0。
评审器:Vals AI 页面列出三名 LLM 评审器:GPT-5.4、Gemini-3.1-Pro 和 Claude Sonnet 4.6。
题目设计:要求确定答案、多源综合、领域特异性和 forensic precision(关键事实可能藏在脚注、MD&A 限定语或会计政策披露中)。
Finance Agent v2 共 927 道专家审核题,拆为:
| 数据部分 | 规模 | 可用性 |
|---|---|---|
| Public | 27 | 开源样本与 Agent harness 可访问 |
| Private Validation | 450 | 需授权/许可 |
| Test | 450 | 保持私有;页面公布结果只基于此部分 |
题目分成 9 个分析类别:General Qualitative Analysis、General Quantitative Analysis、Market Analysis、Comparables、Precedents、Adjustments、Earnings Analysis、Disclosure Analysis、Financial Modeling。页面显示的类别最高准确率从 General Qualitative 的 83.4% 到 Financial Modeling 的 34.5%,说明该基准覆盖从检索总结到多步建模的难度跨度;这些是类别领先模型的结果,不是 Gemini 3.8 Flash 的逐类别成绩。
| 评分口径 | 准确率 | 页面排名 | 每测试成本 | 输入/输出单价 | 页面耗时 |
|---|---|---|---|---|---|
| Partial Credit | 61.44% ± 0.13 | 1 / 58 | $2.00 | $1.50 / $7.50 每百万 token | 3 分 21 秒 |
| All-Pass | 49.69% ± 0.42 | 2 / 58 | $2.00 | $1.50 / $7.50 每百万 token | 3 分 21 秒 |
Vals AI 模型页也把 Finance Agent (v2) 列为 61.44% ± 0.13、1/58;该页总览的 Vals Index 是另一个聚合指标,不能替换 Finance Agent v2 的专项分数。
专业金融 Agent 表现强:在 Vals AI 的 Finance Agent v2 Overall 表中,Gemini 3.8 Flash 以 61.44% Partial Credit 排名第一;相邻第二名 Muse Spark 1.2 为 60.60% ± 0.28,差距很小,不宜据此宣称跨任务全面领先。
严格正确率仍有限:All-Pass 下降到 49.69%,且排名为第二;Partial Credit 与 All-Pass 的落差说明模型可能抓住关键点,但仍会漏掉外围检查项或精确数字。
成本要按完整测试看:页面记录每测试 $2.00,另列输入/输出价格 $1.50/$7.50 每百万 token;这不是任意 API 请求的固定账单,也不代表换 provider 后成本不变。
不能完整逐题复现:公开部分只有 27 题;450 道 Test 题保持私有,页面公布的 61.44%/49.69% 不能仅凭公开集重算。
harness 影响很大:六个工具、文件抓取、检索方式、计算器调用和停止条件都是成绩组成部分;脱离该 harness 的 Gemini 3.8 Flash 不应套用此分数。
评分不是单一正确率:Partial Credit 受到 dealbreaker 和严重度加权影响,All-Pass 则是全检查项通过的二值口径;两者不应混为一个“准确率”。
动态快照:页面标注 UPDATED 9/5/2026;模型列表、价格、排名和模型可用性可能变化,本文数字只对应 2026-09-08 采集到的页面快照。
问题范围有限:题目围绕公开公司 filings 和金融分析师工作,不覆盖视觉理解、一般代码能力、中文本地化投研、合规判断或真实投资回报。
页面参数不是完整运行日志:模型页的默认 provider/temperature/reasoning 设置不能证明 benchmark 每一次运行都使用完全相同的配置;应以 Vals AI benchmark 页面和目标运行日志为准。
固定 Vals AI Finance Agent v2 页面版本、模型精确名称 Gemini 3.8 Flash、provider、temperature、top-p/top-k、max output tokens、reasoning effort 和价格快照。
使用 shared default harness 的六个工具与两小时单题上限;保留每次搜索、页面解析、信息检索、计算器和价格历史调用轨迹。
先用公开 27 题检查接入,再申请同一 Test split;不要用公开题或自拟题宣称复现页面的 450 题成绩。
每题运行 3 次,用同一检查项权重、dealbreaker 门控、严重度规则和三评审器设置计算 Partial Credit 与 All-Pass,并报告均值和 SEM。
同时记录每测试成本、输入/输出 token、完整耗时、超时、工具错误和 fallback;若 provider 或 harness 不同,单独命名为新实验,不与本页排名合并。
Vals AI Finance Agent v2 原始页面:https://www.vals.ai/benchmarks/fabv2;页面显示 UPDATED 9/5/2026、927 道专家审核题、shared harness、6 个工具、2 小时限制、3 次运行,以及 Partial Credit/All-Pass 的定义。
同一页面的 Overall 表:Gemini 3.8 Flash 为 Partial Credit 61.44% ± 0.13、1/58、$2.00/test、3m21s;切换到 All-Pass 后为 49.69% ± 0.42、2/58。
Vals AI 原始模型页:https://www.vals.ai/models/google_gemini-3.8-flash;页面列出模型发布日、Google provider、token 价格、Finance Agent (v2) 的 61.44% ± 0.13 与 1/58,并提供页面默认超参数。
Vals AI 将 Finance Agent v2 概括为 “Evaluating agents on core financial analyst tasks”。这句话准确限定了测试对象:它是专业金融分析工作流基准,不是 Gemini 3.8 Flash 的通用能力总评。
Gemini 3.8 Flash