Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Gemini 3.7 Flash · 媒体来源 · 编辑分析

Gemini 3.7 Flash:真实价格、速度与 Agent 边界(eesel)

这条证据围绕“Gemini 3.7 Flash:真实价格、速度与 Agent 边界(eesel)”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

测试条件
eesel 文章针对 GA 版 gemini-3.7-flash,汇总 low/medium/high thinking、OpenRouter/Artificial Analysis 数据与单客户每月超过 100,000 条德语工单经验;价格含日期和 introductory 条件。
来源边界
支持讨论思考档位如何改变首 token、输出 token 和任务成本,并提示用自身工单干跑。
不能支持
不支持将 340.1 tok/s、单客户经验或 2026-12-31 前价格外推为所有提供商/生产场景结论。

关键数据与适用场景

一句话结论

Gemini 3.7 Flash 的速度、文档/多模态和窄范围重构很强,但高档思考会显著增加首 token 延迟与 token 成本,且长期客服/自动化选型必须用自己的历史工单做干跑验证。

适用场景

  • 适合的任务:PDF/OCR/图表与长上下文检索;图片、视频和文档理解;网页/UI 生成;窄范围代码重构;需要高吞吐的批量任务。

  • 不适合的任务:未经人工审核直接回复客户;长时间终端 Agent 追求一次完成;以“最低 token 价格”为唯一目标的分类/标注工作(minimal 档已移除且思考 token 计费)。

  • 适用的模型版本:gemini-3.7-flash,GA 发布版本(2026-08-13)。

  • 适用的客户端、Agent 或 API:Gemini API、Google AI Studio、Google Antigravity;文中也比较 OpenRouter/Vertex 的运行指标与 API 价格。

  • 推荐的推理档位和参数:low 适合低延迟草稿、实时聊天和快速分析;medium(默认)适合复杂代码/Agent;high 适合难数学、最难编码和长工具链,但需要承受更高延迟和 token 消耗。

测试环境

  • 独立运行数据:Artificial Analysis 速度/智能/幻觉数据;OpenRouter P50 与提供商吞吐;作者在 eesel 的真实客服集成经验(单客户每月超过 100,000 条德语 Zendesk 工单)。

  • 发布方对照:Google 的 21 行模型卡比较表,含 Gemini 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra、Muse Spark 1.2。

  • 价格时间点:2026-12-31 前 introductory price 为输入 $0.75/1M、输出 $3.75/1M;2027-01-01 起变为 $1.50/1M、$7.50/1M。思考 token 按输出价格计费。

输入/配置

  • 输入模态:文本、图片、视频、音频和 PDF;输出为文本。

  • 上下文窗口:1M token;输出上限 64K。

  • 从旧 Gemini 版本迁移时,文章提醒移除 temperature、top_p、top_k、candidate_count,把数值 thinking_budget 改为 thinking_level,移除预填充 model turn,并把多轮历史迁移到服务端 previous_interaction_id。

  • 文章指出 minimal 思考级别在 3.7 Flash 不再可用;调用者应显式记录 low/medium/high,不要假定旧模型的四档配置仍兼容。

结果数据

速度、成本与思考档位

档位Artificial Analysis Intelligence Index首 token 延迟每 benchmark task 成本
high56.09.83 秒(p95 49.5 秒)$0.40
medium53.54.22 秒$0.26
low50.90.74 秒$0.16
  • Artificial Analysis:340.1 output tokens/s,188 个模型中速度第一;同页对照类别中位数为 68.6 tok/s。

  • OpenRouter:P50 约 93 tok/s、延迟 1.85 秒;Google AI Studio 约 124 tok/s/1.74 秒,Vertex 约 84 tok/s/2.02 秒。

  • 高思考相对 Gemini 3.6 Flash 的 token 使用约增加 40%,平均每任务约 37K output tokens;速度快不等于完成任务总耗时或成本低。

  • Artificial Analysis 的独立幻觉率记录为 64.5%,Gemini 3.6 Flash 为 55.6%;作者强调准确率提升与幻觉率上升可以同时发生。

Google 发布表中关键行

基准Gemini 3.7 FlashGemini 3.6 FlashGPT-5.6 Terra观察
FrontierCode 1.1 Main43.6%34.4%41.3%3.7 领先
DeepSWE v1.165.3%48.6%69.6%Terra 领先
Code Arena1588 Elo153815233.7 领先
Terminal-Bench 2.185.8%78.0%87.4%Terra 领先
Terminal-Bench 3.014.9%5.4%20.8%Terra 领先
AutomationBench30.4%17.0%23.6%3.7 领先
GDP.pdf34.0%22.0%24.7%3.7 领先
LVBench85.4%84.2%78.9%3.7 领先
GDM-MRCR v2 @128K97.0%91.8%93.5%3.7 领先
OSWorld-2.047.9%33.8%50.2%Terra 领先
CharXiv(无工具)84.5%85.2%85.9%3.6 略高
CharXiv(有工具)88.7%89.4%未列3.6 略高

结论

  1. 能力形状比总分更有用:3.7 Flash 在文档、视频、图表、长上下文和 UI 生成上形成一致优势;长程终端编码的四项关键指标仍由 GPT-5.6 Terra 领先。

  2. 低档可能是生产默认:在作者引用的数据中,low 的 50.9 分接近 3.6 Flash 高档,但首 token 0.74 秒、任务成本 $0.16;不应无条件使用默认 medium。

  3. 速度需要按“每任务”核算:340 tok/s 的输出速度被高档思考的 37K 平均输出 token 抵消;应记录完成任务成本与人工修正,而不是只看 tok/s。

  4. 可靠性取决于外部控制:作者建议支持场景采用“分类/检索 → 尝试自动处理 → 低置信度转人工”的流程,并在自有历史工单上干跑后再上线。

局限

  • 文章部分数字来自 Artificial Analysis、OpenRouter 和 Google 发布表;并非同一 harness 下的完整独立对照。

  • 幻觉率的定义、样本、任务集与时间窗口未在本文完整披露;不能直接外推到 Tabbit 内容或客服数据。

  • eesel 的生产工作负载与商业产品经验可能存在选择偏差,且 100,000+ 工单案例不是公开可复现数据集。

  • Google 表中的 Terminal-Bench 3.0、AutomationBench 等部分项目带有私有集或发布方口径;不要把它们与 Artificial Analysis 独立测量混为一谈。

  • 价格为指定日期前的 introductory rate;正式上线预算必须重新核对官方价格页。

复现步骤

  1. 在 Gemini API 或 AI Studio 固定同一个输入集合,显式切换 low、medium、high,保存 usage.total_thought_tokens、首 token 延迟、总延迟和输出 token。

  2. 对同一组仓库重构、PDF/图表理解、视频摘要、JSON 结构化输出任务,分别记录成功率、工具错误、人工修正和每个完成任务的总成本。

  3. 对 API 端点分别记录 Google AI Studio、Vertex 或 OpenRouter 的 P50/P95 首 token与吞吐;不要用一个提供商的速度推断另一个提供商。

  4. 在发布前用至少 500 条已关闭客服工单做 dry run:把答案分为可自动发送、需人工草稿、应升级三类,并核对检索命中、事实错误和幻觉率。

  5. 以 2026-12-31 与 2027-01-01 两个价格档重新计算每个任务成本,包含 thinking tokens、缓存读取、批处理或 priority mode。

原始证据与数据

  • eesel 页面给出 low/medium/high 三档的 Intelligence Index、首 token 延迟和单任务成本表,并注明 minimal 不再可用。

  • 页面报告 Artificial Analysis 的 340.1 tok/s、64.5% 幻觉率和 Gemini 3.6 Flash 55.6% 对照;这些是第三方记录,不是作者声称的自建跑分。

  • 页面复述 Google 21 行对照表,并明确 3.7 在 CharXiv 两个子项略低于 3.6,在 Terminal-Bench/DeepSWE/OSWorld 上落后 GPT-5.6 Terra。

  • 页面给出长期客服 dry run 的建议:用自有已关闭工单验证,而不是直接依据 benchmark 或供应商 demo 上线。

来源摘录或观察(仅做合规短引)

“Tokens per second and time to answer, these are not the same thing.”

“Triage, then attempt, then escalate.”

能支持的判断

  • 支持讨论思考档位如何改变首 token、输出 token 和任务成本,并提示用自身工单干跑。

不能支持的判断

  • 不支持将 340.1 tok/s、单客户经验或 2026-12-31 前价格外推为所有提供商/生产场景结论。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

eesel AI Blog · Rama Adi Nugraha;审阅:Katelin Teen · 原文发布日期 2026-08-14 · 本站编辑日期 2026-09-20

打开原始来源

Gemini 3.7 Flash

在 Tabbit 中比较 Gemini 3.7 Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Gemini 3.7 Flash 是什么:获取方式与适用边界

用官方与独立来源说明 Gemini 3.7 Flash、3.6 的变化、3.8 的关系、API 限制、价格时点和实际风险。

相关评测

Gemini 3.7 Flash:Google DeepMind 模型卡这条证据记录 Google DeepMind 模型卡中的 Gemini 3.7 Flash 观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。Gemini 3.7 Flash:Google 发布 Gemini 3.7 Flash这条证据围绕“Gemini 3.7 Flash:Google announces Gemini 3.7 Flash”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。Gemini 3.7 Flash:THOR 发现分诊基准这条证据记录 Gemini 3.7 Flash 在 THOR 发现分诊基准中的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。Gemini 3.7 Flash:基准、定价与速度这条证据记录 Gemini 3.7 Flash 的基准、价格与速度观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。Gemini 3.7 Flash:Introducing Gemini 3.7 Flash — coding and agent workflows把“Gemini 3.7 Flash:Introducing Gemini 3.7 Flash — coding and agent workflows”整理为可执行的任务入口,明确输入、运行环境、交付格式和验收边界;使用前确认模型版本与来源限制。Gemini 3.7 Flash:How To Use The Latest Gemini Flash Model For SEO Automation把“Gemini 3.7 Flash:How To Use The Latest Gemini Flash Model For SEO Automation”整理为可执行的任务入口,明确输入、运行环境、交付格式和验收边界;使用前确认模型版本与来源限制。Gemini 3.7 Flash:Gemini 3.7 Flash image prompt — causal visual description把“Gemini 3.7 Flash:Gemini 3.7 Flash image prompt — causal visual description”整理为可执行的任务入口,明确输入、运行环境、交付格式和验收边界;使用前确认模型版本与来源限制。Gemini 3.7 Flash:Gemini 3.7 Flash with one prompt — voxel Japanese pagoda garden把“Gemini 3.7 Flash:Gemini 3.7 Flash with one prompt — voxel Japanese pagoda garden”整理为可执行的任务入口,明确输入、运行环境、交付格式和验收边界;使用前确认模型版本与来源限制。