Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Gemini 3.7 Flash

Gemini 3.7 Flash:真实价格、速度与 Agent 边界(eesel)

原始来源

eesel AI Blog

作者Rama Adi Nugraha;审阅:Katelin Teen

原文日期2026-08-14

Tabbit 整理2026-08-19

查看原文

一句话结论

Gemini 3.7 Flash 的速度、文档/多模态和窄范围重构很强,但高档思考会显著增加首 token 延迟与 token 成本,且长期客服/自动化选型必须用自己的历史工单做干跑验证。

适用场景

  • 适合的任务:PDF/OCR/图表与长上下文检索;图片、视频和文档理解;网页/UI 生成;窄范围代码重构;需要高吞吐的批量任务。

  • 不适合的任务:未经人工审核直接回复客户;长时间终端 Agent 追求一次完成;以“最低 token 价格”为唯一目标的分类/标注工作(minimal 档已移除且思考 token 计费)。

  • 适用的模型版本:gemini-3.7-flash,GA 发布版本(2026-08-13)。

  • 适用的客户端、Agent 或 API:Gemini API、Google AI Studio、Google Antigravity;文中也比较 OpenRouter/Vertex 的运行指标与 API 价格。

  • 推荐的推理档位和参数:low 适合低延迟草稿、实时聊天和快速分析;medium(默认)适合复杂代码/Agent;high 适合难数学、最难编码和长工具链,但需要承受更高延迟和 token 消耗。

测试环境

  • 独立运行数据:Artificial Analysis 速度/智能/幻觉数据;OpenRouter P50 与提供商吞吐;作者在 eesel 的真实客服集成经验(单客户每月超过 100,000 条德语 Zendesk 工单)。

  • 发布方对照:Google 的 21 行模型卡比较表,含 Gemini 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra、Muse Spark 1.2。

  • 价格时间点:2026-12-31 前 introductory price 为输入 $0.75/1M、输出 $3.75/1M;2027-01-01 起变为 $1.50/1M、$7.50/1M。思考 token 按输出价格计费。

输入/配置

  • 输入模态:文本、图片、视频、音频和 PDF;输出为文本。

  • 上下文窗口:1M token;输出上限 64K。

  • 从旧 Gemini 版本迁移时,文章提醒移除 temperature、top_p、top_k、candidate_count,把数值 thinking_budget 改为 thinking_level,移除预填充 model turn,并把多轮历史迁移到服务端 previous_interaction_id。

  • 文章指出 minimal 思考级别在 3.7 Flash 不再可用;调用者应显式记录 low/medium/high,不要假定旧模型的四档配置仍兼容。

结果数据

速度、成本与思考档位

档位Artificial Analysis Intelligence Index首 token 延迟每 benchmark task 成本
high56.09.83 秒(p95 49.5 秒)$0.40
medium53.54.22 秒$0.26
low50.90.74 秒$0.16
  • Artificial Analysis:340.1 output tokens/s,188 个模型中速度第一;同页对照类别中位数为 68.6 tok/s。

  • OpenRouter:P50 约 93 tok/s、延迟 1.85 秒;Google AI Studio 约 124 tok/s/1.74 秒,Vertex 约 84 tok/s/2.02 秒。

  • 高思考相对 Gemini 3.6 Flash 的 token 使用约增加 40%,平均每任务约 37K output tokens;速度快不等于完成任务总耗时或成本低。

  • Artificial Analysis 的独立幻觉率记录为 64.5%,Gemini 3.6 Flash 为 55.6%;作者强调准确率提升与幻觉率上升可以同时发生。

Google 发布表中关键行

基准Gemini 3.7 FlashGemini 3.6 FlashGPT-5.6 Terra观察
FrontierCode 1.1 Main43.6%34.4%41.3%3.7 领先
DeepSWE v1.165.3%48.6%69.6%Terra 领先
Code Arena1588 Elo153815233.7 领先
Terminal-Bench 2.185.8%78.0%87.4%Terra 领先
Terminal-Bench 3.014.9%5.4%20.8%Terra 领先
AutomationBench30.4%17.0%23.6%3.7 领先
GDP.pdf34.0%22.0%24.7%3.7 领先
LVBench85.4%84.2%78.9%3.7 领先
GDM-MRCR v2 @128K97.0%91.8%93.5%3.7 领先
OSWorld-2.047.9%33.8%50.2%Terra 领先
CharXiv(无工具)84.5%85.2%85.9%3.6 略高
CharXiv(有工具)88.7%89.4%未列3.6 略高

结论

  1. 能力形状比总分更有用:3.7 Flash 在文档、视频、图表、长上下文和 UI 生成上形成一致优势;长程终端编码的四项关键指标仍由 GPT-5.6 Terra 领先。

  2. 低档可能是生产默认:在作者引用的数据中,low 的 50.9 分接近 3.6 Flash 高档,但首 token 0.74 秒、任务成本 $0.16;不应无条件使用默认 medium。

  3. 速度需要按“每任务”核算:340 tok/s 的输出速度被高档思考的 37K 平均输出 token 抵消;应记录完成任务成本与人工修正,而不是只看 tok/s。

  4. 可靠性取决于外部控制:作者建议支持场景采用“分类/检索 → 尝试自动处理 → 低置信度转人工”的流程,并在自有历史工单上干跑后再上线。

局限

  • 文章部分数字来自 Artificial Analysis、OpenRouter 和 Google 发布表;并非同一 harness 下的完整独立对照。

  • 幻觉率的定义、样本、任务集与时间窗口未在本文完整披露;不能直接外推到 Tabbit 内容或客服数据。

  • eesel 的生产工作负载与商业产品经验可能存在选择偏差,且 100,000+ 工单案例不是公开可复现数据集。

  • Google 表中的 Terminal-Bench 3.0、AutomationBench 等部分项目带有私有集或发布方口径;不要把它们与 Artificial Analysis 独立测量混为一谈。

  • 价格为指定日期前的 introductory rate;正式上线预算必须重新核对官方价格页。

复现步骤

  1. 在 Gemini API 或 AI Studio 固定同一个输入集合,显式切换 low、medium、high,保存 usage.total_thought_tokens、首 token 延迟、总延迟和输出 token。

  2. 对同一组仓库重构、PDF/图表理解、视频摘要、JSON 结构化输出任务,分别记录成功率、工具错误、人工修正和每个完成任务的总成本。

  3. 对 API 端点分别记录 Google AI Studio、Vertex 或 OpenRouter 的 P50/P95 首 token与吞吐;不要用一个提供商的速度推断另一个提供商。

  4. 在发布前用至少 500 条已关闭客服工单做 dry run:把答案分为可自动发送、需人工草稿、应升级三类,并核对检索命中、事实错误和幻觉率。

  5. 以 2026-12-31 与 2027-01-01 两个价格档重新计算每个任务成本,包含 thinking tokens、缓存读取、批处理或 priority mode。

原始证据与数据

  • eesel 页面给出 low/medium/high 三档的 Intelligence Index、首 token 延迟和单任务成本表,并注明 minimal 不再可用。

  • 页面报告 Artificial Analysis 的 340.1 tok/s、64.5% 幻觉率和 Gemini 3.6 Flash 55.6% 对照;这些是第三方记录,不是作者声称的自建跑分。

  • 页面复述 Google 21 行对照表,并明确 3.7 在 CharXiv 两个子项略低于 3.6,在 Terminal-Bench/DeepSWE/OSWorld 上落后 GPT-5.6 Terra。

  • 页面给出长期客服 dry run 的建议:用自有已关闭工单验证,而不是直接依据 benchmark 或供应商 demo 上线。

来源摘录或观察(仅做合规短引)

“Tokens per second and time to answer, these are not the same thing.”

“Triage, then attempt, then escalate.”

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.7 Flash

在 Tabbit 中使用并对比模型

Gemini 3.7 Flash

相关测评

官方Google DeepMind2026-08-13

Google DeepMind Gemini 3.7 Flash Model Card

社区Reddit r/GeminiAI2026-08-16

3.7 Flash feels insanely fast — but is it hallucinating more than 3.6?

媒体BenchLM.ai2026-08-15

Gemini 3.7 Flash Benchmarks, Pricing & Speed

媒体Ars Technica2026-08-14

Google announces Gemini 3.7 Flash

Gemini 3.7 Flash

相关提示词

官方Google Blog2026-08-13

Introducing Gemini 3.7 Flash — coding and agent workflows

社区X2026-08-15

Gemini 3.7 Flash image prompt — causal visual description

媒体Tom’s Guide2026-08-14

Gemini 3.7 Flash is here — and this prompt proves why it is Google’s workhorse

社区X2026-08-14

Gemini 3.7 Flash with one prompt — voxel Japanese pagoda garden