Gemini 3.7 Flash 的速度、文档/多模态和窄范围重构很强,但高档思考会显著增加首 token 延迟与 token 成本,且长期客服/自动化选型必须用自己的历史工单做干跑验证。
适合的任务:PDF/OCR/图表与长上下文检索;图片、视频和文档理解;网页/UI 生成;窄范围代码重构;需要高吞吐的批量任务。
不适合的任务:未经人工审核直接回复客户;长时间终端 Agent 追求一次完成;以“最低 token 价格”为唯一目标的分类/标注工作(minimal 档已移除且思考 token 计费)。
适用的模型版本:gemini-3.7-flash,GA 发布版本(2026-08-13)。
适用的客户端、Agent 或 API:Gemini API、Google AI Studio、Google Antigravity;文中也比较 OpenRouter/Vertex 的运行指标与 API 价格。
推荐的推理档位和参数:low 适合低延迟草稿、实时聊天和快速分析;medium(默认)适合复杂代码/Agent;high 适合难数学、最难编码和长工具链,但需要承受更高延迟和 token 消耗。
独立运行数据:Artificial Analysis 速度/智能/幻觉数据;OpenRouter P50 与提供商吞吐;作者在 eesel 的真实客服集成经验(单客户每月超过 100,000 条德语 Zendesk 工单)。
发布方对照:Google 的 21 行模型卡比较表,含 Gemini 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra、Muse Spark 1.2。
价格时间点:2026-12-31 前 introductory price 为输入 $0.75/1M、输出 $3.75/1M;2027-01-01 起变为 $1.50/1M、$7.50/1M。思考 token 按输出价格计费。
输入模态:文本、图片、视频、音频和 PDF;输出为文本。
上下文窗口:1M token;输出上限 64K。
从旧 Gemini 版本迁移时,文章提醒移除 temperature、top_p、top_k、candidate_count,把数值 thinking_budget 改为 thinking_level,移除预填充 model turn,并把多轮历史迁移到服务端 previous_interaction_id。
文章指出 minimal 思考级别在 3.7 Flash 不再可用;调用者应显式记录 low/medium/high,不要假定旧模型的四档配置仍兼容。
| 档位 | Artificial Analysis Intelligence Index | 首 token 延迟 | 每 benchmark task 成本 |
|---|---|---|---|
| high | 56.0 | 9.83 秒(p95 49.5 秒) | $0.40 |
| medium | 53.5 | 4.22 秒 | $0.26 |
| low | 50.9 | 0.74 秒 | $0.16 |
Artificial Analysis:340.1 output tokens/s,188 个模型中速度第一;同页对照类别中位数为 68.6 tok/s。
OpenRouter:P50 约 93 tok/s、延迟 1.85 秒;Google AI Studio 约 124 tok/s/1.74 秒,Vertex 约 84 tok/s/2.02 秒。
高思考相对 Gemini 3.6 Flash 的 token 使用约增加 40%,平均每任务约 37K output tokens;速度快不等于完成任务总耗时或成本低。
Artificial Analysis 的独立幻觉率记录为 64.5%,Gemini 3.6 Flash 为 55.6%;作者强调准确率提升与幻觉率上升可以同时发生。
| 基准 | Gemini 3.7 Flash | Gemini 3.6 Flash | GPT-5.6 Terra | 观察 |
|---|---|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% | 41.3% | 3.7 领先 |
| DeepSWE v1.1 | 65.3% | 48.6% | 69.6% | Terra 领先 |
| Code Arena | 1588 Elo | 1538 | 1523 | 3.7 领先 |
| Terminal-Bench 2.1 | 85.8% | 78.0% | 87.4% | Terra 领先 |
| Terminal-Bench 3.0 | 14.9% | 5.4% | 20.8% | Terra 领先 |
| AutomationBench | 30.4% | 17.0% | 23.6% | 3.7 领先 |
| GDP.pdf | 34.0% | 22.0% | 24.7% | 3.7 领先 |
| LVBench | 85.4% | 84.2% | 78.9% | 3.7 领先 |
| GDM-MRCR v2 @128K | 97.0% | 91.8% | 93.5% | 3.7 领先 |
| OSWorld-2.0 | 47.9% | 33.8% | 50.2% | Terra 领先 |
| CharXiv(无工具) | 84.5% | 85.2% | 85.9% | 3.6 略高 |
| CharXiv(有工具) | 88.7% | 89.4% | 未列 | 3.6 略高 |
能力形状比总分更有用:3.7 Flash 在文档、视频、图表、长上下文和 UI 生成上形成一致优势;长程终端编码的四项关键指标仍由 GPT-5.6 Terra 领先。
低档可能是生产默认:在作者引用的数据中,low 的 50.9 分接近 3.6 Flash 高档,但首 token 0.74 秒、任务成本 $0.16;不应无条件使用默认 medium。
速度需要按“每任务”核算:340 tok/s 的输出速度被高档思考的 37K 平均输出 token 抵消;应记录完成任务成本与人工修正,而不是只看 tok/s。
可靠性取决于外部控制:作者建议支持场景采用“分类/检索 → 尝试自动处理 → 低置信度转人工”的流程,并在自有历史工单上干跑后再上线。
文章部分数字来自 Artificial Analysis、OpenRouter 和 Google 发布表;并非同一 harness 下的完整独立对照。
幻觉率的定义、样本、任务集与时间窗口未在本文完整披露;不能直接外推到 Tabbit 内容或客服数据。
eesel 的生产工作负载与商业产品经验可能存在选择偏差,且 100,000+ 工单案例不是公开可复现数据集。
Google 表中的 Terminal-Bench 3.0、AutomationBench 等部分项目带有私有集或发布方口径;不要把它们与 Artificial Analysis 独立测量混为一谈。
价格为指定日期前的 introductory rate;正式上线预算必须重新核对官方价格页。
在 Gemini API 或 AI Studio 固定同一个输入集合,显式切换 low、medium、high,保存 usage.total_thought_tokens、首 token 延迟、总延迟和输出 token。
对同一组仓库重构、PDF/图表理解、视频摘要、JSON 结构化输出任务,分别记录成功率、工具错误、人工修正和每个完成任务的总成本。
对 API 端点分别记录 Google AI Studio、Vertex 或 OpenRouter 的 P50/P95 首 token与吞吐;不要用一个提供商的速度推断另一个提供商。
在发布前用至少 500 条已关闭客服工单做 dry run:把答案分为可自动发送、需人工草稿、应升级三类,并核对检索命中、事实错误和幻觉率。
以 2026-12-31 与 2027-01-01 两个价格档重新计算每个任务成本,包含 thinking tokens、缓存读取、批处理或 priority mode。
eesel 页面给出 low/medium/high 三档的 Intelligence Index、首 token 延迟和单任务成本表,并注明 minimal 不再可用。
页面报告 Artificial Analysis 的 340.1 tok/s、64.5% 幻觉率和 Gemini 3.6 Flash 55.6% 对照;这些是第三方记录,不是作者声称的自建跑分。
页面复述 Google 21 行对照表,并明确 3.7 在 CharXiv 两个子项略低于 3.6,在 Terminal-Bench/DeepSWE/OSWorld 上落后 GPT-5.6 Terra。
页面给出长期客服 dry run 的建议:用自有已关闭工单验证,而不是直接依据 benchmark 或供应商 demo 上线。
“Tokens per second and time to answer, these are not the same thing.”
“Triage, then attempt, then escalate.”
Gemini 3.7 Flash