Gemini 3.8 Flash 值得保留在候选名单中。Google 公布了多模态输入、1,048,576 个输入 token、65,536 个输出 token,以及 low、medium、high 三档 thinking。离开的理由应来自具体约束:客户端或地区没有这条路、工具不匹配,或完成任务的成本不合适。
关键事实是同价:Google 公布的 2026 Standard 费率中,Gemini 3.7 与 3.8 Flash 都是每百万输入 token 0.75 美元、输出 3.75 美元。退回前代本身不降低单价;只有任务用量、重试或适配变化才会改变实际价值。 (Google)
Gemini 3.8 总览解释模型本身;本文只讨论是否切换。

关键结论
我用四条标准筛选替代方案:完成任务成本、可接受的响应路径、供应商与部署适配、可核对的一手证据。社区评论只说明个人体验,不证明价格、性能或模型优劣。
Gemini 3.7 Flash 适合最小迁移。
GPT-5.6 Luna 适合先测 API 标价。
Claude Sonnet 5 适合 Anthropic 工具路线。
DeepSeek V4.1 Flash 适合 1M 上下文、双思考模式和峰谷价格。
我如何筛选
我用四条标准筛选替代方案:完成任务成本、可接受的响应路径、供应商与部署适配、可核对的一手证据。社区评论只说明个人体验,不证明价格、性能或模型优劣。
四个候选一览
| 候选 | 适用场景 | 官方路线 | 公开价格 | 主要取舍 |
|---|---|---|---|---|
| Gemini 3.7 Flash | Gemini 生态最小迁移 | gemini-3.7-flash;1,048,576 / 65,536 | $0.75 / $3.75 每百万 token | 上一代模型 |
| GPT-5.6 Luna | 高频 API 价格试验 | gpt-5.6-luna;1.05M / 128K | $0.20 / $1.20 每百万 token | 大输入有倍率 |
| Claude Sonnet 5 | 自适应思考与 Anthropic 工具 | claude-sonnet-5;1M / 128K | $2 / $10 每百万 token | 标价较高 |
| DeepSeek V4.1 Flash | 大上下文与时段价格 | deepseek-flash;1M / 384K | 非高峰 $0.003/$0.15/$0.60;高峰 $0.006/$0.30/$1.20 | 需核对时段与驻留 |
Gemini 3.7 Flash:最少改动
适用场景: 保留 Gemini 的多模态输入和 thinking 控制。
优点: Google 列出文本、图片、视频、音频和 PDF 输入,函数调用、代码执行、文件搜索和电脑使用预览。handzhiev 的英文原话是 “my workhorse”,译为“我的主力模型”;这条反馈指向 3.7,不是 3.8 benchmark。

缺点: 它是上一代;与 3.8 同价不代表任务适配相同。
价格: 2026-12-31 前每百万 token 输入 $0.75、输出 $3.75。
结论: 如果兼容性比换供应商更重要,先选它;复杂任务仍与 3.8 做同任务对照。
GPT-5.6 Luna:价格优先
适用场景: 高频工作流的价格优先 API 试验。
优点: OpenAI 公布 1.05M 上下文、128K 输出、函数、网页/文件搜索、电脑使用和 $0.20/$1.20 基础价。gundmc 称它是主力,这是个人偏好。

缺点: 超过 272K 输入有倍率;refactor_master 反馈某次代码编辑需要大量指导。

价格: 另计输出、长输入、工具、重试和人工监督成本。
结论: 当 API 经济性占首要位置且监督预算通过试验时选择。
Claude Sonnet 5:自适应思考
适用场景: Anthropic 的 adaptive thinking 与工具路线。
优点: Anthropic 列出 1M 上下文、128K 输出、视觉、多语言和工具。doctoboggan 与 jsnell 对 effort 成本曲线有不同看法;两者都是主观评论。


缺点: API $2/$10 高于 Luna,且与订阅分开。
价格: 每百万 token 输入 $2、输出 $10。
结论: 当 Anthropic 路线更贴合任务时选择。
DeepSeek V4.1 Flash:按时段计价
适用场景: 1M 上下文、显式 thinking/non-thinking、视觉和时段价格。
优点: 当前官方价格页列出 deepseek-flash / DeepSeek-V4.1-Flash,384K 最大输出、JSON、工具调用、Responses API、Anthropic API 和视觉。eli 的英文反馈说预览端点“good and very fast”,只是预览体验,不是 benchmark。

缺点: UTC 工作日 01:00–04:00、06:00–10:00 为高峰,中国公众假期除外;aftbit 讨论的是旧 Pro 路由,不是当前 Flash 价格。

价格: 非高峰缓存命中/未命中/输出为 $0.003/$0.15/$0.60;高峰为 $0.006/$0.30/$1.20。
结论: 时段、地区、驻留和价格变化都能接受时选择。
| 约束 | 第一候选 | 需要验证 |
|---|---|---|
| 保留 Gemini 多模态 | Gemini 3.7 | SDK、工具、地区 |
| 压低 API 标价 | Luna | 完成任务成本 |
| 自适应思考 | Sonnet 5 | API 功能与迁移 |
| 1M 上下文与时段价格 | DeepSeek V4.1 Flash | 高峰、缓存、驻留 |
Tabbit Browser:一次有限测试
一次合成抽取返回预期四字段:currency 为 USD、paid_total 为 145、overdue_ids 为 B、unknown_status_ids 为 D。界面同时显示 Google 搜索标记。样本数为 1,未测量 thinking、token、费用或 TTFT,也未独立核验是否实际发出搜索请求;这是正确性抽查,不是性能测试。

Tabbit Browser、什么是 agentic browser、浏览器自动化、AI 浏览器选项 可用于继续验证浏览器上下文。模型资源:Gemini 3.7、Luna、Sonnet 5。
用同一任务试验
冻结输入、指令、工具、输出契约、重试预算和计费路线,记录首 token、总时间、token、工具错误、人工修改和完成任务成本。重复运行后再决定。
结论
Gemini 3.8 Flash 值得保留在候选名单中。Google 公布了多模态输入、1,048,576 个输入 token、65,536 个输出 token,以及 low、medium、high 三档 thinking。离开的理由应来自具体约束:客户端或地区没有这条路、工具不匹配,或完成任务的成本不合适。 不宣布全局冠军。
常见问题
Gemini 3.8 Flash 最接近的替代模型是什么?
Gemini 3.7 Flash 是同一家族中最接近的候选,Google 为两者公开了相近的输入类型、token 限制和思考档位。它仍是不同模型,切换前要用同一任务验证。
哪个候选的 API 标价最低?
没有始终最低的路线。DeepSeek V4.1 Flash 谷时未缓存输入/输出为每百万 token 0.15/0.60 美元,低于 Luna 基础价 0.20/1.20;峰时为 0.30/1.20,此时 Luna 未缓存输入更低。缓存、长输入倍率、重试和工具会改变任务成本。
四个替代模型支持相同的工具吗?
不支持。Google、OpenAI、Anthropic 和 DeepSeek 的工具与思考说明并不完全相同。必须在实际使用的 API、客户端和账户中核对。
可以把 API 价格和聊天订阅价格直接比较吗?
不可以。API token、消费者订阅、团队席位和浏览器客户端使用不同计费单位。预算表应分开记录,并计算同一成功任务的成本。
Gemini 3.8 的 benchmark 能直接和其他模型比较吗?
不能仅凭本文资料直接比较。Artificial Analysis 的数据是 2026 年 9 月 20 日查看的 v4.3.2 快照,并按思考档位展示,其他候选没有同条件数据。
Gemini 3.8 Flash 在 Tabbit Browser 中可用吗?
一次测试选择器显示 Gemini-3.8-Flash,单次合成抽取返回了预期四字段 JSON,同时界面显示 Google 搜索标记。样本不是性能测试,不能据此确认生产可用性、延迟、费用或工具行为。