Tabbit博客

Gemini 3.8 Flash 价格:2027 年费率翻倍与任务成本

用公式和算例解释 Gemini 3.8 Flash 的输入、输出、thinking、缓存、Batch 与 Flex 费用。

本文目录
  1. 关键结论
  2. 费率表
  3. 两个可复算算例
  4. 算例一:未缓存的分析请求
  5. 算例二:缓存文档任务
  6. Batch、Flex、工具与重试
  7. Tabbit 的边界
  8. API、订阅与产品费用分开
  9. 两种负载的预算对照
  10. 社区反馈能说明什么
  11. 社区的每任务成本争议
  12. 家族阶梯、effort 杠杆与不收费边界
  13. 两种工作负载:先列假设,再算账
  14. 算清 API 后,选择运行它的地方
  15. 来源与下一步

Gemini 3.8 Flash 的价格重点不是“每百万 token 多少钱”,而是一次任务实际用了多少 token。2026 年 12 月 31 日前,标准 API 输入为每百万 token 0.75 美元,输出为 3.75 美元;输出价格已经包含 thinking token。缓存读取为 0.075 美元,缓存存储为每百万 token 每小时 0.50 美元。2027 年 1 月 1 日起,Google 列出的这些标准价格翻倍。

单次成本公式是:(未缓存输入×输入费率 + 缓存读取×缓存读取费率 + 含 thinking 的输出×输出费率)/1,000,000 + 缓存存储费。订阅额度和 Tabbit 费用不属于这笔 API 账单。

Google 官方模型页,截图于 2026-09-20;展示产品规格,不是 Tabbit 推理实测。
Google 官方模型页,截图于 2026-09-20;展示产品规格,不是 Tabbit 推理实测。

关键结论

  • thinking 不另开一项,必须计入输出总量一次。

  • Batch 是单独的 50% 价格模式;Flex 也有自己的模式和费率,二者不能叠加。

  • 月预算还要加入调用次数、失败重试、工具请求和缓存存储时间。

  • Google 的定价页模型页是本文数字来源。

费率表

项目2026-12-31 前2027-01-01 起单位
标准输入$0.75$1.50每百万 token
标准输出(含 thinking)$3.75$7.50每百万 token
缓存读取$0.075$0.15每百万 token
缓存存储$0.50$1.00每百万 token·小时
Batch 输入$0.375$0.75每百万 token
Batch 输出(含 thinking)$1.875$3.75每百万 token
Batch 缓存读取$0.0375$0.075每百万 token

Google 定价页的 Standard、Batch、Flex 和 Priority 是独立标签。模型页只证明 3.8 Flash 支持 Batch API 与 Flex inference,不代表普通 Standard 请求自动享受折扣。

两个可复算算例

算例一:未缓存的分析请求

假设一次请求使用 200,000 个未缓存输入 token,并产生 20,000 个含 thinking 的输出 token:

(0.2×$0.75) + (0.02×$3.75) = $0.15 + $0.075 = $0.225

100 次成功调用是 $22.50。若预计平均每次需要 1.2 次尝试,预算为 $22.50×1.2=$27.00,未含工具费用。2027 年相同用量的单次成本为 $0.45。

算例二:缓存文档任务

假设 900,000 token 文档缓存 10 小时,每次读取 900,000 个缓存 token,新增 100,000 个未缓存 token,输出 30,000 个含 thinking 的 token:

token 费用 = (0.1×$0.75)+(0.9×$0.075)+(0.03×$3.75)
           = $0.075+$0.0675+$0.1125 = $0.255
存储费用   = 0.9×10×$0.50 = $4.50

若这 10 小时内运行 20 次,合计为 $4.50+(20×$0.255)=$9.60。缓存存储和缓存读取是两笔费用;不读取缓存也不会自动免除存储费。

Batch、Flex、工具与重试

Batch 适合可以延迟完成的工作。Flex 是另一种独立推理模式,准确费率应按官方页面当前标签核对。不要把 Standard 价格再乘 Batch 折扣和 Flex 折扣。

工具也可能产生费用。Google 说明 Search grounding、Maps 有请求额度和超额价格;URL context 按输入 token 计费;代码执行按模型 token 计费,不按会话运行时间收费;File Search 还可能有 embedding 费用。查看工具计价说明

月预算可写成:成功任务数×单次 token 成本×平均尝试次数 + 工具费 + 存储费。不要把失败请求默认当作零成本。

Tabbit 的边界

Tabbit Browser 适合组织多页面研究,可先看AI 浏览器介绍智能体浏览器指南浏览器自动化模型资源页。本次测试客户端能在模型选择器看到 Gemini-3.8-Flash,但新任务页加载错误,没有完成推理。因此不能据此证明生产可用性、成功调用或 Tabbit 费用。API 成本必须按真实 API 账户和日志核算。

API、订阅与产品费用分开

AI Studio 的免费额度、Gemini 消费者订阅、Developer API 付费层和 Tabbit 使用条款是不同产品。请从总览了解获取入口,从测评了解任务证据,再用替代品指南比较成本约束,也可查看AI 浏览器对比

两种负载的预算对照

工作负载2026 年估算(美元)未计入
100 个无缓存任务;每次成功平均尝试 1.2 次27.00工具费用及适用时的缓存创建开销
10 小时内 20 个缓存任务;不重试9.60工具费用及适用时的缓存创建开销

社区反馈能说明什么

NERD UP 关注 token 消耗与隐含成本,Bijan Bowen 展示编码和浏览器任务。这里引用的是视频页面可见标题与章节,不是账单或同条件性能测试。它们说明预算为什么需要统计重试与完整输出。

C_tokens = (I_uncached × P_input + I_cached × P_cached + O_total × P_output) / 1,000,000
C_total = sum(C_tokens for ALL attempts) + C_storage + C_tools
C_success = C_total / N_success   [N_success > 0]

统计全部计费尝试,包括失败和重试;共享存储与工具费只加一次。没有成功任务时,不计算每成功任务成本。

社区的每任务成本争议

Hacker News 9 月 2—3 日的同一讨论串围绕“每任务成本”出现正反观点:gundmc 认为成本基准可能比 token 费率更有解释力,bermudi 认为更高的输出 token 会抵消低单价,criley2 则指出 effort 不同会改变排序。它们引用了不同的 Artificial Analysis 视图,不能当作本文复现的排行榜。

原评论:gundmc(9 月 2 日)bermudi(9 月 2 日)criley2(9 月 2 日)criley2(9 月 3 日)

Hacker News 上 gundmc 讨论每任务成本的评论
gundmc:每任务成本可能改变比较结果;这是社区观点,不是 Tabbit 独立测量。
Hacker News 上 bermudi 讨论每任务输出 token 的评论
bermudi:较高输出 token 可能抵消单价优势;这是社区观点,不是已验证的排行榜结果。
Hacker News 上 criley2 质疑每任务成本比较的评论
criley2:不同 effort 会改变比较;本文不把争议裁成结论。
Hacker News 上 criley2 比较不同 effort 成本的评论
criley2 后续评论:成本会随 effort 变化;这是 9 月 3 日跟帖,不是复现实验。

结论只保留一条:记录 effort 和总输出,再用官方费率计算,不要把社区排序当作验证结果。

家族阶梯、effort 杠杆与不收费边界

Google 当前公布的 2026 Standard 行显示,Gemini 3.8 Flash、3.7 Flash 和 3.6 Flash 都是输入 $0.75、输出 $3.75、缓存读取 $0.075(每百万 token)。费率相同不代表质量、延迟或可用性相同;它只说明换模型不会自动改变 token 算术。真正的成本杠杆是缓存比例、总输出(包含 thinking)、任务轮数和重试次数。降低 effort 只有在确实减少总输出且结果仍可用时才省钱。

Thinking 没有单独附加费,因为已包含在输出;缓存读取也不等于缓存存储。Batch 与 Flex 是两个独立模式,2026 年公布的 token 费率都是标准 token 费率的一半,不能叠加折扣。搜索、Maps、URL context 和 File Search 等工具另有计费规则。失败请求可能已经消耗 token,因此不能假设重试免费。

两种工作负载:先列假设,再算账

以下使用 2026 Standard token 费率;输出已含思考,不重复计费。不含存储、工具、重试和税费。按已公布的 2027 Standard token 费率,两行仅 token 的月费用分别为 30 和 36 美元。

工作负载每次输入缓存比例每次总输出每月次数月 token 费用
短文本抽取10,0000%2,0001,000$15
重复文档分析1,000,00090%10,000100$18

本地计算

估算每月 token 成本

使用截至 2026-12-31 的 Standard API 费率。输出包含思考 token,勿重复计算。输入值仅在浏览器处理。

Gemini 3.8 Flash$0.4500 / 次任务$45.00 /
Gemini 3.7 Flash$0.4500 / 次任务$45.00 /
Gemini 3.6 Flash$0.4500 / 次任务$45.00 /

不含缓存存储、工具、重试和税费。同价不等于每次任务使用相同 token。核对日期:2026-09-20。 核对最新费率

计算器只在浏览器本地运行,比较三个已知家族模型的 2026 Standard 费率,不把未知价格填成 0,也不计缓存存储、工具、重试和税费。准备好实际 token 日志后,再回到 Google 官方价格页复核。

算清 API 后,选择运行它的地方

Tabbit Browser 可以作为整理网页和上下文的浏览器入口,Gemini 3.8 Flash 模型页说明了对应路线。使用 Tabbit Browser Dev、测试站登录账户完成的一次支付记录抽取任务,正确返回 currency、paid_total、overdue_ids 和 unknown_status_ids 四个字段。界面可见 Google Search 标记,但是否实际发起搜索未独立核验;费用、耗时和稳定性也未测量。

Tabbit Browser
Tabbit Browser 显示 Gemini 3.8 Flash 结构化抽取结果
一次 Tabbit Browser 抽取样例返回预期 JSON;不据此推断费用、延迟或稳定性。

来源与下一步

请先核对 Google 的Gemini API 定价3.8 Flash 模型文档。跨过 2027 年 1 月 1 日时,把标准 token 与缓存费率按 2 倍预算,再用真实日志复核。

常见问题

2026 年底前 Gemini 3.8 Flash API 怎么收费?

标准付费层输入为每百万 token 0.75 美元,输出为 3.75 美元且已包含 thinking。缓存读取为 0.075 美元,缓存存储为每百万 token 每小时 0.50 美元。

thinking token 要不要再次收费?

不要。Google 把 thinking token 计入输出价格,估算时只把它们加进总输出 token 一次。

2027 年价格会怎样?

2027 年 1 月 1 日起,标准输入、输出、缓存读取和存储价格分别变为 1.50、7.50、0.15 和 1.00 美元。

Batch 和 Flex 能叠加折扣吗?

不能。它们是不同的请求模式,必须选择一种并使用对应费率。

Gemini 订阅或 Tabbit 费用能代替 API 费用吗?

不能。消费者订阅、Gemini Developer API 账户和 Tabbit 条款分别计费。

失败重试怎样纳入预算?

先算一次成功任务成本,再乘预计尝试次数,并另加工具费和缓存存储费。失败请求消耗的 token 也可能计费。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。