如果只看输入一栏,Kimi K3 像是每百万 token 3 美元的模型。官方 API 表还列出 每百万缓存命中输入 0.30 美元 和 每百万输出 15 美元。缓存写入另计:5 分钟 TTL 为每百万 3 美元,1 小时 TTL 为每百万 6 美元。真正改变预算的数字是 5 倍:输出 token 单价是未缓存输入的五倍。
这篇文章只讲价格和选型,不重复 Kimi K3 模型页与测评集合中的能力、编码和安全证据。重点是:你的任务应走 API、会员,还是先在可用的浏览器工作流中验证?Tabbit 可以用于比较当前账户支持的模型,但不保证每个账户都能使用 Kimi K3。
结论先看
官方 USD API 价格为:输入 $3/M、缓存命中 $0.30/M、输出 $15/M。
缓存命中便宜,但缓存写入并不免费;API 会自动尝试缓存,价格页列出 5 分钟和 1 小时写入计费档位,调用方无需手动发送 cache ID、TTL 或额外参数。
Kimi 会员是产品额度,不是 API token 钱包。当前个人页显示 Andante、Moderato、Allegretto、Allegro 的月付价格,年付只说明更优惠、最高可省 ¥1,680。
K3 上下文窗口为 1,048,576 token;官方表中的 K2.6 为 262,144 token,价格更低但不能直接替换。
短提示词常被输出和重试主导;长上下文更看缓存命中和写入成本。
Kimi K3 价格速查
官方 API 费率表
这张表回答的是开发者账户的 token 账单,不是 Kimi 会员的月费。K3 的输入、缓存命中、缓存写入和输出必须分开记录;K2.7 Code 与 K2.6 只是同一官方比较表中的参照行。上下文窗口是上限,不等于每次请求都会消耗这么多 token,也不代表输出质量相同。
| 模型 | 缓存命中 / 1M | 写入 5 分钟 / 1M | 写入 1 小时 / 1M | 输入 / 1M | 输出 / 1M | 上下文 |
|---|---|---|---|---|---|---|
| K3 | $0.30 | $3.00 | $6.00 | $3.00 | $15.00 | 1,048,576 |
| K2.7 Code | $0.19 | — | — | $0.95 | $4.00 | 262,144 |
| K2.6 | $0.16 | — | — | $0.95 | $4.00 | 262,144 |
数据来自 Kimi 官方模型价格文档,2026 年 9 月 20 日核对。短横线表示比较表没有列出该项,不代表所有提供方的缓存行为相同。
官方会员页当前列出 Andante ¥49/月、Moderato ¥99/月、Allegretto ¥199/月、Allegro ¥699/月。年付只标示更优惠、最高可省 ¥1,680,没有稳定的逐档年价;价格资格以页面实际展示为准,不能和美元 API 费率直接换算。官方会员页
当前显示的会员方案
| 方案 | 月付 | 页面强调 |
|---|---|---|
| Andante | ¥49 | 入门级产品功能与额度 |
| Moderato | ¥99 | 更高的产品功能与额度 |
| Allegretto | ¥199 | 面向较重使用的更大额度 |
| Allegro | ¥699 | 当前显示的最高个人档位 |
关键数字:每百万输出 15 美元
3 美元的输入价格容易被重复引用,但许多任务的账单由输出决定。长答案、较多推理步骤、多轮 Agent 调用和重试都会增加输出 token。官方没有提供适用于所有任务的“每次调用成本”,所以应按实际 token 用量记录。
这里的“输出更贵”是费率判断,不是每个短任务的金额分布。10,000 输入和 2,000 输出的示例中,两项各贡献 $0.03;真正要避免的是把 $3/M 当成整次任务的价格,忽略输出上限、重试、工具和失败循环。对预算来说,先记录每次请求的 usage,再按工作负载求平均值,比用一个“每次调用”数字更可靠。
单次成本 = (未缓存输入 × 3
+ 缓存输入 × 0.30
+ 缓存写入输入 × 写入费率
+ 输出 token × 15) / 1,000,000
+ 工具费与税费如果客户端提供 usage 字段,应保存输入、缓存输入、写入和输出;否则把结果标成估算。不要用可见字符数替代输出 token。
官方缓存规则怎么理解
官方价格文档列出 5 分钟和 1 小时两种 K3 缓存写入计费档位;未指定 TTL 时默认使用 5 分钟。官方故障排查说明 API 会自动尝试缓存,调用方不需要提供 cache ID、TTL 或额外参数。首次把重复前缀写入缓存时按写入费率计费,后续命中按 $0.30/M 计费,并刷新缓存寿命,不再重复收取该次命中的写入费。
因此,应用代码不应把“必须手动创建 cache ID”当作接入前提。更实用的做法是让系统保持 system prompt、工具定义和长文档前缀稳定,然后从返回的 usage 或账单记录判断是否命中。价格表中的 TTL 是供应商的计费/保留档位,不是每个调用都必须显式设置的参数。
以 500,000 token 上下文为例:冷读约 $1.50,命中约 $0.15;如果首次使用 1 小时 TTL,还要加 $3.00 写入费。详情见 Kimi API 价格说明。联网搜索、文件、税费和其他工具不能隐藏在一个 token 乘数里。
三个预算例子
这些是根据官方美元表计算的示意,不是生产请求承诺。
本地计算
估算 Kimi K3 API token 成本
使用 2026-09-20 核对的官方美元费率。输入值仅在浏览器本地处理。
API 会自动尝试缓存。该估算将缓存写入与缓存命中分开计算,不含重试、工具、税费和代理商加价。 核对最新费率
计算器只在浏览器本地运行,不会发送输入值;它将自动缓存命中与缓存写入费用分开估算,不含重试、工具、税费和代理商加价。提交预算前请查看官方费率表。
短输入、短回答
10,000 未缓存输入、2,000 输出:
(10,000 × $3 + 2,000 × $15) / 1,000,000 = $0.06这个示例中,输入和输出各占 $0.03。对一次性任务,优化很少复用的缓存不如记录输出量和重试次数重要。
第一次读取长上下文
500,000 未缓存输入、20,000 输出:
(500,000 × $3 + 20,000 × $15) / 1,000,000 = $1.80若写入缓存,还要根据 TTL 增加写入费用。冷启动和后续命中请求应分开估算。
这个冷启动例子还没有包含搜索、文件读取、税费或 SDK 自动重试。若同一个前缀会被多轮 Agent 重读,应把第一次写入单列,并把后续请求按命中或未命中分别统计,而不是把 $1.80 当作每一轮固定价格。
重复读取长上下文
相同上下文已命中缓存,输出仍为 20,000:
(500,000 × $0.30 + 20,000 × $15) / 1,000,000 = $0.45输入明显下降,但输出仍可能是主要成本。
缓存只改变输入侧的计费行,不会把 20,000 个输出 token 变成缓存输入。若 Agent 反复生成相似的长答案,压缩工具轨迹、限制输出上限和减少无效重试,可能比继续优化缓存比例更有影响。
家族比较:更便宜不等于可替换
官方表中 K2.6 为缓存命中 $0.16/M、输入 $0.95/M、输出 $4/M,上下文 262,144 token;K3 的上下文为 1,048,576 token,单价更高。K2.7 Code 在该表中也显示为 $0.19/M、$0.95/M、$4/M。
这不是简单的“贵的模型一定更好”。K2.7 Code 和 K2.6 的价格更低,但它们的 262k 上下文会让超长仓库或研究资料需要截断、检索或多次调用。每一次额外调用都会重新引入输入、输出、工具和失败成本,所以应把“少一次调用”也放进比较,而不是只比较每百万 token 的费率。
如果代码库或研究资料小于 262k token,且验收结果允许,应该测试 Kimi API 提示词指南中的低成本路线。需要多步骤时,可先看 Agent 配置指南,把规划、执行和验证拆开,而不是直接增加预算。
建议先固定一小组代表任务:一段短回答、一次长文档问答、一个需要工具的编码循环。为每个模型记录成功率、重试次数、总输出和完成时间,再把这些数据代入费率。这样才能判断 K3 的百万 token 上下文是否真的减少了总调用次数。
会员、API,还是浏览器工作流?
会员页当前展示 Andante、Moderato、Allegretto、Allegro;API 标签页另显示 K3 为 ¥2/M 缓存命中、¥20/M 输入、¥100/M 输出。这些页面的货币、账户入口和权益不同,因此本文不把它们转换成同一个“统一单价”。
会员路径适合需要产品内 Agent、研究和文件功能的人;API 路径适合需要 key、usage 日志、重试策略和可审计账单的开发者;浏览器路径则把页面、标签和模型选择放在同一工作流里。三者的余额、权益和可用模型不应互相推断。特别是,会员页的月费不能乘以 token 数量,也不能反过来用 API 费率推导会员能跑多少次 Agent。
社区反馈也说明了原因。一位 Reddit 用户认为额度是主要问题,另有用户称 ¥/美元高价计划可支持多小时 Agent 循环,也有人说半天就能用完一个月额度。它们是个人体验,不是配额证明。Kimi K3 社区测评和实战编码证据适合用来设计测试,不适合拼成统一评分。
社区实际反馈
额度会变成用户感知到的价格
原始社区页面包括 u/thegodkingreal、u/Timely_Impression_92、u/Moppmopp、u/the_stamp_collector 和 Web3 Wesley 的 YouTube 视频。这些是 2026 年 9 月 20 日收集的个人体验:Reddit 评论谈到 200 美元计划和多小时 Agent 循环,视频描述谈到与 Claude、Codex 并用 Moonshot 19 美元计划三个月。它们没有独立验证配额、当前版本行为或普遍 ROI。
u/thegodkingreal 把使用上限称为“ridiculous usage cap”,u/Moppmopp 则说 200 美元计划可能在半天内用完。两条记录都讨论的是“能完成多少有效循环”,而不是官方费率表;它们也没有给出可复核的 token 数、套餐合同或当前 K3 版本证明。因此只能作为采购问题的提示:先测自己的循环次数,再判断月费是否划算。
同一方案对不同任务可能足够
u/Timely_Impression_92 说 200 美元计划支持多小时 Agent 循环且体验不错;u/the_stamp_collector 说自己每天长时间使用 Kimi、没有遇到问题。Web3 Wesley 的视频则把问题 framing 为 Kimi Code 能否替代 100 美元 Claude 订阅,并在描述中说自己把 Moonshot 19 美元计划与 Claude、Codex 并用三个月。作者、任务长度、客户端组合和收集时点都不同,不能把它们合并成一个配额结论。
一个可行的选择:在 Tabbit 里比较
如果当前账户支持 Kimi K3,可以从 Kimi K3 模型页进入提示词集合,用同一任务比较短回答、长文档问题或分阶段编码请求。多模型对话适合回答“同一个任务有几种模型可选”,但不会把会员额度变成 API 余额,也不会显示隐藏配额。
一个可复现的浏览器流程是:先选择同一提示词,再分别记录回答长度、是否需要重试、是否需要人工修正,最后把结果与 API 预算表并排看。短任务可以观察回答质量和输出上限,长文档任务可以观察上下文是否被截断,多模型视图则能帮助判断是否值得把任务固定在 K3。这个流程测的是任务适配,不是 Kimi 官方账单,也不保证每个账户都开放该模型。

对更广的长上下文讨论,可读 GPT-5.6 Sol 文章;它不是 K3 的直接价格来源。
按工作负载做决定
| 工作负载 | 主要成本 | 起点 | 注意事项 |
|---|---|---|---|
| 小输入、短回答 | 输出和重试 | API + 输出上限 | $15/M 输出会超过 $3/M 输入 |
| 重复 100k–500k 前缀 | 写入、TTL、命中 | API + 记录命中与写入 | 冷写入不是热命中 |
| 超过 262k 的长上下文 | 上下文和调用次数 | 比较 K3 与截断/检索成本 | 高单价可能减少总调用次数 |
| 后台 Agent 循环 | 输出、重试、额度、并发 | 先测试代表性循环 | 用户之间额度消耗差异很大 |
| 一次性研究 | 会员功能与限制 | 比较当前会员页 | 会员不是 API 计费 |
| 多模型浏览器工作 | 模型可用性和任务匹配 | 在 Tabbit 中试用支持的模型 | 以当前账户和版本为准 |
最终判断
当 1M 上下文与能力足以抵消更高的 $15/M 输出成本时,Kimi K3 API 才值得进入预算。任务能放进更小上下文且验收允许时,先测试更便宜的 Kimi 行。需要产品内 Agent 和研究功能时,比较会员额度,而不要把会员当作 token 钱包。
至少建立三种预算:冷请求、缓存命中请求、失败或重试的 Agent 循环。用真实的输入和验收标准测试,再在付款前重新查看官方 API 价格和会员页面。
本文使用的动态事实只代表 2026 年 9 月 20 日的核对结果:美元 API 费率、CNY 会员月费、API 标签页价格、缓存规则、税费和地区资格都可能独立变化。最终预算应保存费率页面的日期、实际 usage、重试和工具费用;不要把社区体验或 Tabbit 浏览器中的一次测试当作官方价格证明。
常见问题
Kimi K3 API 官方价格是多少?
官方 API 表列出的 Kimi K3 价格为:未缓存输入每百万 token 3 美元,缓存命中输入每百万 token 0.30 美元,输出每百万 token 15 美元。缓存写入另行计费,5 分钟和 1 小时 TTL 的价格不同。
Kimi K3 缓存命中便宜多少?
缓存命中输入是每百万 0.30 美元,未缓存输入是每百万 3 美元,输入这一项相差 10 倍。首次写入和输出 token 仍要单独计入预算。
Kimi K3 缓存写入收费吗?
收费。官方 K3 表列出 5 分钟和 1 小时两种缓存写入价格;官方故障排查说明 API 会自动尝试缓存,调用方不需要提供 cache ID、TTL 或额外参数。命中缓存时按缓存输入价格计费,并刷新缓存有效期,不会再次收取同一次命中的写入费。
Kimi 会员和 Kimi K3 API 是一回事吗?
不是。会员方案提供产品功能和使用额度,API 按 token 用量计费。当前个人页显示 Andante ¥49/月、Moderato ¥99/月、Allegretto ¥199/月、Allegro ¥699/月;年付只说明更优惠、最高可省 ¥1,680,具体金额应以实时页面为准。
长上下文任务该选哪个 Kimi 模型?
官方比较表中 K2.6 的输入、缓存和输出单价低于 K3,但上下文窗口也更小。应同时比较任务所需上下文、调用次数和输出质量,不能只看单价。
Kimi K3 价格会变吗?
会。税费、地区、资格、额度和工具费用都可能独立变化。预算或购买前,应重新查看官方 API 价格页和会员页。