官方標出的 Token 單價永遠不是解決實際工程問題的真實帳單,它僅僅是一項原材料的單價。在小米於 2026 年 9 月 22 日公布的官方費率表中,旗艦模型 MiMo-V2.6-Pro 標價為每百萬未快取輸入 token 3.00 元(0.435 美元),每百萬輸出 token 6.00 元(0.87 美元)。乍看之下,這似乎只是開源與國產模型價格戰中的又一張常規底牌。
然而,真正決定採購成本的底層機制在於兩點:一是高達 120 倍(99.17% 折扣)的 Prompt 快取優惠,將快取命中輸入的成本壓低至每百萬 token 0.025 元(0.0036 美元);二是高達 131,072 token 的最大單次輸出窗口。當強化學習(RL)模型在給出答案前進行長程思維鏈展開時,輸出 token 往往會瞬間成為帳單的大頭。本決策指南旨在將費率表還原為真實的工程預算。如果需要了解規格,請查看 MiMo-V2.6-Pro 模型概覽 (简体中文);本文專注於成本算帳與採購選型。
核心結論
基礎按量費率為輸入 3 元/M、輸出 6 元/M,名義 token 單價約為西方主流旗艦模型的 1/20 至 1/60。
Prompt 快取帶來 120 倍價格槓桿:匹配的前綴僅需 0.025 元/M(0.0036 美元),使得多輪 Agent 互動在經濟上真正具備可行性。
UltraSpeed 極速版精確加價 10 倍:
mimo-v2.6-pro-ultraspeed為即時互動提供最高 20 倍的生成速度,但單價陡增至輸入 30 元/M、輸出 60 元/M。思考推理 Token 計入輸出行:模型內部生成的思考軌跡同樣按 6 元/M 輸出標準計費,複雜推理任務的輸出成本可能是輸入的數倍。
初代 V2.5 系列將於 2026 年 10 月 21 日正式停用:目前仍在調用 mimo-2-5-pro-api 或參考 mimo-2-5-pro-preset 的開發者應及時遷移預算與調用代碼。
MiMo-V2.6-Pro 費率全貌速查
下表整理自 小米 MiMo 官方開發者文檔,核驗日期為 2026 年 9 月 22 日。所有費率均以每 100 萬 token(1M)為單位標示。
| 模型型號 | 輸入(快取命中)/ 1M | 輸入(快取未命中)/ 1M | 輸出 / 1M | 上下文窗口 | 最大輸出限制 |
|---|---|---|---|---|---|
| MiMo-V2.6-Pro | ¥0.025 ($0.0036) | ¥3.00 ($0.435) | ¥6.00 ($0.87) | 1,048,576 | 131,072 |
| MiMo-V2.6-Flash | ¥0.020 ($0.0028) | ¥1.00 ($0.140) | ¥2.00 ($0.28) | 1,048,576 | 131,072 |
| MiMo-V2.6-Pro-UltraSpeed | ¥0.250 ($0.0360) | ¥30.00 ($4.350) | ¥60.00 ($8.70) | 1,048,576 | 131,072 |
| MiMo-V2.5-Pro(舊版) | — | ¥3.00 ($0.435) | ¥6.00 ($0.87) | 1,048,576 | 8,192 |
費率表揭示了產品演進的實質:雖然基礎未快取輸入與輸出維持在 3 元與 6 元,但 V2.6 增加了 0.025 元的快取讀取層,並將輸出上限從 8k 擴充到 128k。舊版 V2.5 接口將於 2026 年 10 月 21 日正式下線。
關鍵敘事錨點:0.025 元/百萬 token 的快取讀取
對於工程預算而言,最具槓桿作用的數字是每百萬 token 0.025 元(0.0036 美元),它帶來了相對於未快取輸入 99.17% 的降幅。
在現代智慧體架構中,很少有孤立單次調用的場景。在執行複雜的智慧體長程推理工作流時,Agent 需要分析網頁 DOM、讀取工具回應並多輪推演,往往產生 15 到 30 輪調用。如果每次都未快取地重傳累積的 50 萬 token 上下文,20 輪互動僅輸入端就要消耗 1000 萬 token,成本達 30 元。而藉助自動前綴快取,這 20 輪互動的輸入成本直接降至 0.25 元。
家族內部還有一個反直覺的發現:Pro 版的快取命中單價與 Flash 版幾乎拉平(0.025 元 vs 0.020 元)。在快取命中率超過 85% 的工程架構中,調用擁有 1.02T 龐大參數規模的旗艦 MoE 模型,在輸入端的帳單幾乎等同於使用輕量級 MiMo-V2.6-Flash (简体中文)。
官方宣傳口徑的“翻譯”與驗證
官方發布資料宣稱 MiMo-V2.6-Pro 以“1/20 到 1/60 的成本”提供頂尖前沿性能。當對比 6 元輸出與 Claude Opus 或 GPT-5.6 的名義費率時,單純的數學比值確實成立,但實際排期預算時必須注意兩處陷阱:
思考推理 Token 膨脹:作為經過大規模強化學習(RL)訓練的模型,MiMo-V2.6-Pro 在處理疑難代碼或邏輯推理時會自動展開詳細思考。最終給出的 500 字代碼片段前,可能已經默默消耗了 15,000 到 30,000 個思考 token。思考 token 按 6 元/M 的標準輸出計費,單個複雜請求的輸出帳單可能會達到 0.18 元以上。
前綴快取對齊敏感性:自動快取依賴嚴格一致的提示詞前綴。如果客戶端程式在系統提示詞開頭拼接了動態時間戳、動態生成的請求 ID 或隨機排列的工具聲明,將導致每次請求全部判定為快取未命中,按全價 3 元/M 扣費。
單次請求的標準核算公式如下:
單次成本 = (未快取輸入 token × ¥3.00
+ 快取命中輸入 token × ¥0.025
+ 總輸出 token(含思考) × ¥6.00) ÷ 1,000,000
月度預算 = (平均單次成本 × 預估有效任務數) × 重試係數主線之外的帳單明細
要全面把握採購開銷,還需考慮平台提供的輔助方案與技術限制:
UltraSpeed 極速模式(10 倍成本):
mimo-v2.6-pro-ultraspeed專為即時語音互動、極速線上客服與極速代碼補全設計,輸出速度提升最高達 20 倍,但輸入輸出單價均直接放大 10 倍(未快取輸入 30 元/M,輸出 60 元/M)。切忌把後台批量任務誤發到該接口。Token Plan 預付費訂閱包:針對個人開發者與輕量團隊,官方推出了階梯式的按月資源包(以人民幣標價):
Lite 版(¥39/月):適合個人輕度體驗與業餘探索。
Standard 版(¥99/月):適合高頻個人開發者與自動化小腳本。
Pro 版(¥329/月):提供更高的並發上限與額度,適合專業編碼輔助。
Max 版(¥659/月):專為重度生產線與團隊席位打造。
並發與速率配額:按量計費 API 受限於 RPM(每分鐘請求數)與 TPM(每分鐘 token 數)分級管控,大規模並行管道需要提前申請或溝通企業配額。
家族階梯對比與選型指南
| 規格檔位 | 最優適用場景 | 輸入 / 1M(未命中 / 命中) | 輸出 / 1M | 延遲與吞吐特徵 |
|---|---|---|---|---|
| MiMo-V2.6-Pro | 複雜代碼重構、多輪長邏輯推理、網頁自動化 Agent | ¥3.00 / ¥0.025 | ¥6.00 | 兼顧深度推理與穩定吞吐 |
| MiMo-V2.6-Flash | 大規模文本分類、初篩、批量摘要與輕量 ETL | ¥1.00 / ¥0.020 | ¥2.00 | 極快響應,資源消耗低 |
| MiMo-V2.6-Pro-UltraSpeed | 即時對話智慧體、秒級互動式助手 | ¥30.00 / ¥0.250 | ¥60.00 | 極致生成速度(最高提速 20 倍) |
選型決策非常清晰:非深度推理的批量初篩首選 MiMo-V2.6-Flash;複雜的編碼與長程決策以 MiMo-V2.6-Pro 為默認主力;僅在端到端互動存在嚴苛毫秒級要求的場景下採用 UltraSpeed。關於其他前沿模型的橫向對比,可參考我們的 2026 AI 瀏覽器橫評 以及 Kimi K3 定價解析。
免費邊界與額外開銷項
劃清計費邊界能有效預防超額扣款:
基礎時間窗口內無額外快取儲存費:與按每百萬 token 小時收取持續留存費(如 Google 每小時 0.50 美元)的廠商不同,小米 MiMo 目前的自動前綴快取僅按讀取命中量結算,無單獨的靜態儲存帳單。
護欄攔截不額外懲罰:被系統安全過濾或合規規則阻斷的請求,不會按完整預期生成 token 計收懲罰性費用。
思考 Token 絕非免費贈送:部分開發者誤以為“深度思考”屬於免費增值功能,實際上它全部按輸出計費。
Agent 失敗與死循環照常計費:如果自主智慧體發生幻覺陷入無意義的重複工具調用,這些 token 消耗將全額計入帳單。
開發者社群的真實反饋
開發者在各類技術論壇上的實際測評既證實了該模型的性價比優勢,也點明了實際工程邊界:




這些實踐經驗提醒我們:在評估 AI 模型採購方案時,必須聚焦於單項任務的綜合完成成本,而不是被表面的宣傳參數所迷惑。
兩個可復現的真實工程算例
結合 2026 年官方美元標準費率,我們測算兩類典型業務負載的實際支出:
算例一:單輪原子代碼修復任務(短輸入,高密度思考)
輸入參數:25,000 未快取 token(倉庫相關代碼段與問題描述),快取命中率 0%。
輸出參數:3,500 token(包含 2,500 思考推理 token 與 1,000 代碼修改建議)。
核算:
(25,000 × $0.435 + 3,500 × $0.87) ÷ 1,000,000 = $0.010875 + $0.003045 = $0.01392(折合約 0.096 元人民幣)。月度估算:每月 1,000 次執行約 $13.92(約 96 元);按 1.2 重試係數冗餘後約為 $16.70(約 115 元)。
算例二:多輪長文檔與網頁研究智慧體(長上下文,高快取命中)
輸入參數:累積上下文 800,000 token(跨 15 輪工具調用);快取命中率 92%(736,000 快取命中 token,64,000 新輸入 token)。
輸出參數:總輸出 12,000 token(包含中間搜尋規劃與最終結構化報告)。
核算:
(64,000 × $0.435 + 736,000 × $0.0036 + 12,000 × $0.87) ÷ 1,000,000 = $0.02784 + $0.00265 + $0.01044 = $0.04093(折合約 0.28 元人民幣)。月度估算:每月 200 次大任務耗費 $8.19(約 56 元)。若沒有前綴快取機制,相同任務的月度成本將飆升至 $71.60,相差超過 8.7 倍。
| 任務場景 | 任務輸入 Token | 快取比例 | 任務輸出 Token | 月任務量 | 月度 Token 成本(美元) |
|---|---|---|---|---|---|
| 原子代碼報錯修復 | 25,000 | 0% | 3,500 | 1,000 | $13.92 |
| 多輪研究智慧體 | 800,000 | 92% | 12,000 | 200 | $8.19 |
本機計算
估算每月 token 成本
使用 2026 年 9 月核對的官方 API 費率。思考 token 計入輸出,無須重複加算。所有輸入均在本地瀏覽器處理。
不含工具調用、重試與網路開銷。Pro 與 Flash 快取讀取費率分別為 $0.0036 與 $0.0028/百萬 token。核對日期:2026-09-22。 核對最新費率
上方計算器完全在本地瀏覽器運算,不會向任何外部伺服器回傳數據。您可以自由調整參數,即時對比 Pro、Flash 與 UltraSpeed 的成本差異。
在 Tabbit 瀏覽器中落地模型工作流
核算清楚模型調用的帳單後,工程師還需要一個能夠直接承載工作流的客戶端環境。如果每次進行網頁檢索、跨標籤頁數據提取和多文檔比對都要手動編寫爬蟲腳本和粘合代碼,會帶來巨大的開發包袱。
Tabbit 瀏覽器 提供了原生集成的 AI 互動能力,智慧體可以直接在真實瀏覽器環境中瀏覽網頁、解析表格結構並在會話之間沉澱知識。欲了解智慧體驅動的瀏覽體驗,請查閱 什麼是智慧體瀏覽器 以及 2026 年最佳 AI 瀏覽器推薦。
依據項目官方說明,Tabbit 中各類模型的即時可用性以登入帳號的具體模型選擇列表為準。Tabbit 本身不代收外部 API 帳單,但能為以瀏覽器為中心的調研提供極具生產力的高效環境。
數據來源
本文所有費率與參數均採集自 2026 年 9 月 22 日官方公開發布的技術文檔:
常見問題
MiMo-V2.6-Pro 官方 API 的調用價格是多少?
根據官方 API 費率表,MiMo-V2.6-Pro 未快取輸入為每百萬 token 3.00 元(0.435 美元),快取命中輸入為每百萬 token 0.025 元(0.0036 美元),輸出為每百萬 token 6.00 元(0.87 美元)。
MiMo-V2.6-Pro 的 Prompt 快取能便宜多少?
快取命中輸入的費率為每百萬 token 0.025 元,相比未快取的 3.00 元降低了 120 倍(相當於 99.17% 的折扣),能大幅降低多輪 Agent 循環的前綴重讀成本。
模型內部的思考推理(Reasoning)Token 會單獨收費嗎?
不會單獨設立計費項目。小米 MiMo 將思考推理過程產生的 token 與最終輸出文本合併,統一按照每百萬 token 6.00 元(0.87 美元)的標準輸出費率計算。
MiMo-V2.6-Pro-UltraSpeed 是什麼,為什麼價格貴 10 倍?
UltraSpeed 是專為低延遲和即時互動優化的極速版本,輸出生成速度最高提升 20 倍。其輸入和輸出費率均嚴格為基礎版的 10 倍(未快取輸入 30 元/M,輸出 60 元/M)。
小米 Token Plan 訂閱套餐與按量付費 API 有什麼區別?
Token Plan 為預付費包月方案(Lite 版 39 元/月、Standard 版 99 元/月、Pro 版 329 元/月、Max 版 659 元/月),提供固定額度與席位權益;而開發者 API 是按實際消耗的 token 百萬分比按量結算。
可以在 Tabbit 瀏覽器中直接調用 MiMo-V2.6-Pro 嗎?
Tabbit 瀏覽器為網頁研究與智慧體工作流提供了原生環境;模型在 Tabbit 內的具體可用性以當前登入帳號的模型選擇器與平台條款為準。