官方標出的 Token 單價永遠不是解決工程問題的全部成本,它僅僅是原材料的價格。在小米於 2026 年 9 月 22 日正式發布的官方費率表中,面向高效率與高輸送量場景的 MiMo-V2.6-Flash 定價為每百萬未快取輸入 token 1.00 元(0.140 美元),每百萬輸出 token 2.00 元(0.280 美元)。相比旗艦兄弟模型 Pro 便宜了超過 3 倍,這一極具競爭力的定價直接向輕量級模型市場發起衝擊。
然而,真正決定大規模落地可行性的底層機制在於兩點:一是高達 50 倍(98.0% 折扣)的 Prompt 快取優惠,將快取命中輸入的成本壓低至每百萬 token 0.020 元(0.0028 美元);二是其稀疏混合專家(MoE)設計在 309B 總參數中僅啟動 15B 參數,保證了超過 140 tok/s 的極速生成輸送量。對於大規模批量資料擷取、即時資訊分類與高頻瀏覽器智慧體來說,這徹底改變了單位工作量的成本公式。本指南旨在將官方費率表轉化為可複算的工程預算。如需檢視技術規格,請造訪 MiMo-V2.6-Flash 模型頁 (简体中文);如需了解 1.02T 旗艦版,可參閱 MiMo-V2.6-Pro 定價解析。
核心結論
基礎按量費率為輸入 1.00 元/M、輸出 2.00 元/M,名義調用成本較旗艦級 MiMo-V2.6-Pro (简体中文)(3 元/M 輸入、6 元/M 輸出)直降超過 3 倍。
Prompt 快取帶來 98.0% 的輸入成本削減:匹配的前綴僅需 0.020 元/M(0.0028 美元),使長前綴與參考文件的多輪查詢成本幾乎歸零。
無需額外購買 UltraSpeed 檔位:Flash 憑藉 15B 啟動參數的 MoE 架構原生具備 140+ tok/s 輸送量,官方未設定也不需要 10 倍加價的極速端點。
思考推理 Token 計入輸出行:在 RL 推理版本中,思維鏈消耗同樣按 2.00 元/M 輸出計費,無上限的深度發散推理依然會增加帳單。
反直覺的高快取成本收斂:在快取命中率超過 85% 的深層 Agent 循環中,Pro 的快取讀取成本(0.025 元/M)與 Flash(0.020 元/M)僅差 0.005 元,兩者的實際成本差異幾乎全在輸出端。
MiMo-V2.6-Flash 費率全貌速查
下表整理自 小米 MiMo 官方開發者文件,核驗日期為 2026 年 9 月 22 日。所有費率均以每 100 萬 token(1M)為單位標示。
| 模型型號 | 輸入(快取命中)/ 1M | 輸入(快取未命中)/ 1M | 輸出 / 1M | 上下文視窗 | 最大輸出限制 |
|---|---|---|---|---|---|
| MiMo-V2.6-Flash | ¥0.020 ($0.0028) | ¥1.00 ($0.140) | ¥2.00 ($0.280) | 1,048,576 | 131,072 |
| MiMo-V2.6-Pro | ¥0.025 ($0.0036) | ¥3.00 ($0.435) | ¥6.00 ($0.870) | 1,048,576 | 131,072 |
| DeepSeek V4.1 Flash | ¥0.021 ($0.0030) | ¥1.05 ($0.150) | ¥2.10 ($0.300) | 1,048,576 | 8,192 |
| Gemini 3.8 Flash | ¥0.263 ($0.0375) | ¥1.05 ($0.150) | ¥4.20 ($0.600) | 1,048,576 | 8,192 |
這張費率表展現了明確的市場定位:MiMo-V2.6-Flash 在價格上全面對標並略微超越 DeepSeek V4.1 Flash 與 Gemini 3.8 Flash,同時在 100 萬 token 上下文內提供了高達 131,072 token 的最大輸出空間。
變化的關鍵數字:0.020 元/百萬快取 Token
對於高並發與高頻任務的基礎設施架構師而言,核心指標是 0.020 元 / 1M token(0.0028 美元)。相比未快取輸入的 1.00 元/M,降幅高達 98.0%(即降低至 1/50)。
在實際的網頁智慧體場景中,例如執行 長程智慧體推理工作流程 時,智慧體往往需要對同一頁面的 DOM 結構、全域指令或知識庫進行多輪反思、工具調用與結果比對。如果一段 10 萬 token 的網頁上下文在 20 輪互動中反覆提交且未開啟快取,將消耗 200 萬未快取輸入 token(花費 2.00 元)。而在 Prompt 自動快取機制下,這 20 輪中的重複前綴輸入成本僅需約 0.04 元。
與此同時,Flash 模型的輕量 MoE 設計使其首字延遲(TTFT)極低,生成輸送量保持在 140 tok/s 以上,確保大規模批量爬蟲擷取與即時資訊過濾不會受制於排隊等待。
拆解官方“極致性價比”聲明
小米在發布通稿中強調 MiMo-V2.6-Flash 是企業級大規模資料管線的理想選擇。雖然按量單價優勢顯著,但在生產級系統架構設計中必須警惕兩個實際約束:
RL 推理模式下的思維鏈計費:
MiMo-V2.6-Flash-RL檢查點引入了強化學習推理能力。雖然 Flash 的輸出單價低至 2 元/M,但在複雜的多步驟指令下,模型可能在給出 200 字結構化輸出前生成 3,000 到 6,000 字的思考過程。由於思考 token 全部歸入輸出計費行,單個請求的實際花費取決於推理發散程度,而非 Prompt 長度。前綴快取的對齊穩定性:只有請求前綴嚴格匹配時才能觸發 0.020 元/M 的優惠價。如果在 Prompt 頭部插入動態時間戳記、隨機請求識別碼或變動不定的系統變數,將導致全量快取失效,直接退回 1.00 元/M 的未快取費率。
單次調用與月度預算的複算公式如下:
單次調用成本 = (未快取輸入 × 1.00
+ 快取命中輸入 × 0.020
+ 包含思考在內的輸出 × 2.00) / 1,000,000
月度總預算 = (平均單次成本 × 月度計費任務數) + 重試容災餘量主線費率表之外的細則
全面評估 TCO(總體擁有成本)還需要關注小米 MiMo 平台的邊緣規則:
Flash 無需且沒有 UltraSpeed 檔位:與旗艦級 Pro 提供 10 倍加價的
mimo-v2.6-pro-ultraspeed(輸入 30 元/M、輸出 60 元/M)不同,Flash 憑藉 15B 啟動參數的 MoE 特性本身就具備極速輸送量,不存在也不需要昂貴的極速加價模式。Token Plan 包月訂閱套餐:針對中小型團隊與獨立開發者,小米提供人民幣定價的固定額度套餐:
Lite 版(39 元/月):適合個人輕量測試與指令碼實驗;
Standard 版(99 元/月):適合日常爬蟲清洗與中頻任務;
Pro 版(329 元/月):提供更高並發通道,滿足生產流水線需求;
Max 版(659 元/月):企業級輸送量保障,滿足海量資料攝入。
並發與頻次限制(Rate Limits):按量計費 API 受平台 RPM(每分鐘請求數)與 TPM(每分鐘 token 數)限制約束,高並發批量擷取需提前申請提額。
初代 V2.5 生命週期截止:舊版 MiMo-V2.5 模型將於 2026 年 10 月 21 日正式停止服務,調用方應盡快遷移至 V2.6 端點。
家族階梯對比與選型決策
| 模型型號 | 最佳適用工作負載 | 輸入 / 1M(未命中 / 命中) | 輸出 / 1M | 輸送量與延遲表現 |
|---|---|---|---|---|
| MiMo-V2.6-Flash | 海量網頁清洗、高頻分類過濾、文件初篩與摘要 | ¥1.00 / ¥0.020 | ¥2.00 | 極高輸送量(140+ tok/s),15B 啟動 MoE |
| MiMo-V2.6-Pro | 複雜程式碼重構、多步數學證明、深度邏輯推理 | ¥3.00 / ¥0.025 | ¥6.00 | 深度推理,42B 啟動 / 1.02T 總參數 MoE |
| MiMo-V2.6-Pro-UltraSpeed | 即時語音對齊、毫秒級互動式客服系統 | ¥30.00 / ¥0.250 | ¥60.00 | 極速回應(生成速度提速最高 20 倍,成本 10 倍) |
這一梯隊中存在一個反直覺的決策拐點:在單輪零快取任務中,Flash 相比 Pro 便宜整整 3.1 倍;但當進入多輪深度 Agent 循環、Prompt 快取命中率達到 90% 以上時,Flash 與 Pro 的輸入端成本相差無幾(0.020 元 vs 0.025 元)。此時,是否升級為 1.02T 參數的 Pro 模型,幾乎只取決於輸出 token 量(2 元 vs 6 元)以及任務對高難度邏輯的硬性要求。更多模型對比可參考我們的 2026 年 AI 瀏覽器橫評指南。
不收錢的邊界與隱性開銷
明確計費邊界是避免帳單失控的關鍵:
基礎視窗內免收快取常駐保留費:與部分雲端廠商按小時收取快取儲存費不同,小米 MiMo 目前僅按快取讀取命中量收費,閒置等待不按小時疊加儲存費。
平台安全合規攔截免收生成費:因平台護欄觸發或安全策略主動截斷的請求,後續未生成的投機 token 不予扣費。
思考 Token 屬於正規計費項目:RL 模式下的內省思維鏈不是免費贈品,統一按 2 元/M 輸出標準全額扣費。
業務失敗與重試同樣消耗資金:若爬蟲遭遇驗證碼死循環、解析指令碼異常導致多輪重試,產生的全部 token 均需如實結帳。
開發者真實反饋台帳
來自技術社群的一手實測記錄反映了 MiMo-V2.6-Flash 在生產環境中的真實表現:




這些實踐經驗指明了統一的最佳實踐:用 Flash 承攬海量擷取與清洗,僅在遇到高難度複雜程式碼與邏輯瓶頸時再切回 Pro。
兩個可複現的真實業務算例
為了將抽象單價落實為企業預算,我們給出基於 2026 年官方費率的兩個代表性算例:
算例 1:高並發網頁資料批量結構化提取(海量請求、低快取複用)
單任務輸入:每頁 15,000 token(HTML 原始碼及擷取規範);25% 快取命中(3,750 命中 token,11,250 未命中 token)。
單任務輸出:800 token(結構化 JSON 清洗結果)。
單次成本:
11,250 × ¥1.00/M + 3,750 × ¥0.020/M + 800 × ¥2.00/M = ¥0.01125 + ¥0.000075 + ¥0.0016 = ¥0.012925(約 1.29 分錢)。每月 10,000 頁:¥129.25 / 月(約 18.10 美元)。同等業務若調用 MiMo-V2.6-Pro 則需花費 ¥399.75 / 月,Flash 直接節省 68%!
算例 2:多輪長文件對比與研報總結(深度上下文、高快取命中)
單任務輸入:跨 10 輪工具互動累計 300,000 token;85% 快取命中(255,000 命中 token,45,000 新增 token)。
單任務輸出:5,000 token(規劃、清洗與最終總結文本)。
單次成本:
45,000 × ¥1.00/M + 255,000 × ¥0.020/M + 5,000 × ¥2.00/M = ¥0.045 + ¥0.0051 + ¥0.010 = ¥0.0601(約 6 分錢)。每月 500 次任務:¥30.05 / 月(約 4.21 美元)。若無 Prompt 快取,僅輸入端就需要花費 ¥0.21/次,月開銷將飆升至 ¥155.00 / 月,成本高出 5 倍以上。
| 業務場景 | 輸入 Token | 快取比例 | 輸出 Token | 每月任務量 | 每月 Token 費用 |
|---|---|---|---|---|---|
| 高頻批量網頁清洗 | 15,000 | 25% | 800 | 10,000 次 | ¥129.25 ($18.10) |
| 多輪長文件智慧體 | 300,000 | 85% | 5,000 | 500 次 | ¥30.05 ($4.21) |
本機計算
估算每月 token 成本
使用 2026 年 9 月核對的官方 API 費率。思考 token 計入輸出,無須重複加算。所有輸入均在本地瀏覽器處理。
不含工具調用、重試與網路開銷。Pro 與 Flash 快取讀取費率分別為 $0.0036 與 $0.0028/百萬 token。核對日期:2026-09-22。 核對最新費率
上方計算器完全在本機瀏覽器中運行,無需向外部傳輸任何業務資料。您可以在其中自由調整輸入規模與快取比例,對比 Flash、Pro 與 UltraSpeed 的成本差異。
在 Tabbit 瀏覽器中編排真實業務流
算清 Token 帳單僅僅是第一步,智慧體仍然需要一個能夠穩定運行的網頁環境。自行維護無頭瀏覽器池、處理登入鑑權與複雜滾動載入,往往需要耗費大量基礎設施維運精力。
Tabbit 瀏覽器 提供了原生 AI 瀏覽器工作空間,智慧體可以直接在真實瀏覽器標籤頁中執行多源資訊檢索、表格結構化提取與跨工作階段事實核對。如果您正在探索智慧體瀏覽器的前沿架構,歡迎閱讀我們的深度解析 什麼是智慧體瀏覽器 以及 2026 年最佳 AI 瀏覽器橫向橫評。
依據專案公開記錄,Tabbit 內部的模型可用性以您登入帳號的即時模型選擇器與平台條款為準。Tabbit 並不替代您外部的獨立 API 帳戶,而是為您提供高槓桿的網頁級自動化操作台。
官方來源與參考
本文費率與模型規格均核驗自 2026 年 9 月 22 日官方發布資訊:
常見問題
MiMo-V2.6-Flash 官方 API 的調用價格是多少?
官方公佈的 API 費率顯示,MiMo-V2.6-Flash 未快取輸入為每百萬 token 1.00 元(0.140 美元),快取命中輸入為每百萬 token 0.020 元(0.0028 美元),輸出為每百萬 token 2.00 元(0.280 美元)。
MiMo-V2.6-Flash 的 Prompt 快取能便宜多少?
Prompt 快取命中輸入費率為每百萬 token 0.020 元(0.0028 美元),相比未快取的 1.00 元降低了整整 50 倍(即 98.0% 的折扣),能大幅削減多輪互動中的重複輸入成本。
MiMo-V2.6-Flash 的定價與旗艦 Pro 相比如何?
在未快取輸入(1.00 元 vs 3.00 元)和輸出(2.00 元 vs 6.00 元)上,Flash 比 Pro 便宜超過 3 倍;在快取命中輸入上,Flash 為 0.020 元/M,Pro 為 0.025 元/M,兩者的快取讀取成本極為接近。
Flash RL 模型的思考推理(Reasoning)Token 會單獨收費嗎?
不會單獨設立計費項目。小米 MiMo 將思考推理產生的 token 與正式輸出文本合併,統一按照每百萬 token 2.00 元(0.280 美元)的標準輸出費率計費。
MiMo-V2.6-Flash 是否提供 UltraSpeed 極速模式?
不提供。UltraSpeed 模式是旗艦 MiMo-V2.6-Pro 獨占的 10 倍加價檔位。Flash 本身依靠 15B 啟動參數的輕量 MoE 架構,原生輸出速度即可穩定在 140+ tok/s,無需額外加價極速檔。
可以在 Tabbit 瀏覽器中直接調用 MiMo-V2.6-Flash 嗎?
Tabbit 瀏覽器為網頁研究與智慧體工作流程提供了原生環境;模型在 Tabbit 內的具體可用性以當前登入帳號的模型選擇器與平台條款為準。