官方标出的 Token 单价永远不是解决实际工程问题的真实账单,它仅仅是一项原材料的单价。在小米于 2026 年 9 月 22 日公布的官方费率表中,旗舰模型 MiMo-V2.6-Pro 标价为每百万未缓存输入 token 3.00 元(0.435 美元),每百万输出 token 6.00 元(0.87 美元)。初看之下,这似乎只是开源与国产模型价格战中的又一张常规底牌。
然而,真正决定采购成本的底层机制在于两点:一是高达 120 倍(99.17% 折扣)的 Prompt 缓存优惠,将缓存命中输入的成本压低至每百万 token 0.025 元(0.0036 美元);二是高达 131,072 token 的最大单次输出窗口。当强化学习(RL)模型在给出答案前进行长程思维链展开时,输出 token 往往会瞬间成为账单的大头。本决策指南旨在将费率表还原为真实的工程预算。如果需要了解规格,请查看 MiMo-V2.6-Pro 模型概览;本文专注于成本算账与采购选型。
核心结论
基础按量费率为输入 3 元/M、输出 6 元/M,名义 token 单价约为西方主流旗舰模型的 1/20 至 1/60。
Prompt 缓存带来 120 倍价格杠杆:匹配的前缀仅需 0.025 元/M(0.0036 美元),使得多轮 Agent 交互在经济上真正具备可行性。
UltraSpeed 极速版精确加价 10 倍:
mimo-v2.6-pro-ultraspeed为实时交互提供最高 20 倍的生成速度,但单价陡增至输入 30 元/M、输出 60 元/M。思考推理 Token 计入输出行:模型内部生成的思考轨迹同样按 6 元/M 输出标准计费,复杂推理任务的输出成本可能是输入的数倍。
初代 V2.5 系列将于 2026 年 10 月 21 日正式停用:目前仍在调用 mimo-2-5-pro-api 或参考 mimo-2-5-pro-preset 的开发者应及时迁移预算与调用代码。
MiMo-V2.6-Pro 费率全貌速查
下表整理自 小米 MiMo 官方开发者文档,核验日期为 2026 年 9 月 22 日。所有费率均以每 100 万 token(1M)为单位标示。
| 模型型号 | 输入(缓存命中)/ 1M | 输入(缓存未命中)/ 1M | 输出 / 1M | 上下文窗口 | 最大输出限制 |
|---|---|---|---|---|---|
| MiMo-V2.6-Pro | ¥0.025 ($0.0036) | ¥3.00 ($0.435) | ¥6.00 ($0.87) | 1,048,576 | 131,072 |
| MiMo-V2.6-Flash | ¥0.020 ($0.0028) | ¥1.00 ($0.140) | ¥2.00 ($0.28) | 1,048,576 | 131,072 |
| MiMo-V2.6-Pro-UltraSpeed | ¥0.250 ($0.0360) | ¥30.00 ($4.350) | ¥60.00 ($8.70) | 1,048,576 | 131,072 |
| MiMo-V2.5-Pro(旧版) | — | ¥3.00 ($0.435) | ¥6.00 ($0.87) | 1,048,576 | 8,192 |
费率表揭示了产品演进的实质:虽然基础未缓存输入与输出维持在 3 元与 6 元,但 V2.6 增加了 0.025 元的缓存读取层,并将输出上限从 8k 扩充到 128k。旧版 V2.5 接口将于 2026 年 10 月 21 日正式下线。
关键叙事锚点:0.025 元/百万 token 的缓存读取
对于工程预算而言,最具杠杆作用的数字是每百万 token 0.025 元(0.0036 美元),它带来了相对于未缓存输入 99.17% 的降幅。
在现代智能体架构中,很少有孤立单次调用的场景。在执行复杂的智能体长程推理工作流时,Agent 需要分析网页 DOM、读取工具响应并多轮推演,往往产生 15 到 30 轮调用。如果每次都未缓存地重传累积的 50 万 token 上下文,20 轮交互仅输入端就要消耗 1000 万 token,成本达 30 元。而借助自动前缀缓存,这 20 轮交互的输入成本直接降至 0.25 元。
家族内部还有一个反直觉的发现:Pro 版的缓存命中单价与 Flash 版几乎拉平(0.025 元 vs 0.020 元)。在缓存命中率超过 85% 的工程架构中,调用拥有 1.02T 庞大参数规模的旗舰 MoE 模型,在输入端的账单几乎等同于使用轻量级 MiMo-V2.6-Flash。
官方宣传口径的“翻译”与验证
官方发布资料宣称 MiMo-V2.6-Pro 以“1/20 到 1/60 的成本”提供顶尖前沿性能。当对比 6 元输出与 Claude Opus 或 GPT-5.6 的名义费率时,单纯的数学比值确实成立,但实际排期预算时必须注意两处陷阱:
思考推理 Token 膨胀:作为经过大规模强化学习(RL)训练的模型,MiMo-V2.6-Pro 在处理疑难代码或逻辑推理时会自动展开详细思考。最终给出的 500 字代码片段前,可能已经默默消耗了 15,000 到 30,000 个思考 token。思考 token 按 6 元/M 的标准输出计费,单个复杂请求的输出账单可能会达到 0.18 元以上。
前缀缓存对齐敏感性:自动缓存依赖严格一致的提示词前缀。如果客户端程序在系统提示词开头拼接了动态时间戳、动态生成的请求 ID 或随机排列的工具声明,将导致每次请求全部判定为缓存未命中,按全价 3 元/M 扣费。
单次请求的标准核算公式如下:
单次成本 = (未缓存输入 token × ¥3.00
+ 缓存命中输入 token × ¥0.025
+ 总输出 token(含思考) × ¥6.00) ÷ 1,000,000
月度预算 = (平均单次成本 × 预估有效任务数) × 重试系数主线之外的账单明细
要全面把握采购开销,还需考虑平台提供的辅助方案与技术限制:
UltraSpeed 极速模式(10 倍成本):
mimo-v2.6-pro-ultraspeed专为实时语音交互、极速在线客服与极速代码补全设计,输出速度提升最高达 20 倍,但输入输出单价均直接放大 10 倍(未缓存输入 30 元/M,输出 60 元/M)。切忌把后台批量任务误发到该接口。Token Plan 预付费订阅包:针对个人开发者与轻量团队,官方推出了阶梯式的按月资源包(以人民币标价):
Lite 版(¥39/月):适合个人轻度体验与业余探索。
Standard 版(¥99/月):适合高频个人开发者与自动化小脚本。
Pro 版(¥329/月):提供更高的并发上限与额度,适合专业编码辅助。
Max 版(¥659/月):专为重度生产线与团队席位打造。
并发与速率配额:按量计费 API 受限于 RPM(每分钟请求数)与 TPM(每分钟 token 数)分级管控,大规模并行管道需要提前申请或沟通企业配额。
家族阶梯对比与选型指南
| 规格档位 | 最优适用场景 | 输入 / 1M(未命中 / 命中) | 输出 / 1M | 延迟与吞吐特征 |
|---|---|---|---|---|
| MiMo-V2.6-Pro | 复杂代码重构、多轮长逻辑推理、网页自动化 Agent | ¥3.00 / ¥0.025 | ¥6.00 | 兼顾深度推理与稳定吞吐 |
| MiMo-V2.6-Flash | 大规模文本分类、初筛、批量摘要与轻量 ETL | ¥1.00 / ¥0.020 | ¥2.00 | 极快响应,资源消耗低 |
| MiMo-V2.6-Pro-UltraSpeed | 实时对话智能体、秒级交互式助手 | ¥30.00 / ¥0.250 | ¥60.00 | 极致生成速度(最高提速 20 倍) |
选型决策非常清晰:非深度推理的批量初筛首选 MiMo-V2.6-Flash;复杂的编码与长程决策以 MiMo-V2.6-Pro 为默认主力;仅在端到端交互存在严苛毫秒级要求的场景下采用 UltraSpeed。关于其他前沿模型的横向对比,可参考我们的 2026 AI 浏览器横评 以及 Kimi K3 定价解析。
免费边界与额外开销项
划清计费边界能有效预防超额扣款:
基础时间窗口内无额外缓存存储费:与按每百万 token 小时收取持续留存费(如 Google 每小时 0.50 美元)的厂商不同,小米 MiMo 目前的自动前缀缓存仅按读取命中量结算,无单独的静态存储账单。
护栏拦截不额外惩罚:被系统安全过滤或合规规则阻断的请求,不会按完整预期生成 token 计收惩罚性费用。
思考 Token 绝非免费赠送:部分开发者误以为“深度思考”属于免费增值功能,实际上它全部按输出计费。
Agent 失败与死循环照常计费:如果自主智能体发生幻觉陷入无意义的重复工具调用,这些 token 消耗将全额计入账单。
开发者社区的真实反馈
开发者在各类技术论坛上的实际测评既证实了该模型的性价比优势,也点明了实际工程边界:




这些实践经验提醒我们:在评估 AI 模型采购方案时,必须聚焦于单项任务的综合完成成本,而不是被表面的宣传参数所迷惑。
两个可复现的真实工程算例
结合 2026 年官方美元标准费率,我们测算两类典型业务负载的实际支出:
算例一:单轮原子代码修复任务(短输入,高密度思考)
输入参数:25,000 未缓存 token(仓库相关代码段与问题描述),缓存命中率 0%。
输出参数:3,500 token(包含 2,500 思考推理 token 与 1,000 代码修改建议)。
核算:
(25,000 × $0.435 + 3,500 × $0.87) ÷ 1,000,000 = $0.010875 + $0.003045 = $0.01392(折合约 0.096 元人民币)。月度估算:每月 1,000 次执行约 $13.92(约 96 元);按 1.2 重试系数冗余后约为 $16.70(约 115 元)。
算例二:多轮长文档与网页研究智能体(长上下文,高缓存命中)
输入参数:累积上下文 800,000 token(跨 15 轮工具调用);缓存命中率 92%(736,000 缓存命中 token,64,000 新输入 token)。
输出参数:总输出 12,000 token(包含中间搜索规划与最终结构化报告)。
核算:
(64,000 × $0.435 + 736,000 × $0.0036 + 12,000 × $0.87) ÷ 1,000,000 = $0.02784 + $0.00265 + $0.01044 = $0.04093(折合约 0.28 元人民币)。月度估算:每月 200 次大任务耗费 $8.19(约 56 元)。若没有前缀缓存机制,相同任务的月度成本将飙升至 $71.60,相差超过 8.7 倍。
| 任务场景 | 任务输入 Token | 缓存比例 | 任务输出 Token | 月任务量 | 月度 Token 成本(美元) |
|---|---|---|---|---|---|
| 原子代码报错修复 | 25,000 | 0% | 3,500 | 1,000 | $13.92 |
| 多轮研究智能体 | 800,000 | 92% | 12,000 | 200 | $8.19 |
本地计算
估算每月 token 成本
使用 2026 年 9 月核对的官方 API 费率。思考 token 计入输出,无需重复加算。所有输入均在本地浏览器处理。
不含工具调用、重试和网络开销。Pro 与 Flash 缓存读取费率分别为 $0.0036 与 $0.0028/百万 token。核对日期:2026-09-22。 核对最新费率
上方计算器完全在本地浏览器运算,不会向任何外部服务器回传数据。您可以自由调整参数,实时对比 Pro、Flash 与 UltraSpeed 的成本差异。
在 Tabbit 浏览器中落地模型工作流
核算清楚模型调用的账单后,工程师还需要一个能够直接承载工作流的客户端环境。如果每次进行网页检索、跨标签页数据提取和多文档比对都要手动编写爬虫脚本和粘合代码,会带来巨大的开发包袱。
Tabbit 浏览器 提供了原生集成的 AI 交互能力,智能体可以直接在真实浏览器环境中浏览网页、解析表格结构并在会话之间沉淀知识。欲了解智能体驱动的浏览体验,请查阅 什么是智能体浏览器 以及 2026 年最佳 AI 浏览器推荐。
依据项目官方说明,Tabbit 中各类模型的实时可用性以登录账号的具体模型选择列表为准。Tabbit 本身不代收外部 API 账单,但能为以浏览器为中心的调研提供极具生产力的高效环境。
数据来源
本文所有费率与参数均采集自 2026 年 9 月 22 日官方公开发布的技术文档:
常见问题
MiMo-V2.6-Pro 官方 API 的调用价格是多少?
根据官方 API 费率表,MiMo-V2.6-Pro 未缓存输入为每百万 token 3.00 元(0.435 美元),缓存命中输入为每百万 token 0.025 元(0.0036 美元),输出为每百万 token 6.00 元(0.87 美元)。
MiMo-V2.6-Pro 的 Prompt 缓存能便宜多少?
缓存命中输入的费率为每百万 token 0.025 元,相比未缓存的 3.00 元降低了 120 倍(相当于 99.17% 的折扣),能大幅降低多轮 Agent 循环的前缀重读成本。
模型内部的思考推理(Reasoning)Token 会单独收费吗?
不会单独设立计费项。小米 MiMo 将思考推理过程产生的 token 与最终输出文本合并,统一按照每百万 token 6.00 元(0.87 美元)的标准输出费率计算。
MiMo-V2.6-Pro-UltraSpeed 是什么,为什么价格贵 10 倍?
UltraSpeed 是专为低延迟和实时交互优化的极速版本,输出生成速度最高提升 20 倍。其输入和输出费率均严格为基础版的 10 倍(未缓存输入 30 元/M,输出 60 元/M)。
小米 Token Plan 订阅套餐与按量付费 API 有什么区别?
Token Plan 为预付费包月方案(Lite 版 39 元/月、Standard 版 99 元/月、Pro 版 329 元/月、Max 版 659 元/月),提供固定额度与席位权益;而开发者 API 是按实际消耗的 token 百万分比按量结算。
可以在 Tabbit 浏览器中直接调用 MiMo-V2.6-Pro 吗?
Tabbit 浏览器为网页研究与智能体工作流提供了原生环境;模型在 Tabbit 内的具体可用性以当前登录账号的模型选择器与平台条款为准。