Gemini 3.8 Flash 的价格重点不是“每百万 token 多少钱”,而是一次任务实际用了多少 token。2026 年 12 月 31 日前,标准 API 输入为每百万 token 0.75 美元,输出为 3.75 美元;输出价格已经包含 thinking token。缓存读取为 0.075 美元,缓存存储为每百万 token 每小时 0.50 美元。2027 年 1 月 1 日起,Google 列出的这些标准价格翻倍。
单次成本公式是:(未缓存输入×输入费率 + 缓存读取×缓存读取费率 + 含 thinking 的输出×输出费率)/1,000,000 + 缓存存储费。订阅额度和 Tabbit 费用不属于这笔 API 账单。

关键结论
thinking 不另开一项,必须计入输出总量一次。
Batch 是单独的 50% 价格模式;Flex 也有自己的模式和费率,二者不能叠加。
月预算还要加入调用次数、失败重试、工具请求和缓存存储时间。
费率表
| 项目 | 2026-12-31 前 | 2027-01-01 起 | 单位 |
|---|---|---|---|
| 标准输入 | $0.75 | $1.50 | 每百万 token |
| 标准输出(含 thinking) | $3.75 | $7.50 | 每百万 token |
| 缓存读取 | $0.075 | $0.15 | 每百万 token |
| 缓存存储 | $0.50 | $1.00 | 每百万 token·小时 |
| Batch 输入 | $0.375 | $0.75 | 每百万 token |
| Batch 输出(含 thinking) | $1.875 | $3.75 | 每百万 token |
| Batch 缓存读取 | $0.0375 | $0.075 | 每百万 token |
Google 定价页的 Standard、Batch、Flex 和 Priority 是独立标签。模型页只证明 3.8 Flash 支持 Batch API 与 Flex inference,不代表普通 Standard 请求自动享受折扣。
两个可复算算例
算例一:未缓存的分析请求
假设一次请求使用 200,000 个未缓存输入 token,并产生 20,000 个含 thinking 的输出 token:
(0.2×$0.75) + (0.02×$3.75) = $0.15 + $0.075 = $0.225100 次成功调用是 $22.50。若预计平均每次需要 1.2 次尝试,预算为 $22.50×1.2=$27.00,未含工具费用。2027 年相同用量的单次成本为 $0.45。
算例二:缓存文档任务
假设 900,000 token 文档缓存 10 小时,每次读取 900,000 个缓存 token,新增 100,000 个未缓存 token,输出 30,000 个含 thinking 的 token:
token 费用 = (0.1×$0.75)+(0.9×$0.075)+(0.03×$3.75)
= $0.075+$0.0675+$0.1125 = $0.255
存储费用 = 0.9×10×$0.50 = $4.50若这 10 小时内运行 20 次,合计为 $4.50+(20×$0.255)=$9.60。缓存存储和缓存读取是两笔费用;不读取缓存也不会自动免除存储费。
Batch、Flex、工具与重试
Batch 适合可以延迟完成的工作。Flex 是另一种独立推理模式,准确费率应按官方页面当前标签核对。不要把 Standard 价格再乘 Batch 折扣和 Flex 折扣。
工具也可能产生费用。Google 说明 Search grounding、Maps 有请求额度和超额价格;URL context 按输入 token 计费;代码执行按模型 token 计费,不按会话运行时间收费;File Search 还可能有 embedding 费用。查看工具计价说明。
月预算可写成:成功任务数×单次 token 成本×平均尝试次数 + 工具费 + 存储费。不要把失败请求默认当作零成本。
Tabbit 的边界
Tabbit Browser 适合组织多页面研究,可先看AI 浏览器介绍、智能体浏览器指南、浏览器自动化和模型资源页。本次测试客户端能在模型选择器看到 Gemini-3.8-Flash,但新任务页加载错误,没有完成推理。因此不能据此证明生产可用性、成功调用或 Tabbit 费用。API 成本必须按真实 API 账户和日志核算。
API、订阅与产品费用分开
AI Studio 的免费额度、Gemini 消费者订阅、Developer API 付费层和 Tabbit 使用条款是不同产品。请从总览了解获取入口,从测评了解任务证据,再用替代品指南比较成本约束,也可查看AI 浏览器对比。
两种负载的预算对照
| 工作负载 | 2026 年估算(美元) | 未计入 |
|---|---|---|
| 100 个无缓存任务;每次成功平均尝试 1.2 次 | 27.00 | 工具费用及适用时的缓存创建开销 |
| 10 小时内 20 个缓存任务;不重试 | 9.60 | 工具费用及适用时的缓存创建开销 |
社区反馈能说明什么
NERD UP 关注 token 消耗与隐含成本,Bijan Bowen 展示编码和浏览器任务。这里引用的是视频页面可见标题与章节,不是账单或同条件性能测试。它们说明预算为什么需要统计重试与完整输出。
C_tokens = (I_uncached × P_input + I_cached × P_cached + O_total × P_output) / 1,000,000
C_total = sum(C_tokens for ALL attempts) + C_storage + C_tools
C_success = C_total / N_success [N_success > 0]统计全部计费尝试,包括失败和重试;共享存储与工具费只加一次。没有成功任务时,不计算每成功任务成本。
社区的每任务成本争议
Hacker News 9 月 2—3 日的同一讨论串围绕“每任务成本”出现正反观点:gundmc 认为成本基准可能比 token 费率更有解释力,bermudi 认为更高的输出 token 会抵消低单价,criley2 则指出 effort 不同会改变排序。它们引用了不同的 Artificial Analysis 视图,不能当作本文复现的排行榜。
原评论:gundmc(9 月 2 日)、bermudi(9 月 2 日)、criley2(9 月 2 日)、criley2(9 月 3 日)。




结论只保留一条:记录 effort 和总输出,再用官方费率计算,不要把社区排序当作验证结果。
家族阶梯、effort 杠杆与不收费边界
Google 当前公布的 2026 Standard 行显示,Gemini 3.8 Flash、3.7 Flash 和 3.6 Flash 都是输入 $0.75、输出 $3.75、缓存读取 $0.075(每百万 token)。费率相同不代表质量、延迟或可用性相同;它只说明换模型不会自动改变 token 算术。真正的成本杠杆是缓存比例、总输出(包含 thinking)、任务轮数和重试次数。降低 effort 只有在确实减少总输出且结果仍可用时才省钱。
Thinking 没有单独附加费,因为已包含在输出;缓存读取也不等于缓存存储。Batch 与 Flex 是两个独立模式,2026 年公布的 token 费率都是标准 token 费率的一半,不能叠加折扣。搜索、Maps、URL context 和 File Search 等工具另有计费规则。失败请求可能已经消耗 token,因此不能假设重试免费。
两种工作负载:先列假设,再算账
以下使用 2026 Standard token 费率;输出已含思考,不重复计费。不含存储、工具、重试和税费。按已公布的 2027 Standard token 费率,两行仅 token 的月费用分别为 30 和 36 美元。
| 工作负载 | 每次输入 | 缓存比例 | 每次总输出 | 每月次数 | 月 token 费用 |
|---|---|---|---|---|---|
| 短文本抽取 | 10,000 | 0% | 2,000 | 1,000 | $15 |
| 重复文档分析 | 1,000,000 | 90% | 10,000 | 100 | $18 |
本地计算
估算每月 token 成本
使用截至 2026-12-31 的 Standard API 费率。输出包含思考 token,勿重复计算。输入值仅在浏览器处理。
不含缓存存储、工具、重试和税费。同价不等于每次任务使用相同 token。核对日期:2026-09-20。 核对最新费率
计算器只在浏览器本地运行,比较三个已知家族模型的 2026 Standard 费率,不把未知价格填成 0,也不计缓存存储、工具、重试和税费。准备好实际 token 日志后,再回到 Google 官方价格页复核。
算清 API 后,选择运行它的地方
Tabbit Browser 可以作为整理网页和上下文的浏览器入口,Gemini 3.8 Flash 模型页说明了对应路线。使用 Tabbit Browser Dev、测试站登录账户完成的一次支付记录抽取任务,正确返回 currency、paid_total、overdue_ids 和 unknown_status_ids 四个字段。界面可见 Google Search 标记,但是否实际发起搜索未独立核验;费用、耗时和稳定性也未测量。

来源与下一步
请先核对 Google 的Gemini API 定价和3.8 Flash 模型文档。跨过 2027 年 1 月 1 日时,把标准 token 与缓存费率按 2 倍预算,再用真实日志复核。
常见问题
2026 年底前 Gemini 3.8 Flash API 怎么收费?
标准付费层输入为每百万 token 0.75 美元,输出为 3.75 美元且已包含 thinking。缓存读取为 0.075 美元,缓存存储为每百万 token 每小时 0.50 美元。
thinking token 要不要再次收费?
不要。Google 把 thinking token 计入输出价格,估算时只把它们加进总输出 token 一次。
2027 年价格会怎样?
2027 年 1 月 1 日起,标准输入、输出、缓存读取和存储价格分别变为 1.50、7.50、0.15 和 1.00 美元。
Batch 和 Flex 能叠加折扣吗?
不能。它们是不同的请求模式,必须选择一种并使用对应费率。
Gemini 订阅或 Tabbit 费用能代替 API 费用吗?
不能。消费者订阅、Gemini Developer API 账户和 Tabbit 条款分别计费。
失败重试怎样纳入预算?
先算一次成功任务成本,再乘预计尝试次数,并另加工具费和缓存存储费。失败请求消耗的 token 也可能计费。