Tabbit博客

Gemini 3.6 Flash:变化、价格,以及为什么验证比榜单更重要

Gemini 3.6 Flash 提供 100 万 token 上下文、更少的输出 token 和多模态工具,但配额、验证与版本迁移仍决定实际价值。

本文目录
  1. 快速判断
  2. 规格一览
  3. 从 3.5 到 3.6,3.7 又意味着什么
  4. 官方结果必须连同口径阅读
  5. 独立与社区反馈
  6. 价格、配额和风险
  7. 场景自检与 Tabbit 边界
  8. 结论
  9. 来源

Gemini 3.6 Flash 适合做多模态代码、文档和边界清晰的 Agent 试点。它的价值不只在 benchmark:Google 称它比 3.5 Flash 使用更少输出 token,而社区反馈说明,只有在结果容易复核时,这种节省才会变成实际收益。

本文的时间锚点是 Google 2026 年 7 月 21 日发布,以及 9 月 20 日重新核对的模型卡:gemini-3.6-flash、输入 1,048,576 token、输出 65,536 token、文本/图片/视频/音频/PDF 输入,以及输入/输出每百万 1.50/7.50 美元的付费 Standard 行。3.7 和 3.8 是相邻路线,不是自动替代。先看 Gemini 3.6 模型页,再确认实际客户端与账户。

快速判断

  • 需要多模态输入、快速 Agent 循环和较低输出账单时可试用 3.6。

  • “少 17% 输出 token”是有日期的对比,不是每个任务都省钱的保证。

  • Google 列出幻觉、偶发超时和知识截点,因此必须独立验证。

  • Gemini API、AI Studio/Antigravity、企业条款和 Tabbit 配额要分开看。

  • 允许写入的 Agent 必须同时给出 diff、测试结果和停止条件。

规格一览

项目2026-09-20 核对内容实际边界
模型 ID稳定版 gemini-3.6-flash仍应检查选择器和请求中的精确 ID。
输入输出文本、图片、视频、音频、PDF 输入;文本输出客户端可能只开放其中一部分。
token 上限输入 1,048,576;输出 65,536产品或套餐可能设置更小的有效窗口。
工具缓存、代码执行、计算机使用预览、文件搜索、函数调用、接地、结构化输出、URL 上下文API 支持不等于账户和客户端都开放。
付费价格输入 $1.50 / 输出 $7.50 每百万 token免费层、缓存、工具和重试另算。
知识截点模型卡列出 2026 年 3 月当前事实仍需搜索和引用。

先读 什么是 Agent 浏览器 区分浏览器助手和 API,再看 AI 浏览器比较Tabbit Browser 实践

从 3.5 到 3.6,3.7 又意味着什么

Google 将 3.6 定位为 3.5 Flash 之后的工作模型:代码、知识工作和多模态表现更好,并在引用的 Artificial Analysis 对比中少用 17% 输出 token。发布文还列出 DeepSWE 49% 对 37%、MLE-Bench 63.9% 对 49.7%、OSWorld-Verified 83.0% 对 78.4%、GDPval-AA v2 Elo 1421 对 1349。这些是发布方选择的比较,不能当独立审计。

3.7 和 3.8 改变的是选择,而不是让 3.6 立刻失效。如果 3.6 能以较少循环完成边界明确、容易复核的工作,它的效率有意义;如果任务需要更长自主规划,就应固定任务和验收条件去测试新路线。Agent 深度研究指南可帮助记录努力等级、工具和修正次数。

官方结果必须连同口径阅读

Google 模型卡列出 SWE-Bench Pro 58.7%、DeepSWE 49%、Terminal-Bench 2.1 78.0%、MLE-Bench 63.9%、OSWorld-Verified 83.0%、CharXiv 无工具 85.2%、GDM-MRCR 1M 54.0%。这些行分别测试代码、电脑使用、图表和长上下文,不是一个综合分。1M 行是点测,不代表每个百万 token 请求都便宜或稳定。Google 的发布文还包含 Artificial Analysis 和客户案例,只能作为线索。Gemini promptsGemini reviews应保留来源条件,不复制第三方长提示词。

独立与社区反馈

Promptslove 记录了 24 小时 OpenCode、high thinking、四个任务的比较:前端、浏览器游戏、表单构建和 Instagram 视频分析。作者称表单、CSV 导出、编辑与视频分析可用,但前端缺少要求的滚动指针、数字动画、响应式和视觉精度。这是具体的小样本,不是替代官方 benchmark。

r/google_antigravity 的一篇帖子认为,任务范围清晰、先做 instrument、再按通过/失败判断时,3.6 快而有能力;但最重要的问题是“验证”可能只是看起来合理,另有一次不可逆操作风险。另一位半天用户称循环和 token 更少,但后续功能开发漏跑测试和 Firebase 规则。r/SillyTavernAI 用户在 temperature 1 与指定 preset 下称赞写作,却有回复提到 400 错误、拒答和长上下文重复。这些观察说明监督成本也是价格的一部分。

价格、配额和风险

Google 付费 Standard 行为输入/输出每百万 1.50/7.50 美元,输出包含 thinking token。免费层说明提交内容可能用于改进 Google 产品,付费层则写明不会用于改进;发送敏感资料前必须核对当前区域条款。缓存、Search grounding、其他工具、重试和消费者订阅不能藏在 token 单价里。

AI Studio、Gemini API、Antigravity、Android Studio 与 Gemini Enterprise 可能有不同配额和合同。某个产品中跑得快,不证明 API 或另一个产品也有同样隐私条款。Tabbit 是独立路线;可参考 浏览器自动化设计任务,但不能把 Tabbit 会话转换成 Gemini API 发票。

Google 还列出幻觉、偶发超时、持续加强越狱防护和 2026 年 3 月知识截点。社区补充了漏测、错误验证、配额压力、供应商错误和长会话重复。它们不是失败率,而是验收清单。

场景自检与 Tabbit 边界

小型代码补丁应使用固定仓库、diff 和测试;文档或图表任务要有日期和缺失值字段;电脑使用应在可丢弃页面中记录工具调用;长写作需比较短长续写和重复率;生产 Agent 必须设置预算和人工检查点。

本文没有运行已登录的 Gemini 3.6 Flash Tabbit 任务,也没有捕获 4–8 张合格截图,因此不声称选择器、有效上下文、延迟、配额、订阅或价格。若账户出现该模型,先从公开文档抽取五项事实和链接,人工核验后再重复已知答案。首次不要上传机密资料或授予写入权限。

Tabbit Browser

结论

Gemini 3.6 Flash 是多模态代码和边界清晰 Agent 的可信效率型候选。Google 的结果支持 token 效率和相对 3.5 的多项提升,但独立与社区反馈提醒:监督、配额和验证可能吃掉账面节省。用固定任务试点;只有新能力或更长自主性足以抵消路线和复核成本时,才迁移 3.7 或 3.8。高影响任务保留备用模型。

来源

常见问题

Gemini 3.6 Flash 是什么?

Gemini 3.6 Flash 是 Google 面向代码、知识工作和 Agent 的稳定多模态 Flash 模型。Google 列出文本、图片、视频、音频和 PDF 输入,输入上限 1,048,576 token,输出上限 65,536 token。

它相比 Gemini 3.5 Flash 改变了什么?

Google 引用的 Artificial Analysis 对比显示输出 token 少 17%,同时代码、知识工作和多模态表现提升。这是有日期和口径的供应商数据,不等于每项任务成本都下降。

Gemini 3.6 Flash 多少钱?

2026 年 9 月 20 日查看的 Google 付费 Standard 价格是输入每百万 token 1.50 美元、输出 7.50 美元。免费层数据使用条款不同,工具和重试也可能增加费用。

它适合代码 Agent 吗?

Google 模型卡列出 SWE-Bench Pro 58.7%、Terminal-Bench 2.1 78.0% 和 OSWorld-Verified 83.0%。独立与社区反馈更支持边界清晰、有人复核的任务。

Gemini 3.6 Flash 有哪些限制?

Google 列出幻觉、偶发变慢或超时、持续加强的越狱防护,以及 2026 年 3 月知识截点。社区还提到配额、漏测和长上下文重复。

能在 Tabbit 使用 Gemini 3.6 Flash 吗?

本文没有执行已登录的 Gemini 3.6 Flash Tabbit 任务。请检查实时选择器和账户条款,不要从 Gemini API 推断 Tabbit 的可用性、延迟、配额或账单。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。