GEMINI 2.5 FLASH-LITE × SILLYTAVERN

先填对模型 ID

SillyTavern 可以通过 Google AI Studio 连接 Gemini 2.5 Flash-Lite。真正容易出错的地方往往更小:provider、准确模型名、Key、每轮发送的上下文,以及 429 或空回复到底代表什么。

查看接入步骤
Tabbit 桌面浏览器展示带聊天入口的简洁新标签页工作区。

先核对模型

稳定、快速,也很容易配错

Google 将 Gemini 2.5 Flash-Lite 列为适合高频轻量多模态任务的稳定模型。它接受文本、图片、视频、音频和 PDF 输入,并输出文本。上下文上限很大,不代表 provider 或配额检查会消失。

01

使用准确 ID

填写 gemini-2.5-flash-lite。预览别名 gemini-2.5-flash-lite-preview-09-2025 已关闭。不要因为名称相似就换成更新的 Flash 模型。

02

先看限额

官方记录的输入上限是 1,048,576 tokens,输出上限是 65,536 tokens。实际 RPM、TPM、RPD 取决于 Google 项目和使用层级。

03

支持 thinking

模型支持 thinking、函数调用、结构化输出、URL context、Search grounding、代码执行、缓存和文件搜索。计费时 thinking tokens 计入输出用量。

04

免费不等于无限

Google AI Studio 免费层提供有限模型访问和免费输入输出 tokens。付费层提供更高限额。高频角色扮演前先查看 AI Studio 实时配额。

SILLYTAVERN 接入

先跑通一条干净请求,再调预设

SillyTavern 官方 Google 指南使用 Chat Completion。先在 Google AI Studio 创建 Key,再让 SillyTavern 获取模型列表。第一轮保持请求短小,这样才能分清 Key 错误、配额问题和格式问题。

01

在 Google AI Studio 创建 Key

打开 API key 页面并登录,选择 Get API Key,接受条款,创建 Key 后复制。把 Key 当作密码,不要放进角色卡或公开截图。

02

选择对应 provider

在 SillyTavern 打开 API Connections,选择 Chat Completion,再选择 Google AI Studio。把 Key 粘贴到 API Key 输入框并点击 Connect。

03

选择稳定模型

如果模型列表里出现 gemini-2.5-flash-lite,就选择它。手动输入时使用准确稳定 ID。预览 ID 已关闭,调 temperature 无法修复。

04

用短提示开始

用精简角色卡发送一条短消息。测试时保持 streaming 开关一致,记录模型、provider、上下文大小和回复状态。

05

最后再加角色格式

普通请求成功后,再加入 system prompt、指令格式和 lore。如果控制标记出现在回复中,先检查 template 和消息格式。

Google 限额按 RPM、TPM、RPD 衡量,并应用于项目,而不只是 API Key。预览模型的限制可能更严格。

TABBIT 的位置

让网页资料留在 RP 聊天旁边

Tabbit 不是 SillyTavern 前端、本地 Gemma runner,也不是 Google AI Studio Key 管理器。它适合处理角色 wiki、设定资料、PDF、截图和模型比较等聊天周边上下文。

  1. 1

    打开资料页

    把 canon 笔记、设定 wiki 或文档页面留在可见标签页。Tabbit 可以在侧边栏总结页面。

  2. 2

    用 @ 引用上下文

    用 @ 把打开的页面、截图或本地文件加入提示,让模型检查连续性或整理场景状态,不必复制每一段。

  3. 3

    只使用实际列出的模型

    当前国际版生产快照列出并启用 gemini-2.5-flash-lite,但账号、edition、配额和未来部署可能不同,请以 SillyTavern 实时模型选择器为准。Tabbit 仍不接受 SillyTavern provider 或 Google AI Studio API Key,也不能替代 SillyTavern 的这条连接。

Tabbit Agent 模式操作 Google Sheets,右侧显示指令面板和执行步骤。

选对工作面

API 控制与浏览器上下文解决不同问题

需要角色卡、消息格式和生成设置时使用 SillyTavern。资料散落在网页和文件中,需要放在浏览器原生助手旁时使用 Tabbit。

需求SillyTavern + Google AI StudioTabbit
Gemini 2.5 Flash-Lite endpoint使用准确模型 ID 连接,并以实时选择器为准不是 Tabbit 连接,请留在 SillyTavern
API Key 与配额在 Google AI Studio 管理没有粘贴此 Key 的入口
角色卡和 lore完整 RP 控制引用 wiki 或文件
网页上下文粘贴或自行集成@ 打开的标签、截图和文件
Agent 操作取决于你的 ST 配置浏览器原生 Agent 模式

官方来源

免费不等于无限

Google AI Studio 免费层提供有限模型访问和免费输入输出 tokens。付费层提供更高限额。高频角色扮演前先查看 AI Studio 实时配额。

Tabbit 新标签页工作区,显示提示输入框和模型选择器。

常见问题

Gemini 2.5 Flash-Lite 与 SillyTavern

该填写哪个模型 ID?+

稳定模型使用 gemini-2.5-flash-lite。Google 将 gemini-2.5-flash-lite-preview-09-2025 列为已关闭,不要再使用这个预览 ID。

Key 放在 SillyTavern 哪里?+

打开 API Connections,选择 Chat Completion,选择 Google AI Studio,粘贴 API Key 并连接。SillyTavern 官方指南记录了这条路径。

429 RESOURCE_EXHAUSTED 是什么?+

它表示超出了速率或支出限额。在 AI Studio 查看项目的 RPM、TPM、RPD 使用情况,然后等待、降低请求频率或减少上下文和输出。同一项目中新建 Key 不一定改变配额。

为什么回复是空的?+

检查 SillyTavern 控制台和响应详情,再用短提示、稳定模型 ID 测试,并尝试关闭 streaming。如果请求成功但文本为空,检查格式、安全反馈和 finish 详情,再考虑角色卡。

它有百万 token 上下文吗?+

Google 记录的输入上限是 1,048,576 tokens,最大输出是 65,536 tokens。这是上限,不保证角色对话能同样取回开头的每个细节。

可以在 SillyTavern 打开 thinking 吗?+

Google 将 thinking 列为支持能力。SillyTavern 是否暴露开关取决于当前 connector 和设置。界面没有该项时不要自行编造参数,先使用 provider 默认值。

Gemini 2.5 Flash-Lite 免费吗?+

Google AI Studio 有免费层,提供有限模型访问和免费输入输出 tokens。配额因项目和层级而异。付费、批量和优先级价格以 Google 实时价格页为准。

Tabbit 能运行我的 SillyTavern 连接吗?+

不能。Tabbit 当前不接受 SillyTavern provider 连接,也不接收你的 Google AI Studio Key。用 Tabbit 处理浏览器上下文和其实际列出的模型,把这个 Gemini 连接留在 SillyTavern。

把 Key 放在正确的地方

用 SillyTavern 连接 Gemini API。需要处理聊天周边的网页、文件和浏览器动作时,再使用 Tabbit。

支持 macOS 和 Windows。Tabbit 的模型列表与 provider 支持可能变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。