GEMINI 2.5 FLASH-LITE × 角色扮演

让剧情往前走,不要原地复述

Gemini 2.5 Flash-Lite 速度快、成本低,但角色扮演效果取决于每一轮发送的提示。用户反馈里常见人设漂移、复述用户动作和创意不稳定。先写清楚规则,再一次只改一个设置。

查看测试流程
Tabbit 桌面模型选择器,聊天输入框旁显示 Gemini 模型选项。

角色扮演的难点

上下文很大,也救不了混乱的提示

百万 token 输入上限可以容纳更多 lore,但不代表每个早期细节都同样容易取回。社区有人觉得 Flash 的长对话自然稳定,也有人遇到改写用户动作和文风变平的问题。这些都是个人体验,不是基准测试。

01

人设会滑走

角色刚开始有清晰节奏,长场景后却回到泛化叙述。

02

你的动作被复述

回复重复上一轮,而不是带来后果或新的可选行动。

03

Lore 越多,焦点可能越少

超长角色卡会压住当前场景。把长期设定和本轮状态分开。

Google 官方资料

先了解模型,再调整它

Google 将 Gemini 2.5 Flash-Lite 列为适合高频轻量任务的稳定多模态模型。它接受文本、图片、视频、音频和 PDF,输出文本。官方上限是边界,不等于完美记忆。

01

使用稳定 ID

使用 `gemini-2.5-flash-lite`。Google 已将 `gemini-2.5-flash-lite-preview-09-2025` 列为关闭。

02

上下文和输出

输入上限为 1,048,576 tokens,输出上限为 65,536 tokens。配额仍取决于项目和使用层级。

03

支持 thinking

Google 列出 thinking、缓存、函数调用、结构化输出、URL context、Search grounding、代码执行和文件搜索。

04

安全反馈也是结果的一部分

被拦截或空回复可能来自安全反馈或格式问题。遵守 provider 规则并检查 finish 详情。

可控的 RP 流程

先调规则,再调采样

用同一段短场景比较变化。记录模型、提示版本、上下文大小、输出长度和一条质量备注。这样比同时改五项设置更容易找到原因。

01

写场景契约

说明模型控制谁、必须推进什么、哪些内容留给用户。加入:“不要复述用户动作,结尾留下用户可以接住的开口。”

02

分开状态与 lore

用短状态块记录地点、关系、未解决动作和语气。长期设定放在只在相关时触发的 lore 条目里。

03

设定输出目标

指定符合自己回合的范围,例如两到四段。回复太短时先提高输出上限,再考虑 temperature。

04

一次改一个变量

先测试 temperature 或 top-p,不要同时改。保持角色卡和用户回合一致,比较两三次生成。

05

检查失败原因

复读时缩短指令并删除重复例子。漂移时加入一条具体 canon 提醒。被拦截时查看安全反馈,改写无害措辞。

不要使用 jailbreak 或绕过过滤器。这样更难排错,也可能违反 provider 规则。

排错表

长对话的快速诊断

最有用的线索通常来自请求和响应状态,而不是论坛里又一个新预设。

现象先试什么再检查什么
复述或改写我的回合加入不要复述规则,删掉重复示例。只改角色卡一处,再比较同一提示。
人设漂移用短场景状态块加一条语气提示。确认旧 lore 是否挤占了当前回合。
回复太短提高输出上限,或指定段落范围。之后再测 temperature,不要同时改 top-p。
429 RESOURCE_EXHAUSTED等待、降低频率,减少上下文或输出。查看项目 RPM、TPM、RPD。同一项目换 Key 可能无效。
空回复或被拦截用短小无害提示并查看 finish 和安全详情。先测试格式和 streaming,再重写整张卡。

TABBIT 的位置

把设定资料放在对话旁边

Tabbit 给角色扮演资料一个浏览器工作区。把世界观 wiki、参考图片和场景大纲留在标签页里,再让浏览器原生模型做总结或连续性检查。当前国际版 picker 快照列出了 Gemini 2.5 Flash-Lite,但可用性和配额会变化。

  1. 1

    打开参考标签

    保留 lore wiki、角色表或 PDF。比较提示时,资料仍在手边。

  2. 2

    用 @ 补充上下文

    用 @ 引用打开的页面、截图或本地文件,让模型整理简短连续性清单,不必粘贴整篇 wiki。

  3. 3

    选择实际显示的模型

    当前生产快照的国际版目录列出 Gemini 2.5 Flash-Lite。如果你的 picker 不同,使用实际列出的模型并查看限额。Tabbit 不接收你的 SillyTavern provider Key。

Tabbit Agent 模式旁显示 Google Sheets、指令和执行步骤。

Google 官方资料

上下文和输出

输入上限为 1,048,576 tokens,输出上限为 65,536 tokens。配额仍取决于项目和使用层级。

Tabbit 桌面浏览器中的模型选择器。Tabbit Agent 模式旁显示 Google Sheets、指令和执行步骤。

常见问题

Gemini 2.5 Flash-Lite 角色扮演问答

Gemini 2.5 Flash-Lite 适合角色扮演吗?+

它可以是快速、低成本的选项。社区体验不一致,有人觉得文风稳定,也有人遇到复读或变平。先用固定提示测试。

该填写哪个模型 ID?+

使用 `gemini-2.5-flash-lite`。Google 已将 `gemini-2.5-flash-lite-preview-09-2025` 预览版列为关闭。

一百万 tokens 代表完美记忆吗?+

不代表。这是官方记录的输入上限。用滚动场景状态块仍有助于让当前事实保持可见。

temperature 和 top-p 要一起改吗?+

不要。比较时固定一个变量。先稳定提示和输出目标,再单独改 temperature 或 top-p。

为什么它复述我的动作?+

社区用户确实报告过改写和复述。加入不要复述规则,删掉重复例子,改一项后比较同一回合。

可以绕过安全拦截吗?+

不要绕过安全系统。查看 finish 和安全反馈,保持请求无害,必要时调整场景措辞。

Tabbit 支持这个模型吗?+

当前国际版生产模型快照将 Gemini 2.5 Flash-Lite 列为 picker 中已启用的模型。账号或版本可能不同,页面不承诺无限访问或 SillyTavern provider 注入。

Tabbit 能替代 SillyTavern 吗?+

不能。SillyTavern 仍适合角色卡和 provider 专属 RP 控制。Tabbit 用来把网页、文件和模型上下文放在一起。

先测试场景,再把资料放近

使用准确模型 ID,一次只改一个设置,并把安全反馈纳入排错。下一回合需要 wiki、截图或文件时,打开 Tabbit。

支持 macOS 和 Windows。模型可用性与限额可能变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。