Qwen3.8-27B · SillyTavern 实用指南

在 SillyTavern 中使用 Qwen3.8-27B

这个名称确实存在,但很容易和别的模型混在一起。Qwen 发布了官方 Qwen3.8-27B dense 视觉语言检查点。Qwen3.8-Max 是另一位成员,总参数 2.4T、激活参数 95B。先确认手里的检查点和提供商,再调 RP 预设。

核对模型身份

本指南把上游事实和社区反馈分开,不承诺特定提供商、量化文件或每个 Tabbit 账号都能使用。

Tabbit 新标签页显示模型选择器和 @ 引用输入框

先核对名称

27B 不是 2.4T 模型

搜索结果会把几个名称放在一起。它们指向不同文件,复制一个名字就可能把本地配置带到错误的路径。

01

官方 dense 检查点

Qwen 模型卡的仓库名是 Qwen/Qwen3.8-27B,列出 27B 参数、视觉编码器、Apache-2.0 许可和原生 262144 token 上下文。

02

Qwen3.8-Max 家族

Qwen 发布说明及相关开源命名把 Qwen3.8-Max 写成总参数 2.4T、激活参数 95B。其开源权重名为 Qwen3.8-2.4T-A95B,不是 27B 别名。

03

社区文件

GGUF、FP8、GPTQ 和 RP 微调可能会增加后缀或作者名。每个仓库都是独立产物,要阅读量化格式和模板说明。

04

托管 ID

SillyTavern 需要提供商实际暴露的准确模型 ID。友好的显示名称不能证明路由提供 Qwen3.8-27B。

模型卡

官方 27B 页面真正写了什么

用这些事实选择运行时。它们描述的是上游检查点,不是所有量化文件的显存消耗。

27B 参数

模型卡把 dense 语言模型列为 27B 参数,同时显示 safetensors 模型大小标签为 28B。不要把下载标签当成新的模型名称。

图像与视频

模型卡标为 image-text-to-text,并说明支持图像和视频理解。后端仍需具备对应处理器和多模态支持。

262K 上下文

原生上下文是 262144 token,并可在模型卡描述中扩展到 1M。长上下文不代表消费级显卡能装下所有配置。

服务方式

模型卡给出 Transformers、vLLM、SGLang、TokenSpeed 和 Docker 示例。请选择明确支持该架构的当前版本。

Tabbit Deep Research 页面展示 Google 结果和核对模型文档的执行步骤

SillyTavern 设置

从端点向内排查

角色卡无法修复错误路由或重复套用的模板。无论使用托管 API 还是本地服务,都按这个顺序检查。

提供商标签、社区预设和量化仓库不属于上游模型卡。引用时要把说法和来源绑定。

  1. 1. 写清产物名称

    复制准确的仓库名或提供商模型 ID。确认你拿到的是 Qwen/Qwen3.8-27B、量化衍生文件,还是另一个 Qwen3.8-2.4T-A95B 家族成员。

  2. 2. 核对后端

    本地运行时确认 Transformers、vLLM、SGLang、llama.cpp 或所用应用支持该检查点和视觉路径。GGUF 文件不一定暴露全部多模态能力。

  3. 3. 连接 SillyTavern

    OpenAI 兼容服务选择 Chat Completions,填写文档规定的 Base URL,并复制服务返回的 model ID。Key 不要放进角色卡。

  4. 4. 模板只交给一处

    让托管路由负责序列化,或者使用本地 tokenizer 的文档模板。两边都套会造成角色错位、标签泄漏或回复过短。

  5. 5. 对比思考档位

    如果提供商暴露了这些控制项,用同一张角色卡依次测试关闭或 low、medium、xhigh。先记录延迟和剧情推进,再改文风预设。

快速诊断

先修复最普通的故障

固定角色卡和开场消息,一次只改一个输入,并把返回的 model ID 和测试记录放在一起。

现象先检查小修复
找不到模型或静默回退提供商模型列表和响应中的 model复制实际暴露的 ID,删除猜出的 qwen3.8-27b 别名。
角色、标签或格式异常聊天模板由谁负责只保留一条模板路径,然后新建对话。
显存不足权重格式、上下文和视觉输入先尝试更小量化、较短上下文和纯文本基线。
思考很久但剧情推进少思考模式、输出上限和预设长度在同一张角色卡上比较 low/medium 与 xhigh。
不同提供商文风不同过滤、采样默认值和系统提示词把路由记录为变量,不要把单一提供商结果当成模型事实。

RP 测试卡

给模型一份短契约

排错时使用短提示词,模板、思考和提供商差异会更容易看出来。

Role: 你是[角色]。
Scene: [地点、关系、当前冲突]。
Style: [视角、语言、句长]。
Direction: 每轮推进一个可观察动作。不要替用户说话。
Continuity: 只使用已确认事实;不确定时提问。
Format: 先动作,再对话。250 到 450 字。不复述。
Check: 保持语气、边界和上一轮未解决的线索。

发送同一张角色卡三次,比较延迟、意外标签、格式遵循和场景是否变化。之后再调整温度、上下文或社区预设。

浏览器路径

让模型文档和世界观处于同一工作区

SillyTavern 仍然适合角色卡和世界书。Tabbit 处理的是另一种难题:阅读模型卡、比较提供商说明和对照资料时,不必反复复制粘贴。

  1. 1

    打开来源页

    把 Hugging Face 模型卡、提供商文档或角色 wiki 留在标签页里,配置时随时可以回看。

  2. 2

    查看实时选择器

    打开 Tabbit 模型选择器,只有当你的版本和账号出现准确的 Qwen3.8-27B 选项时才选择它。选择器才是 Tabbit 可用性的来源。

  3. 3

    用 @ 引用

    用 @ 把网页、截图或文件带进问题。可以让另一个模型提取模板要求,或把量化说明和模型卡放在一起比较。

  4. 4

    对照回答

    多模型对话可以让多个模型阅读同一份资料。截图证明的是浏览器工作流,不代表每个用户都能获得相同模型。

Tabbit 页面总结侧边栏让参考文章与 AI 笔记同时可见

浏览器路径

对照回答

Tabbit 页面总结侧边栏让参考文章与 AI 笔记同时可见Tabbit Deep Research 页面展示 Google 结果和核对模型文档的执行步骤

选择工作面

SillyTavern 还是 Tabbit?

它们负责 RP 工作流的不同部分。需要细粒度控制时保留专用工具,资料成为瓶颈时使用浏览器。

需求SillyTavernTabbit
角色卡和世界书专门的 RP 控件引用网页和文件
预设和提示词顺序细粒度提示词控制系统提示词和 Skills
边看文档边 RP扩展或复制粘贴打开的标签页成为上下文
比较模型回答提供商设置或扩展浏览器内多模型对话
第一步确认 ID、后端和模板打开来源,再查看实时选择器

常见问题

Qwen3.8-27B SillyTavern 问答

Qwen3.8-27B 是官方模型吗?+

是。Qwen/Qwen3.8-27B 有官方 Hugging Face 模型卡,是 27B dense 视觉语言检查点。它与 Qwen3.8-Max 和 Qwen3.8-2.4T-A95B 分开。

27B 等于 Qwen3.8-Max 吗?+

不等于。Qwen3.8-Max 被描述为总参数 2.4T、激活参数 95B。想测试 27B dense 模型时,不要填写 Max 的提供商 ID,也不要下载 2.4T 量化文件。

应该下载哪个量化?+

没有脱离显卡、内存、上下文目标和后端的统一答案。先选择明确写出格式和加载器支持的仓库,把 GGUF、FP8、GPTQ 和微调名称视为不同产物。

SillyTavern 使用哪个聊天模板?+

托管提供商通常负责序列化。本地服务应使用 tokenizer 或检查点文档的模板。不要在已经格式化的端点上再次套 Qwen 模板。

为什么 RP 很慢或回复太短?+

分别检查思考模式、输出上限、上下文大小、采样默认值和提供商路由。社区反馈并不统一,先用相同角色卡记录路由,再改提示词。

Tabbit 能运行 Qwen3.8-27B 吗?+

只有当 Tabbit 模型选择器显示准确的模型时才选择它。可用性会随版本、地区、账号和发布进度变化。即使没有该模型,也可以用 Tabbit 把模型卡或角色资料放在支持的对话旁边。

把参考资料留在手边

安装 macOS 或 Windows 版 Tabbit,查看实时模型选择器,把模型卡或角色 wiki 带进同一个浏览器对话。

模型访问和提供商条款会因版本与发布进度变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。