官方 dense 检查点
Qwen 模型卡的仓库名是 Qwen/Qwen3.8-27B,列出 27B 参数、视觉编码器、Apache-2.0 许可和原生 262144 token 上下文。
Qwen3.8-27B · SillyTavern 实用指南
这个名称确实存在,但很容易和别的模型混在一起。Qwen 发布了官方 Qwen3.8-27B dense 视觉语言检查点。Qwen3.8-Max 是另一位成员,总参数 2.4T、激活参数 95B。先确认手里的检查点和提供商,再调 RP 预设。
本指南把上游事实和社区反馈分开,不承诺特定提供商、量化文件或每个 Tabbit 账号都能使用。

先核对名称
搜索结果会把几个名称放在一起。它们指向不同文件,复制一个名字就可能把本地配置带到错误的路径。
Qwen 模型卡的仓库名是 Qwen/Qwen3.8-27B,列出 27B 参数、视觉编码器、Apache-2.0 许可和原生 262144 token 上下文。
Qwen 发布说明及相关开源命名把 Qwen3.8-Max 写成总参数 2.4T、激活参数 95B。其开源权重名为 Qwen3.8-2.4T-A95B,不是 27B 别名。
GGUF、FP8、GPTQ 和 RP 微调可能会增加后缀或作者名。每个仓库都是独立产物,要阅读量化格式和模板说明。
SillyTavern 需要提供商实际暴露的准确模型 ID。友好的显示名称不能证明路由提供 Qwen3.8-27B。
模型卡
用这些事实选择运行时。它们描述的是上游检查点,不是所有量化文件的显存消耗。
模型卡把 dense 语言模型列为 27B 参数,同时显示 safetensors 模型大小标签为 28B。不要把下载标签当成新的模型名称。
模型卡标为 image-text-to-text,并说明支持图像和视频理解。后端仍需具备对应处理器和多模态支持。
原生上下文是 262144 token,并可在模型卡描述中扩展到 1M。长上下文不代表消费级显卡能装下所有配置。
模型卡给出 Transformers、vLLM、SGLang、TokenSpeed 和 Docker 示例。请选择明确支持该架构的当前版本。

SillyTavern 设置
角色卡无法修复错误路由或重复套用的模板。无论使用托管 API 还是本地服务,都按这个顺序检查。
提供商标签、社区预设和量化仓库不属于上游模型卡。引用时要把说法和来源绑定。
复制准确的仓库名或提供商模型 ID。确认你拿到的是 Qwen/Qwen3.8-27B、量化衍生文件,还是另一个 Qwen3.8-2.4T-A95B 家族成员。
本地运行时确认 Transformers、vLLM、SGLang、llama.cpp 或所用应用支持该检查点和视觉路径。GGUF 文件不一定暴露全部多模态能力。
OpenAI 兼容服务选择 Chat Completions,填写文档规定的 Base URL,并复制服务返回的 model ID。Key 不要放进角色卡。
让托管路由负责序列化,或者使用本地 tokenizer 的文档模板。两边都套会造成角色错位、标签泄漏或回复过短。
如果提供商暴露了这些控制项,用同一张角色卡依次测试关闭或 low、medium、xhigh。先记录延迟和剧情推进,再改文风预设。
快速诊断
固定角色卡和开场消息,一次只改一个输入,并把返回的 model ID 和测试记录放在一起。
| 现象 | 先检查 | 小修复 |
|---|---|---|
| 找不到模型或静默回退 | 提供商模型列表和响应中的 model | 复制实际暴露的 ID,删除猜出的 qwen3.8-27b 别名。 |
| 角色、标签或格式异常 | 聊天模板由谁负责 | 只保留一条模板路径,然后新建对话。 |
| 显存不足 | 权重格式、上下文和视觉输入 | 先尝试更小量化、较短上下文和纯文本基线。 |
| 思考很久但剧情推进少 | 思考模式、输出上限和预设长度 | 在同一张角色卡上比较 low/medium 与 xhigh。 |
| 不同提供商文风不同 | 过滤、采样默认值和系统提示词 | 把路由记录为变量,不要把单一提供商结果当成模型事实。 |
RP 测试卡
排错时使用短提示词,模板、思考和提供商差异会更容易看出来。
Role: 你是[角色]。 Scene: [地点、关系、当前冲突]。 Style: [视角、语言、句长]。 Direction: 每轮推进一个可观察动作。不要替用户说话。 Continuity: 只使用已确认事实;不确定时提问。 Format: 先动作,再对话。250 到 450 字。不复述。 Check: 保持语气、边界和上一轮未解决的线索。
发送同一张角色卡三次,比较延迟、意外标签、格式遵循和场景是否变化。之后再调整温度、上下文或社区预设。
浏览器路径
SillyTavern 仍然适合角色卡和世界书。Tabbit 处理的是另一种难题:阅读模型卡、比较提供商说明和对照资料时,不必反复复制粘贴。
把 Hugging Face 模型卡、提供商文档或角色 wiki 留在标签页里,配置时随时可以回看。
打开 Tabbit 模型选择器,只有当你的版本和账号出现准确的 Qwen3.8-27B 选项时才选择它。选择器才是 Tabbit 可用性的来源。
用 @ 把网页、截图或文件带进问题。可以让另一个模型提取模板要求,或把量化说明和模型卡放在一起比较。
多模型对话可以让多个模型阅读同一份资料。截图证明的是浏览器工作流,不代表每个用户都能获得相同模型。

浏览器路径


选择工作面
它们负责 RP 工作流的不同部分。需要细粒度控制时保留专用工具,资料成为瓶颈时使用浏览器。
| 需求 | SillyTavern | Tabbit |
|---|---|---|
| 角色卡和世界书 | 专门的 RP 控件 | 引用网页和文件 |
| 预设和提示词顺序 | 细粒度提示词控制 | 系统提示词和 Skills |
| 边看文档边 RP | 扩展或复制粘贴 | 打开的标签页成为上下文 |
| 比较模型回答 | 提供商设置或扩展 | 浏览器内多模型对话 |
| 第一步 | 确认 ID、后端和模板 | 打开来源,再查看实时选择器 |
打开证据
下面的链接把上游规格和解释 SillyTavern 排错缘由的社区反馈分开。
常见问题
是。Qwen/Qwen3.8-27B 有官方 Hugging Face 模型卡,是 27B dense 视觉语言检查点。它与 Qwen3.8-Max 和 Qwen3.8-2.4T-A95B 分开。
不等于。Qwen3.8-Max 被描述为总参数 2.4T、激活参数 95B。想测试 27B dense 模型时,不要填写 Max 的提供商 ID,也不要下载 2.4T 量化文件。
没有脱离显卡、内存、上下文目标和后端的统一答案。先选择明确写出格式和加载器支持的仓库,把 GGUF、FP8、GPTQ 和微调名称视为不同产物。
托管提供商通常负责序列化。本地服务应使用 tokenizer 或检查点文档的模板。不要在已经格式化的端点上再次套 Qwen 模板。
分别检查思考模式、输出上限、上下文大小、采样默认值和提供商路由。社区反馈并不统一,先用相同角色卡记录路由,再改提示词。
只有当 Tabbit 模型选择器显示准确的模型时才选择它。可用性会随版本、地区、账号和发布进度变化。即使没有该模型,也可以用 Tabbit 把模型卡或角色资料放在支持的对话旁边。
安装 macOS 或 Windows 版 Tabbit,查看实时模型选择器,把模型卡或角色 wiki 带进同一个浏览器对话。
模型访问和提供商条款会因版本与发布进度变化。