QWEN 3.8 + SILLYTAVERN

Qwen 3.8 SillyTavern 设置

回复循环、想太久、忘记角色事实,或生成到一半停住时,采样器只是一个可能原因。先查连接和聊天模板,再一次只改一个变量,用同一段短测试复测。

跳到排错流程

下面的数值是文档给出的起点,不是适用于所有卡片的最佳预设。provider、后端、量化、角色卡和上下文预算都会改变 Qwen3.8-27B 的表现。

Tabbit 新标签页输入框,显示 @ 引用入口和模型选择器。

先看失败症状

症状指向某一层,不会自动告诉你一个神奇数字

同样难看的回复,可能来自错误端点、不匹配的模板、过小的上下文窗口,或过度限制的采样器组合。先记录改过什么,再找预设。

01

一直在思考

先看是否开启 thinking、推理预算是否够,以及 provider 是否保留 thinking block。较低的 reasoning effort 每轮可能更快,但长任务也可能增加重试。

02

忘记角色卡

检查上下文边界和 response 分配。SillyTavern 会把角色资料、系统提示和聊天历史放进 context,旧消息可能只是已经被排除。

03

循环或变平

一起检查 repetition penalty、DRY、top-p、top-k 和 min-p。Qwen 为其中几项列了中性值。一次改一个控制项。

04

标签格式坏了

检查模型 ID、聊天模板、思考标签处理和提示后处理。采样器修不好发给另一个模型家族的请求格式。

排错顺序

Provider → 模板 → context → sampler → 复测

准备一段可重复的短角色对话。保持角色卡、提示词、可用 seed 和输出长度不变,逐层检查。

  1. 1

    连接和 provider

    确认 provider 真正提供 Qwen3.8-27B,复制准确的模型 ID,然后发送 Test Message。Custom OpenAI-compatible endpoint 还要检查 base URL 和是否提供 /v1/models。

  2. 2

    聊天模板和 thinking

    使用 Qwen3.8 对应的模板。官方模型卡默认开启 thinking。要直接回答,就通过 provider 支持的字段关闭。是否保留历史 thinking 也要明确选择。

  3. 3

    上下文和响应

    让 context 足够容纳角色卡和近期对话,同时给 response 留空间。上下文参数写得很大,也不代表后端或量化版本真的暴露同样大小。

  4. 4

    采样和复测

    先从下表的官方模式起点开始。每次只改一个设置,对同一段短对话重生几次并记录可见结果,再测试下一个变量。

如果 provider 忽略某字段,界面里的数值不能证明模型收到了它。条件允许时查看请求或响应元数据。

参考表

把官方起点和中性值放在一起

Qwen 分别列出了 Thinking Mode 和 Instruct 或 non-thinking mode 的参数。SillyTavern 文档也说明了关闭多个采样器的中性值。按当前测试模式选择一行。

参数Thinking modeInstruct / non-thinking留意什么
temperature1.00.7低值更可预测,高值变化更多。
top_p0.950.801 表示关闭 nucleus 过滤。
top_k2020按后端不同,0 或 -1 表示关闭。
min_p0.00.0过高可能加重重复。
presence_penalty0.01.5Qwen 说 0 到 2 可减少无休止重复。
repetition_penalty1.01.01 表示关闭效果。
reasoning_effortxhigh不适用Qwen 列出 xhigh、medium、low。
preserve_thinkingtruetrue只想保留最新思考时关闭。

这些是 Qwen 模型卡的起点。不同框架和 provider 支持的采样参数不一样,不能保证每张角色卡都有更好 RP 效果。

看起来像采样问题的边缘情况

视觉、量化和 DRY 都会改变基线

把它们当成独立实验。社区预设可能把真正的变化来源藏起来。

上下文和 response 长度

SillyTavern 将 context 定义为扣除 response 分配后的提示预算。response 越长,生成越慢,也会给角色卡和历史留下更少空间。Qwen3.8-27B 原生支持 262,144 token,但后端、显存和量化可能把实际限制压低。

视觉输入

官方模型卡说明支持图片和视频理解。如果连接器没有按后端要求传递媒体,问题在集成层,不在 temperature。

量化

BF16、FP8 和低比特版本用不同方式换取显存和数值精度。先在相同后端、相同提示、context 和 sampler 下比较,再判断是不是预设问题。

repetition penalty 和 DRY

repetition_penalty 1 是中性值。范围和 slope 过高会惩罚常用词。DRY 针对重复序列,multiplier 0 表示关闭。只有可复现地循环时,才增加一个限制项。

另一条上下文路径

来源在网页里,就在网页旁使用 Qwen

需要角色卡和 lorebook 时,SillyTavern 仍然合适。提示来自网页、PDF、截图或研究过程时,Tabbit 更顺手。打开来源,在模型选择器里选模型,让上下文一直留在眼前。

打开来源

使用 macOS 或 Windows 桌面端,在主视图保留 wiki、提示词指南或文档。

Tabbit 显示 Google 搜索研究页,右侧 Deep Research 任务列出执行步骤。

选择模型

在新标签页输入框或侧边聊天打开 Tabbit 模型选择器。可用列表会随产品变化,不要假设所有本地 Qwen3.8 权重都能用。

Tabbit 主视图打开文章,右侧 AI 摘要栏显示模型控制。

用 @ 引用

输入 @ 引用标签页、截图或文件。资料不离开视线,就能让模型列场景、改写卡片或做对比。

Tabbit 多模型对话显示五列并行回答和共用输入框。

用 @ 引用

输入 @ 引用标签页、截图或文件。资料不离开视线,就能让模型列场景、改写卡片或做对比。

Tabbit Agent 在 Google Sheets 中执行任务,右侧显示指令和步骤。

常见问题

Qwen 3.8 与 SillyTavern 设置

Qwen3.8 官方采样值是什么?+

Thinking Mode 是 temperature 1.0、top_p 0.95、top_k 20、min_p 0.0、presence_penalty 0.0、repetition_penalty 1.0。Instruct 或 non-thinking mode 是 0.7、0.80、20、0.0、1.5、1.0。

应该直接用社区预设吗?+

把它当比较对象,不要当保证。社区片段经常混用模型版本和后端。记录它的字段,再用官方模式起点一次改一个变量。

为什么 Qwen3.8 在 SillyTavern 里一直思考?+

官方模型卡默认开启 thinking。先查连接器的聊天模板字段、思考标签和 provider 支持,再改 sampler。关闭时只使用后端文档写明的字段。

context 应该设多大?+

先给角色卡、系统提示和近期对话留够空间,再预留 response。模型卡写的是原生 262,144 token,实际后端可能更小。

要不要开 repetition penalty 或 DRY?+

先用 repetition_penalty 1 和 DRY multiplier 0。它们分别是中性值或关闭值。只有同一段测试仍然循环时,才加一个控制项。

Tabbit 能运行我本地的 Qwen3.8-27B 吗?+

本页不作这个承诺。Tabbit 提供浏览器模型选择器和上下文工具。请以当前选择器为准,需要本地权重时继续使用 SillyTavern 和本地后端。

保留你能解释的设置

先用官方模式起点,一次改一个变量,并让来源保持可见。任务从网页或文档开始时,在 Tabbit 打开它,走浏览器上下文路径。

支持 macOS 和 Windows。模型可用性会随产品更新变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。