一直在思考
先看是否开启 thinking、推理预算是否够,以及 provider 是否保留 thinking block。较低的 reasoning effort 每轮可能更快,但长任务也可能增加重试。
QWEN 3.8 + SILLYTAVERN
回复循环、想太久、忘记角色事实,或生成到一半停住时,采样器只是一个可能原因。先查连接和聊天模板,再一次只改一个变量,用同一段短测试复测。
下面的数值是文档给出的起点,不是适用于所有卡片的最佳预设。provider、后端、量化、角色卡和上下文预算都会改变 Qwen3.8-27B 的表现。

先看失败症状
同样难看的回复,可能来自错误端点、不匹配的模板、过小的上下文窗口,或过度限制的采样器组合。先记录改过什么,再找预设。
先看是否开启 thinking、推理预算是否够,以及 provider 是否保留 thinking block。较低的 reasoning effort 每轮可能更快,但长任务也可能增加重试。
检查上下文边界和 response 分配。SillyTavern 会把角色资料、系统提示和聊天历史放进 context,旧消息可能只是已经被排除。
一起检查 repetition penalty、DRY、top-p、top-k 和 min-p。Qwen 为其中几项列了中性值。一次改一个控制项。
检查模型 ID、聊天模板、思考标签处理和提示后处理。采样器修不好发给另一个模型家族的请求格式。
排错顺序
准备一段可重复的短角色对话。保持角色卡、提示词、可用 seed 和输出长度不变,逐层检查。
确认 provider 真正提供 Qwen3.8-27B,复制准确的模型 ID,然后发送 Test Message。Custom OpenAI-compatible endpoint 还要检查 base URL 和是否提供 /v1/models。
使用 Qwen3.8 对应的模板。官方模型卡默认开启 thinking。要直接回答,就通过 provider 支持的字段关闭。是否保留历史 thinking 也要明确选择。
让 context 足够容纳角色卡和近期对话,同时给 response 留空间。上下文参数写得很大,也不代表后端或量化版本真的暴露同样大小。
先从下表的官方模式起点开始。每次只改一个设置,对同一段短对话重生几次并记录可见结果,再测试下一个变量。
如果 provider 忽略某字段,界面里的数值不能证明模型收到了它。条件允许时查看请求或响应元数据。
参考表
Qwen 分别列出了 Thinking Mode 和 Instruct 或 non-thinking mode 的参数。SillyTavern 文档也说明了关闭多个采样器的中性值。按当前测试模式选择一行。
| 参数 | Thinking mode | Instruct / non-thinking | 留意什么 |
|---|---|---|---|
| temperature | 1.0 | 0.7 | 低值更可预测,高值变化更多。 |
| top_p | 0.95 | 0.80 | 1 表示关闭 nucleus 过滤。 |
| top_k | 20 | 20 | 按后端不同,0 或 -1 表示关闭。 |
| min_p | 0.0 | 0.0 | 过高可能加重重复。 |
| presence_penalty | 0.0 | 1.5 | Qwen 说 0 到 2 可减少无休止重复。 |
| repetition_penalty | 1.0 | 1.0 | 1 表示关闭效果。 |
| reasoning_effort | xhigh | 不适用 | Qwen 列出 xhigh、medium、low。 |
| preserve_thinking | true | true | 只想保留最新思考时关闭。 |
这些是 Qwen 模型卡的起点。不同框架和 provider 支持的采样参数不一样,不能保证每张角色卡都有更好 RP 效果。
看起来像采样问题的边缘情况
把它们当成独立实验。社区预设可能把真正的变化来源藏起来。
SillyTavern 将 context 定义为扣除 response 分配后的提示预算。response 越长,生成越慢,也会给角色卡和历史留下更少空间。Qwen3.8-27B 原生支持 262,144 token,但后端、显存和量化可能把实际限制压低。
官方模型卡说明支持图片和视频理解。如果连接器没有按后端要求传递媒体,问题在集成层,不在 temperature。
BF16、FP8 和低比特版本用不同方式换取显存和数值精度。先在相同后端、相同提示、context 和 sampler 下比较,再判断是不是预设问题。
repetition_penalty 1 是中性值。范围和 slope 过高会惩罚常用词。DRY 针对重复序列,multiplier 0 表示关闭。只有可复现地循环时,才增加一个限制项。
另一条上下文路径
需要角色卡和 lorebook 时,SillyTavern 仍然合适。提示来自网页、PDF、截图或研究过程时,Tabbit 更顺手。打开来源,在模型选择器里选模型,让上下文一直留在眼前。
使用 macOS 或 Windows 桌面端,在主视图保留 wiki、提示词指南或文档。

在新标签页输入框或侧边聊天打开 Tabbit 模型选择器。可用列表会随产品变化,不要假设所有本地 Qwen3.8 权重都能用。

输入 @ 引用标签页、截图或文件。资料不离开视线,就能让模型列场景、改写卡片或做对比。

输入 @ 引用标签页、截图或文件。资料不离开视线,就能让模型列场景、改写卡片或做对比。

常见问题
Thinking Mode 是 temperature 1.0、top_p 0.95、top_k 20、min_p 0.0、presence_penalty 0.0、repetition_penalty 1.0。Instruct 或 non-thinking mode 是 0.7、0.80、20、0.0、1.5、1.0。
把它当比较对象,不要当保证。社区片段经常混用模型版本和后端。记录它的字段,再用官方模式起点一次改一个变量。
官方模型卡默认开启 thinking。先查连接器的聊天模板字段、思考标签和 provider 支持,再改 sampler。关闭时只使用后端文档写明的字段。
先给角色卡、系统提示和近期对话留够空间,再预留 response。模型卡写的是原生 262,144 token,实际后端可能更小。
先用 repetition_penalty 1 和 DRY multiplier 0。它们分别是中性值或关闭值。只有同一段测试仍然循环时,才加一个控制项。
本页不作这个承诺。Tabbit 提供浏览器模型选择器和上下文工具。请以当前选择器为准,需要本地权重时继续使用 SillyTavern 和本地后端。
先用官方模式起点,一次改一个变量,并让来源保持可见。任务从网页或文档开始时,在 Tabbit 打开它,走浏览器上下文路径。
支持 macOS 和 Windows。模型可用性会随产品更新变化。