MISTRAL 24B PRESET

先弄清 preset 做了哪些假设

Mistral 24B preset 可能包含模型名、作者说明、聊天模板、系统提示词和采样值。只要来源、版本或量化不一致,就可能出现空回复、角色标记泄露、循环,甚至替用户说话。导入前先逐层核对。

打开 3.2 模型卡
Tabbit 浏览器把搜索页面与执行步骤面板并排展示。

先看 MODEL ID

24B 是规模,不是型号名

在改设置前先记下仓库或供应商的完整 slug。这样可以避免把 3.2 模板套到 3.1 文件上,也不会把社区 merge 当成官方 checkpoint。

01

官方 3.2 instruct

`mistralai/Mistral-Small-3.2-24B-Instruct-2506` 是 3.1 的后续小版本更新。官方模型卡提到指令遵循、复读和 function calling 有改进。

02

上一代官方版本

`mistralai/Mistral-Small-3.1-24B-Instruct-2503` 是另一份 2025 年 3 月的 checkpoint。不要从 3.2 推断它的模板或行为。

03

社区 RP 文件

Magistry、Cydonia、Magidonia 等属于微调或 merge。请以各自仓库的模型卡为准,核对许可证、提示格式和采样说明。

04

base、instruct 与量化

base 和 instruct 是不同 checkpoint。GGUF、AWQ 以及 Q4/Q5/Q6 是格式或量化,不是新的官方 Mistral 型号。

清晰的设置路径

先选服务层,再接 SillyTavern

SillyTavern 是聊天前端,模型仍需要本地服务器或供应商接口。根据硬件和隐私需求选择路径。

01

本地 GPU 或 Mac

官方 3.2 模型卡为 BF16/FP16 记录了约 55GB GPU 显存需求。较小的 GGUF 量化会用速度和质量换内存,先看量化发布者的文件大小和上下文限制。

02

vLLM 服务

Mistral 推荐 vLLM 0.9.1 或更新版本,并使用 `mistral_common` 1.6.2 或更新版本。按模型卡使用 Mistral tokenizer、config、load 格式和准确仓库 ID。

03

供应商或 OpenAI 兼容 API

如果供应商提供该 checkpoint,复制准确的 model slug 和 endpoint。只看到“Mistral 24B”这个名称,不能据此决定 SillyTavern 模板。

04

连接 SillyTavern

后端接受 role messages 时使用 Chat Completion。只有后端和模型卡指定文本格式时才用 Text Completion。认真配置 endpoint、API key、模型名和上下文。

角色扮演调参

先修模板,再动采样

模板错了,表现很像模型能力不足。先修格式和上下文,再用一组可重复的短测试调整生成。

01

使用后端的 Mistral 格式

尽量让 tokenizer 或服务栈应用模型 chat template。回复中出现 `<s>`、角色标记或工具 token 时,先停下来修格式。

02

角色卡保持紧凑

分开固定事实、当前目标和临时场景状态。删掉重复 lore 以及要求模型替用户和角色双方写作的冲突指令。

03

记录一组基线

先使用模型卡或微调卡的值。官方 3.2 卡对一般用途建议较低 temperature,例如 0.15;RP 微调可能发布不同的值。

04

停止字符串按型号处理

Llama 或 ChatML 的 stop string 可能截断 Mistral 回复或泄露标记。复制 checkpoint 的准确建议,再测试两轮对话。

社区讨论提到替用户说话、叙述异常、空回复、复读和量化速度慢。这些是症状,不代表所有 Mistral 24B 文件都一样。

症状 → 检查 → 修复

找到真正出问题的那一层

一次只改一个变量,保存结果并重复同一条短提示。最快的修复通常是名称、endpoint 或模板不匹配。

症状检查下一步
空回复或 nullendpoint 状态、model slug、上下文模板和 stop string。先发一条极短消息,再换成后端提供的准确 Mistral 模板。
角色标记出现在正文chat template 到底由 SillyTavern、服务器还是 tokenizer 应用?只保留一个模板负责人,删除重复格式并查看原始 prompt。
模型替用户写话角色卡指令和示例对话。明确用户的主动权,删除冲突示例,用短选择题测试。
复读或循环重复 lore、上下文长度、采样和量化文件。减少提示噪音,回到卡片基线,一次只改一个采样值。
速度很慢或逐渐下降量化类型、GPU offload、RAM/显存压力和上下文长度。把文件需求和硬件对比。部分 CPU offload 可能明显慢于全 GPU。
行为和预期不符base/instruct、3.1/3.2、官方/社区仓库。把完整 ID 写进笔记,再按该仓库的模型卡重新设置。

资料工作区,不是 RUNNER

把模型卡放在聊天旁边

Tabbit 不替代 SillyTavern,也不运行这个本地 checkpoint。本页检查时 Tabbit 公开模型目录没有列出 Mistral。你可以用它收集模型卡、比较量化文件、保存提示词笔记和阅读社区讨论。

  1. 1

    打开官方模型卡和量化页

    把准确 ID、硬件说明和模板指令放在眼前。确认官方 checkpoint 后,再加入社区微调卡。

  2. 2

    用 @ 引用标签和文件

    用 @ 把页面、截图或本地笔记放进提示,让模型生成保留 model ID、标出未知假设的检查清单。

  3. 3

    只比较当前列表

    Tabbit 可以比较自己选择器中实际可用的模型并总结来源差异。列表会变化,安装后请重新确认。

Tabbit Deep Research 页面,在 Google 结果旁显示执行步骤。
Tabbit 模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6;截图中没有 Mistral。
Tabbit 多模型聊天界面展示多个模型对同一提示的回答。
Tabbit 浏览器在来源文章旁显示 AI 摘要面板。

选对工作面

本地 RP 控制,还是浏览器上下文?

两种工具解决不同问题。SillyTavern 负责角色卡、采样和后端,Tabbit 适合跨网页和文件整理资料。

SillyTavern + 后端Tabbit
本地运行 Mistral 24B可以,需兼容服务器不作承诺
角色卡和采样细致控制引用笔记和角色卡
官方与社区资料粘贴或切换应用@ 标签、文件和页面
模型比较切换 endpoint 或 preset比较选择器中的模型
硬件诊断显存、offload、tokens/sec整理证据

常见问题

Mistral 24B 与 SillyTavern 问题

Mistral 24B 是什么?+

它通常指 240 亿参数的 Mistral Small checkpoint,但搜索结果也会用来指 3.1、3.2、量化文件和社区 RP merge。请使用完整仓库 ID。

官方型号该选哪个?+

本页对应的官方页面是 `mistralai/Mistral-Small-3.2-24B-Instruct-2506`,它是 3.1 的小版本更新。请以服务器或供应商实际提供的版本为准。

官方模型能放进一张显卡吗?+

3.1 公告称可运行于单张 RTX 4090 或 32GB Mac;3.2 模型卡记录 BF16/FP16 约需 55GB GPU 显存。量化文件需求不同,必须看实际文件。

该用 Chat Completion 还是 Text Completion?+

跟随后端和模型卡。SillyTavern 文档说明,二者区别在于消息如何组成 prompt,不在于本地还是云端。

为什么会复读或替用户说话?+

按 model ID、chat template、重复角色卡、sampler 的顺序检查。社区报告有这些症状,但前端不匹配也会造成同样结果。

Tabbit 能运行 Mistral 24B 吗?+

不要默认可以。本页检查时 Tabbit 公开模型目录没有显示 Mistral。这里推荐 Tabbit 用于资料收集、比较和浏览器调研。

把 checkpoint、模板和证据放在一起

先确认准确的 Mistral ID,接好服务层,再用短测试调整 SillyTavern。模型卡、量化页和社区讨论散落各处时,可以用 Tabbit 收拢资料。

支持 macOS 和 Windows,Tabbit 模型列表可能变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。