端点与别名
官方快速开始使用 Moonshot API 地址 https://api.moonshot.ai/v1,Chat Completions 的模型别名是 kimi-k3。
KIMI K3 API + SILLYTAVERN
SillyTavern 可以通过 OpenAI 兼容连接访问 Kimi K3,但模型仍有自己的请求规则。先确认端点和别名,再按请求体、推理块、provider、状态码的顺序排查。
官方文档使用 https://api.moonshot.ai/v1 和 kimi-k3。K3 始终开启 thinking,应使用 reasoning_effort,不要照搬 K2.x 的 thinking。

先看事实
Kimi 官方文档对 K3 的规则写得很清楚。社区搜索结果可以帮助定位慢响应、过度思考、额度或安全提示等线索,但它们不是服务承诺。
官方快速开始使用 Moonshot API 地址 https://api.moonshot.ai/v1,Chat Completions 的模型别名是 kimi-k3。
K3 始终开启 thinking。流式响应可能把 reasoning_content 与最终 content 分开,多轮请求还可能需要保留完整 assistant 消息。
兼容前端不会让所有 provider 变成同一个 API。要分别核对模型列表、别名、限额、支持字段,以及是否保留 reasoning block。
API 契约
用这份小契约区分认证问题和模型参数问题。把密钥放进环境变量,从 Chat Completions 开始。
最小请求结构
curl https://api.moonshot.ai/v1/chat/completions \
+ -H "Authorization: Bearer $MOONSHOT_API_KEY" \
+ -H "Content-Type: application/json" \
+ -d '{"model":"kimi-k3","reasoning_effort":"high","messages":[{"role":"user","content":"Hello"}]}'代码展示官方字段名。K3 的固定字段不要因为 OpenAI 客户端接受就顺手加入。
OpenAI 客户端的 base URL 使用 https://api.moonshot.ai/v1。第三方代理可能有不同地址,应以它的文档为准。
在 Kimi API Platform 创建 API key,通过 Authorization: Bearer 发送。可存为 MOONSHOT_API_KEY 或 provider 的变量,不要把真实密钥放进公开 preset。
官方 K3 API 使用 kimi-k3。界面显示名 Kimi K3 不一定就是请求 slug,第三方 provider 需要查看它当前列出的别名。
响应含 reasoning_content 时,下一轮发送完整 assistant 消息。删掉 preserved thinking 字段,可能导致下一次响应为空或无效。
模型专属字段
最常见的问题是把所有 Kimi 模型当成同一个 API。K3 与 K2.x 的推理控制不同,也会拒绝一些熟悉字段。
顶层 reasoning_effort 支持 low、high、max,官方默认 max。thinking 仍然开启。
thinking 对象属于 K2.x 示例。不要把 thinking: { type: enabled } 直接放进 K3 请求,除非 provider 明确提供转换层。
K3 的 tool_choice 支持 auto、none、required。partial mode 使用带 partial=true 的 assistant 消息,与 SillyTavern 文本模板是两回事。
K3 请求省略 temperature、top_p、n、presence_penalty、frequency_penalty。官方参考把它们列为固定值。若 provider 有额外参数,以其文档为准。
Provider 检查
直接调用 Moonshot 时使用官方一栏。网关或共享端点的值,在文档确认前都应视为 provider 专属。
| Moonshot 官方 API | 网关或第三方 provider | |
|---|---|---|
| Base URL | https://api.moonshot.ai/v1 | 严格使用 provider 给出的地址 |
| 模型字段 | kimi-k3 | 确认它列出的 slug 或 alias |
| 推理控制 | reasoning_effort: low | high | max | 确认是否透传或改写字段 |
| 额度与权限 | Kimi 账户等级与当前限额 | provider 的计费、quota、RPM、TPM、并发 |
| 历史消息 | 保留完整 assistant 消息 | 确认 reasoning_content 是否保留 |
错误排查台
下面的检查用于确定下一步,不代表每个 provider 的错误文本都相同。
密钥缺失、格式错误、过期,或发送到了错误主机。
检查 Authorization、环境变量、选中的 provider 和账户权限。密钥泄露时请重新生成。
当前 provider 没有这个 URL 路径或模型别名。
确认 base URL 以 /v1 结尾,路径是 /chat/completions,并在模型列表中确认 kimi-k3 或官方别名。
请求触发速率、并发、quota 或账户限制。
查看 provider 限额,减少并行轮次,缩短上下文并退避重试。社区的额度反馈不等于统一限制。
请求体带了不支持字段、thinking 格式不匹配,或 assistant 历史不完整。
移除 K2.x thinking 和 K3 固定参数,校验 messages,并在需要时带回 reasoning_content。
少配置一条路
如果你只是想询问角色卡、wiki 或写作 brief,Tabbit 提供浏览器聊天路径。它不是 SillyTavern 替代品,也不提供 ST 卡片或 lorebook。

把角色设定、资料页或草稿留在标签页。Tabbit 输入框可以引用当前页面、截图或本地文件。

从 Chat 或新标签页模型选择器选择 Kimi-K3。截图是界面示例,安装后请以实时模型列表和权限为准。

用侧边栏提问,或在同一视图比较多个模型。这个浏览器工作流不需要先配置端点,但角色功能仍可留给 SillyTavern。
分清工具边界
按当前任务选择工具。浏览器聊天捷径不等于角色卡引擎。
| SillyTavern | Tabbit | |
|---|---|---|
| API 端点与密钥 | 自行配置 provider、密钥、别名和模板 | 选择可用的内置模型 |
| 角色卡与 lorebook | SillyTavern 的核心工作流 | 以页面或文件作为上下文 |
| 推理排查 | 检查 provider 响应和扩展 | 不管理 API 字段,直接在页面旁提问 |
| 扩展与群聊 | SillyTavern 生态 | 不同的产品能力 |
K3 API 常见问题
官方快速开始使用 https://api.moonshot.ai/v1,路径为 /chat/completions。网关可能公布不同的 base URL。
官方 Moonshot API 使用 kimi-k3。第三方 provider 请填写它当前模型列表中显示的准确 slug。
K3 使用顶层 reasoning_effort,值为 low、high 或 max,并始终开启 thinking。thinking 对象属于 K2.x,不是通用 Kimi 字段。
K3 始终推理。检查 effort、流式处理,以及下一次请求是否保留完整 assistant 消息和 reasoning_content。社区的速度反馈不是服务保证。
移除 temperature 等 K3 固定字段和 K2.x thinking 配置,再校验模型别名、messages 与 provider schema。
Tabbit 当前模型选择器显示 Kimi-K3,可以先走浏览器路径,不必先创建自己的端点。权限和额度会变化,请以实时应用为准。
需要卡片、lorebook 或扩展时,认真配置 SillyTavern。只是想马上询问一个页面时,打开 Tabbit,从实时列表选择模型。
支持 macOS 和 Windows。模型权限取决于当前版本和方案。