KIMI K3 / PREFILL DE RAISONNEMENT

Préremplissez la réponse, pas le mauvais bloc de raisonnement

Kimi K3 raisonne toujours. Partial Mode poursuit le préfixe d’un message assistant, tandis que le raisonnement et le contenu final peuvent arriver dans des champs distincts. Cette frontière explique les réponses vides, les erreurs 400, le raisonnement visible et la perte de contexte au tour suivant.

Voir la carte de compatibilité

La référence officielle Kimi Chat Completions décrit K3, Partial Mode et les différences avec K2.x. Vérifiez séparément le support de votre fournisseur.

Nouvel onglet Tabbit avec un prompt central et le sélecteur de modèles ouvert pour voir la liste actuelle.

COMMENCEZ PAR LE CONTRAT

Le raisonnement et le prefill ont deux frontières distinctes

La documentation Kimi est précise. Les publications de la communauté donnent des indices sur les fournisseurs et SillyTavern, sans garantir une solution universelle.

K3 raisonne toujours

K3 utilise `reasoning_effort` au niveau supérieur avec `low`, `high` ou `max`. Ne copiez pas les réglages `thinking` de K2.x dans une requête K3.

Partial Mode poursuit le contenu

Placez un message `assistant` à la fin de `messages` et ajoutez `partial: true` pour guider le préfixe de sortie. Ce n’est pas une méthode documentée pour injecter un raisonnement privé.

Le fournisseur fait partie du test

Une passerelle peut renommer, supprimer ou refuser `partial`, `reasoning_effort` ou `reasoning_content`. Comparez d’abord le même prompt sans prefill avant de modifier une fiche de rôle.

CARTE DES CHAMPS

K3 et K2.x n’utilisent pas le même réglage thinking

Choisissez le champ selon la famille du modèle. Ce tableau aide au diagnostic, mais ne garantit pas qu’une passerelle transmette chaque champ.

K3 et K2.x n’utilisent pas le même réglage thinking
QuestionKimi K3Kimi K2.x
Peut-on désactiver thinking ?Non. K3 raisonne toujours.Cela dépend du modèle. K2.6 documente enabled ou disabled ; K2.7-code reste fixé sur enabled.
Contrôle du raisonnementAu niveau supérieur, `reasoning_effort` : low, high, max.`thinking.type`, avec des valeurs par défaut propres au modèle.
Historique conservéK3 utilise preserved thinking. Retournez le tour assistant complet si le fournisseur le demande.`thinking.keep` est documenté pour K2.x et varie selon le modèle.
PrefillPartial Mode poursuit le préfixe assistant avec `partial: true`.Consultez la documentation du modèle et du fournisseur. Ne déduisez pas le support des exemples K3.

Si une requête K3 contient `thinking: { type: "enabled" }`, supprimez-le, sauf si votre fournisseur documente explicitement une couche de traduction.

VÉRIFICATION DU PREFILL

Lancez un tour propre avant d’ajouter un préfixe

Un test court et contrôlé permet de distinguer le prompt, le mappage de réponse, l’historique et le fournisseur. Gardez le même modèle et le même endpoint, puis ne changez qu’un élément à la fois.

Forme minimale de Partial Mode

{
  "model": "kimi-k3",
  "messages": [
    {"role": "user", "content": "Renvoyez un objet d’état."},
    {"role": "assistant", "content": "{\"status\":", "partial": true}
  ],
  "reasoning_effort": "low",
  "stream": false
}

Cet exemple montre le rôle des champs, pas un preset SillyTavern propre à un fournisseur. Ne mettez pas de clés API dans le code.

  1. 01

    1. Confirmez la famille du modèle

    Vérifiez le slug exact dans la liste du fournisseur. Pour l’API Kimi officielle, l’alias K3 est `kimi-k3`, mais une passerelle peut en publier un autre.

  2. 02

    2. Envoyez une requête propre

    Retirez `partial`, utilisez un message user normal et gardez seulement le champ de raisonnement documenté pour K3. Enregistrez `content` et tout `reasoning_content` renvoyé.

  3. 03

    3. Ajoutez un court préfixe assistant

    Placez un petit préfixe dans le dernier message assistant et activez `partial: true`. Commencez par un format comme `{"status":`, plutôt que par un long bloc de roleplay.

  4. 04

    4. Rejouez le tour assistant complet

    Au tour suivant, conservez le message assistant complet dans la forme indiquée par votre fournisseur. Ne mélangez pas un bloc de raisonnement avec le préfixe de contenu.

FOURNISSEUR ET FRONTEND

La compatibilité OpenAI décrit une forme, pas une garantie

SillyTavern accepte les endpoints compatibles avec OpenAI et permet de saisir manuellement l’ID du modèle quand l’endpoint models est absent. L’endpoint décide quels champs K3 restent inchangés.

Moonshot officielPasserelle ou route SillyTavern
Modèle`kimi-k3`Utilisez l’alias exact actuellement fourni.
Raisonnement`reasoning_effort` low, high, maxConfirmez s’il est transmis, renommé ou supprimé.
Partial ModePréfixe assistant et `partial: true`Vérifiez que le champ est accepté pour ce modèle.
Historique de réponseConservez le message assistant si nécessaireVérifiez que reasoning et content restent séparés.
Réglage SillyTavernUtilisez la source API documentéeTest Message et Bypass API status check aident à isoler les contrôles du frontend.

DU SYMPTÔME AU TEST

Laissez l’erreur choisir la prochaine modification

Ces tests gardent le diagnostic ciblé. Un rapport de communauté peut suggérer une hypothèse, mais la requête et la réponse de votre fournisseur sont les éléments vérifiables.

400 après import d’un preset K2.x

Schéma de raisonnement incorrect

Supprimez `thinking` et les champs d’historique K2.x. Utilisez `reasoning_effort` pour K3 et l’alias actuel du fournisseur.

Réponse vide après un raisonnement visible

Mappage de réponse ou historique

Examinez les deltas de streaming et les champs hors streaming. Conservez le tour assistant complet, pas seulement `content`.

Le prefill renvoie un refus ou une suite étrange

Partial Mode ou fournisseur

Désactivez `partial` et comparez une complétion propre. Vérifiez que ce modèle et cette route documentent le prefill.

Le raisonnement apparaît dans la réponse finale

Frontière du rendu

Affichez `reasoning_content` séparément de `content`. Ne concaténez pas les deux champs à l’écran.

Le tour suivant perd son contexte

Historique tronqué ou modifié

Journalisez les messages sortants, gardez l’objet assistant complet et vérifiez la limite de contexte du fournisseur.

Le raisonnement dure trop longtemps

Effort, prompt ou quota

Essayez le niveau d’effort inférieur documenté, raccourcissez l’historique de test et comparez avec le prefill désactivé.

UNE ROUTE PLUS SIMPLE

Posez d’abord votre question à Kimi à côté de la source

Pour examiner une fiche de personnage, un document API ou une page de recherche, Tabbit vous permet de choisir un modèle actuel tout en gardant la source visible. Cette tâche de navigateur ne demande pas de câbler un endpoint ; SillyTavern reste adapté aux cartes et aux extensions.

01

Gardez la page ou le fichier ouvert

Utilisez la page visible, une capture d’écran ou un fichier local comme contexte. Posez une question précise sans construire de payload de prefill.

Sélecteur de modèles Tabbit dans un nouvel onglet, avec le prompt et la liste des modèles visibles.
02

Vérifiez le sélecteur actuel

Choisissez Kimi-K3 lorsqu’il apparaît dans la liste. La capture est un exemple d’interface ; l’accès dépend de votre édition et de votre forfait.

Chat Tabbit avec plusieurs modèles, dont une colonne Kimi-K3 pour une comparaison propre.
03

Comparez une réponse propre

Posez une question dans la barre latérale ou comparez plusieurs réponses. Vous aurez une base avant de revenir à un test Partial Mode propre au fournisseur.

Barre latérale de résumé Tabbit à côté d’un article, avec le contexte de la page sans payload de prefill.

FAQ DU PREFILL DE RAISONNEMENT

Réponses avant le prochain tour défaillant

Kimi K3 accepte-t-il le prefill assistant ?+

L’API officielle documente Partial Mode. Ajoutez un message assistant à la fin de `messages` et `partial: true` pour poursuivre le préfixe. Vérifiez aussi le fournisseur utilisé.

Puis-je préremplir reasoning_content pour Kimi K3 ?+

Ne le supposez pas. Partial Mode documente le préfixe de sortie assistant. Le raisonnement est une autre frontière de réponse, et le fournisseur peut refuser ou réécrire une tentative d’injection.

Dois-je envoyer thinking ou reasoning_effort ?+

Pour K3, utilisez `reasoning_effort` au niveau supérieur avec `low`, `high` ou `max`. L’objet `thinking` appartient aux exemples K2.x et n’est pas un réglage Kimi universel.

Pourquoi une requête avec prefill renvoie-t-elle une réponse vide ?+

Désactivez le prefill et envoyez une requête propre. Vérifiez que `content` et `reasoning_content` arrivent séparément, puis que le message assistant complet est conservé au tour suivant.

Pourquoi SillyTavern affiche-t-il 400 ?+

Vérifiez l’alias du modèle, l’endpoint, le JSON et le support du fournisseur. Retirez les champs K2.x copiés et les samplers non pris en charge avant de modifier le prompt.

Moonshot est-il le seul fournisseur à prendre en charge le prefill ?+

Un échange Reddit rapporte qu’un utilisateur n’a trouvé le support que chez Moonshot. C’est une observation individuelle, pas une règle générale. Consultez la documentation de votre route.

Rendez la frontière visible, puis choisissez votre méthode

Utilisez les noms de champs officiels de K3, testez Partial Mode avec un préfixe court et conservez le tour assistant attendu par votre fournisseur. Pour une question sur une page ou un fichier, ouvrez Tabbit et choisissez Kimi-K3 dans le sélecteur actuel.

Disponible sur macOS et Windows. L’accès aux modèles et les quotas dépendent de l’édition et du forfait actuels.

© 2026 Tabbit Browser. Le navigateur natif IA qui comprend votre contexte.