SKYFALL 31B × SILLYTAVERN

まず正しい Skyfall ファイルを選ぶ

Skyfall 31B には複数のバージョンと形式があります。このガイドは TheDrummer/Skyfall-31B-v4.2 用です。キャラクターカードを調整する前に、ID、base、Mistral v7 テンプレート、量子化を確認します。

v4.2 カードを見る
垂直タブとリサーチ用サイドバーを表示した Tabbit デスクトップブラウザー。

リポジトリ ID を確認

31B はサイズであり checkpoint 名ではない

完全なリポジトリ名をメモします。v4.2、v4.1、旧 Skyfall、似た名前の検索結果を分けられます。

01

このガイドのモデル

`TheDrummer/Skyfall-31B-v4.2` は safetensors リポジトリです。カードは作者を TheDrummer とし、Mistral v7 Tekken を記載しています。

02

ベースモデル

メタデータでは `mistralai/Magistral-Small-2509` が base です。名前が似た別の Mistral Small に置き換えないでください。

03

パラメータ数

HF API は BF16 パラメータを 31,352,980,480、Mistral アーキテクチャ、最大 position を 131,072 と報告しています。実際のコンテキスト利用を保証する値ではありません。

04

ライセンス

確認した API メタデータには license 欄がありませんでした。再配布や商用利用の前にカードと upstream の条件を確認してください。

量子化とハードウェア

実際に読み込めるファイルを選ぶ

公式リポジトリは大きく、GGUF には複数の選択肢があります。ファイルサイズは入口の目安で、最終的な VRAM 使用量ではありません。

01

Q4_K_M から始める

GGUF tree では Q4_K_M は約 18.98 GB です。runtime、コンテキスト、OS 用の余裕を残します。24 GB GPU でも余裕のある全 GPU ロードとは限りません。

02

大きな量子化には余裕が必要

Q5_K_M は約 22.25 GB、Q6_K は約 25.73 GB、Q8_0 は約 33.32 GB です。CPU や RAM の offload は可能でも速度が大きく落ちることがあります。

03

小さい量子化は品質と交換

Q2_K は約 11.73 GB、Q3_K_M は約 15.20 GB です。量子化を変えたら同じ短い場面で比較します。

04

サービス層を一つ選ぶ

GGUF カードは llama.cpp と Ollama の手順を掲載しています。正しいファイルを取得し、backend の endpoint と model ID を SillyTavern に入力します。

SILLYTAVERN RP 設定

テンプレートが先、sampler は後

Skyfall v4.2 はカスタム Mistral v7 Tekken テンプレートを使います。形式の担当を一つにして、二往復のテストから始めます。

01

Mistral v7 Tekken を使う

可能なら tokenizer または backend にテンプレートを適用させます。SillyTavern も prompt を包む場合は role marker の重複を確認します。

02

thinking を使うか決める

テンプレートは system message の `/think` を探し、`[THINK]...[/THINK]` を追加できます。意図してテストし、カードに偶然混ぜないでください。

03

基準値を残す

最初の RP は temperature 0.7、top_p 0.9、適度な最大出力から始め、毎回一つだけ変更します。

04

ユーザーの発話権を守る

モデルが担当する話者を明記します。例は短くし、ユーザーとキャラクターの両方を書く指示を削ります。

コミュニティには自然な会話、キャラクターの一貫性、トーン追従を評価する声があります。一方で冗長さ、ナレーションの弱さ、ユーザーの発話、swipe 後の反復も報告されています。統制された評価ではありません。

症状 → 確認 → 対処

失敗した層を切り分ける

短い同じ prompt を繰り返し、一度に一つだけ変更します。

症状確認次の手順
空応答またはマーカーが見えるendpoint、Mistral template の担当、`/think`、stop string。一行の prompt を送り、担当を一つにしてマーカーを除きます。
モデルが {{user}} の台詞を書くカード例、system prompt、直前の assistant。話者の境界を明記し、例を短くして二択の場面でテストします。
長く反復するcontext、重複 lore、max tokens、sampler。カードを整理し、予算を下げ、一つずつ sampler を変更します。
遅い、またはクラッシュする量子化サイズ、GPU offload、RAM/VRAM、context。小さい量子化か短い context を試し、tokens/sec を比較します。
カードと挙動が違うv4.2/v4.1、safetensors/GGUF、完全な model ID。ID を再コピーし、そのファイルのカードに従います。

TABBIT を調査デスクに

カード、量子化、メモを同じ場所に置く

Tabbit は Skyfall を実行せず、SillyTavern の代わりにもなりません。カード、GGUF tree、コミュニティの情報をまとめる用途です。

  1. 1

    ソースを開く

    公式カード、GGUF tree、SillyTavern docs を並べ、ID、サイズ、テンプレート指示だけを抽出します。

  2. 2

    @ で文脈を渡す

    ページ、スクリーンショット、ローカルメモを @ で参照し、確定事項と未確認事項を分けたリストを作ります。

  3. 3

    変更前に比較する

    マルチモデルチャットで説明を比較します。Tabbit は証拠を整理し、Skyfall は互換 backend で動かします。

検索結果と実行手順を並べた Tabbit Deep Research。
ソース記事の隣に AI 要約を表示する Tabbit。
同じ質問への複数回答を並べた Tabbit マルチモデルチャット。
実行手順を表示しながら Google Sheets を操作する Tabbit Agent。

適切な画面を使う

SillyTavern はチャットを実行し、Tabbit は証拠を整理する

役割は異なります。生成操作は SillyTavern に残し、Tabbit で資料のタブ移動を減らします。

SillyTavern + backendTabbit
Skyfall をローカル実行互換 backend なら可能保証しない
キャラクターカードと sampler詳細な操作参照メモ
カードと量子化を読むタブやアプリを切り替え@ ページ、ファイル、画像
説明を比較preset や endpoint を切替利用可能モデルを比較
ハードウェア診断VRAM、offload、速度を確認証拠を集める

FAQ

Skyfall 31B と SillyTavern

このガイドの Skyfall 31B は?+

TheDrummer/Skyfall-31B-v4.2 です。v4.1 や別プロジェクトはテンプレートも挙動も異なる可能性があります。

v4.2 の base は?+

カードのメタデータでは mistralai/Magistral-Small-2509 です。完全な ID を使ってください。

どの量子化を選ぶ?+

公式 GGUF tree で約 18.98 GB の Q4_K_M が出発点になります。runtime の余裕を確認し、必要に応じて Q3 または Q5 を試します。

どの chat template を使う?+

カードには Mistral v7 Tekken とあります。カスタムテンプレートは system prompt の /think も確認します。

Tabbit は Skyfall 31B を実行する?+

このページでは保証していません。Tabbit はカード、ファイル、比較情報の整理用です。互換 backend で実行し、SillyTavern に接続してください。

最初の設定を model ID にする

v4.2 を確認し、量子化を選び、Mistral の形式担当を一つにして短い場面を試します。資料が散らばっているなら Tabbit でまとめます。

macOS と Windows に対応。利用できるモデルは変わる場合があります。

© 2026 Tabbit Browser. あなたのコンテキストを理解する AI ネイティブブラウザ。