Tabbit部落格

Kimi K2 角色扮演:決定前先測什麼

區分原版 Kimi K2 與後續版本,再用同一張角色卡檢查聲音、連貫性和節奏。

本文目錄
  1. 重點整理
  2. Kimi K2 角色扮演速覽
  3. 比較前先確認版本與路由
  4. 用同一張角色卡做可重複測試
  5. 分別測試上下文、記憶與重複
  6. 依照場景選擇測試重點
  7. 區分模型與 SillyTavern、供應商設定
  8. 結論:讓實際路由通過你的測試

「Kimi K2 角色扮演」不是單一固定配置。它可能指原版 Kimi-K2-Instruct checkpoint、供應商標示為 K2 0905 的路由,或後續 Kimi 型號。官方 Kimi-K2-Instruct 模型卡將它描述為通用聊天與 Agent 模型,並列出 128K 上下文;卡片沒有評量人物聲音、長對話連貫性或場景節奏。

因此,實用答案有前提:只有你實際能使用的準確 checkpoint 與 endpoint 符合角色卡和偏好,Kimi K2 才值得考慮。先跑一組短而可重複的測試,再決定是否投入長篇故事。本文提供測試表和拆解模型、提示詞組裝與供應商設定的方法,不是 Kimi K2 基準,也沒有聲稱作者親自測過 K2。

128K 是容量規格,不代表應用程式會把整段對話送給模型,也不保證供應商開放完整視窗,更不代表模型能在需要時取回正確細節。這些是不同問題,應分別檢查。

重點整理

  • 比較前記下準確 checkpoint 或供應商 model ID;「Kimi K2」不足以識別實際路由。

  • 將 K2-Instruct、標示為 K2 0905 的 endpoint 和後續型號視為不同候選項。

  • 使用相同角色卡、開場、提示詞格式、供應商和輪數比較。

  • 分開評估聲音、連貫性、指令遵循、角色主動權、節奏與重複;單篇精彩回覆不等於整場表現。

  • 本稿沒有 K2 實測,也沒有核實社群原文或截圖;以下方法不代表 K2 表現好或不好。

Kimi K2 角色扮演速覽

版本或層現有來源可確認的事仍無法確認的角色扮演表現
Kimi-K2-Instruct官方卡將它描述為通用聊天與 Agent 模型,標示不使用長思考及 128K 上下文,並提供 vLLM、SGLang 等本機服務範例。人物聲音、長對話回憶、節奏、特定場景的拒答,或特定託管服務的輸出品質。
K2 0905 標籤研究紀錄有搜尋發現的日期版本線索;原社群頁面無法開啟,也未核實目前供應商路由。目前是否有可用路由、不同供應商是否提供相同權重,以及該版本的 RP 表現。
供應商 endpoint個別供應商頁面可能列出 model ID、上下文上限、請求處理方式與服務限制,使用前應確認。單靠標籤無法證明 checkpoint、完整上下文或預設生成設定一致。
後續 Kimi 名稱K2.5、K2.6、K2.7 Code、K2.8 和 K3 在本次研究範圍內是不同版本名稱。這些版本的文件、設定或使用者印象不能直接代表原版 K2。
角色扮演前端SillyTavern 會把角色和對話內容組成請求;官方文件說明不同的提示詞建構方式。前端無法保證 endpoint 收到什麼,也不能決定模型如何回覆。

Kimi-K2-Instruct 的上述資訊來自官方模型卡。研究計畫列有官方 Kimi K2 專案頁作為版本名稱來源,但本輪未重新開啟。依賴目前供應狀態或版本說法前,請重新檢查官方發布頁與供應商頁面。搜尋摘要、討論串標題或相近的 Kimi 型號都不能取代查證。

比較前先確認版本與路由

先複製供應商顯示的 model ID,或本機服務設定中的 checkpoint 全名;同時記下日期、供應商與使用介面。如果畫面只有「Kimi K2」,就先標為待確認,不要猜它是 Kimi-K2-Instruct 或 K2 0905。

角色輸出來自整條流程:角色卡與對話歷史被組成提示詞,送到某個路由,再依生成設定解碼。供應商可能更改顯示的 model ID、限制上下文、套用範本或設定預設值。所以結果只適用於實際測試的這條路徑,不能推論所有 K2 名稱的服務。

把版本問題和品質問題分開。公開模型卡能確認其標示的模型定位與服務範例;供應商頁面能確認該供應商目前列出的 endpoint 和條款。兩者都沒評量角色是否能演滿五十輪。一段讓使用者喜歡的劇情,也不能證明模型的上下文容量或授權內容。

看到 K2 0905 時,先核實路由及其來源。本稿只有搜尋發現線索,沒有可讀取的一手頁面證實目前 endpoint,因此不把它寫成已測試或目前可用的模型。後續型號請分別看Kimi K2.6 概覽Kimi K3 角色扮演指南,不要把它們當成 K2 證據。

用同一張角色卡做可重複測試

挑一張熟悉的角色卡,讓你能察覺人物走樣。先在自己的評分表寫下穩定口吻、當下目標、和玩家角色的關係、一條不可跨越的界線,以及會影響下一次回覆的近期事件。除非每個候選模型都收到完全相同內容,否則這張表只用來評分,不要額外塞進其中一個提示詞。

把相同角色卡與開場訊息送給準確 K2 路由和一個替代模型。盡量固定供應商、系統提示詞、上下文設定、採樣選項、輸出上限與對話紀錄。成本允許時,分別開三段獨立對話,每段至少六輪模型回覆。三輪可快速抓出明顯問題,但不足以說明長對話可靠。不要拿新開的 K2 對話,比已經累積更多設定的另一模型。

每個面向都用同一把簡單量表:0 = 任務被破壞;1 = 需要反覆修正;2 = 大致可用,偶爾失準;3 = 穩定符合這張卡和你的偏好。各段對話分開評分,再看中位數,而非挑最高的一次。每個 0 或 3 都附上例子或輪數。這是個人選擇工具,不是標準基準,也不代表所有使用者。

面向記錄內容可繼續的訊號停止或修正的訊號
聲音用字、句子節奏、情緒收放、人物細節不必反覆提醒,仍聽得出是誰變成通用敘述,或重複固定口頭禪
連貫性前文事實、承諾、物件、關係和事件在適當時機準確帶回相關細節忘記、否定或捏造關鍵情節
指令遵循角色卡規則及最新場景限制遵守當下限制,也維持角色設定忽略明確界線,或退回過時指令
主動權誰控制玩家角色與尚未決定的選擇推進場景,同時保留玩家下一步替玩家決定、描述其感受或封死結果
節奏新資訊、回覆長度與場景變化符合你偏好的速度重複解說拖慢互動,或跳過選擇
重複重用語句、動作、摘要和情緒只在有助理解時回顧沒有新意地重複,阻礙劇情前進

把提示詞、角色卡版本、準確 endpoint ID、日期、設定和輸出存在本機筆記;分享前刪除私人內容。如果某個設定改變後結果變好,保留兩次輸出並註明變因。「我同時改了提示詞和 temperature」不是控制良好的比較,因為無法判斷是哪項造成差異。

分別測試上下文、記憶與重複

不要從上下文視窗數字推論記憶。在對話不同位置放入幾條事實:一條在開頭、一條在中段、一條在最近幾輪。內容可分別是具體細節、關係或承諾,以及必須持續遵守的指令。之後在自然的情節對話中詢問其中一項,再加入新事件,觀察模型會更新理解,還是固守舊狀態。

分開記錄三種結果:正確取回、遺漏、改成沒有依據的內容。也要確認該事實是否真的出現在送到模型的提示詞裡。前端可能摘要或截斷歷史;若事實未送出,問題可能在提示詞或供應商流程。若內容確實存在卻被錯誤處理,才記作觀察到的回覆問題。沒有檢查實際提示詞時,成因應標為未知。

檢查重複時,請依序閱讀整段紀錄,不要只看單次回覆。標記重複原句、動作、同一情緒宣告和不必要的摘要。有時重複是角色的一部分,例如再次提起承諾或儀式。當重複沒有新增意義、卡住場景,或迫使你再次提供資訊時,才算問題。記下重複類型,不要只寫「很重複」。

測試指令遵循時,使用容易觀察且適合劇情的規則,例如「不要替玩家角色決定行動」或「每次回覆不超過兩段短文」。把規則放在角色卡或共用提示詞中,在開場、場景轉換後及長對話後都檢查。比較期間不要更改規則。漏掉一次指令可能來自提示詞位置、上下文截斷或模型表現;單看對話不一定能判斷原因。

依照場景選擇測試重點

不同 RP 任務會暴露不同問題。先決定你在意什麼,不要用一個總分藏起取捨。

主要用途第一個測試可保留的條件停止或調整的條件
短篇角色聊天用熟悉口吻進行三次來回,明確保留玩家回合符合卡片,也留下可接續的選擇每輪都要糾正,或很快變得制式
慢熱關係先建立小承諾,幾輪後自然回扣關係隨具體互動發展,沒有強行升溫忘記承諾或一直重演同一情緒
懸疑或冒險早期給一條線索,再增加限制使用相關線索,也讓玩家自行決定捏造線索或擅自替玩家結案
設定密集的長篇把幾項事實放在提示詞不同位置,再自然詢問重要細節仍可取用,前端也有持續送出設定擠滿提示詞,或後續取不到細節
多角色場景為兩位角色設定差異並測試對話聲音容易分辨,輪替清楚人物混聲,或搞錯誰知道什麼
嚴格保留玩家主導加一條明確的玩家控制規則只推進模型角色和環境替玩家敘述想法或決定

以上是測試場景,不是 Kimi K2 在任何類型上的成敗結論。短聊天也許可接受較低的連貫性分數,長篇戰役未必。停止標準要符合修正成本:改一個措辭可能沒關係,虛構雙方關係史則可能讓整次測試失效。

區分模型與 SillyTavern、供應商設定

角色扮演前端會實際改變提示詞。角色卡、範例對話、世界書、作者備註和近期聊天都可能被組合後再送出。SillyTavern 的 API Connections 文件說明,Chat Completions 與 Text Completions 是不同的提示詞建構方式,不代表「雲端」與「本機」的區別。endpoint 和部署方式是另一層。

回覆不理想時,依序檢查:確認選到正確 model ID;確認提示詞按預期包含角色卡和歷史且沒有重複;核對上下文與輸出限制;最後才調整生成設定。若路由套用不同範本或提前截斷歷史,調 temperature 可能只掩蓋症狀。

連線步驟見Kimi K2 SillyTavern 設定指南Kimi K3 SillyTavern 指南Kimi K3 設定指南討論不同型號,不能當成 K2 專用步驟。尋找比較對象時,可參考DeepSeek V3.2 角色扮演Mistral 24B SillyTavern 指南GLM-5.3 SillyTavern 指南Gemma 4 SillyTavern 指南。使用同一張卡自行比較,不要把不同文章當作對照實驗。

Tabbit 可當作整理工作區,把官方模型文件、供應商說明與個人測試紀錄放在一起。這只是文件整理用途,不代表 Tabbit 託管原版 Kimi K2、提供 K2 選模器,或曾用來完成本文測試。本文沒有 K2 的 Tabbit 對話或 RP 結果。

結論:讓實際路由通過你的測試

現有一手資料只能確認 Kimi-K2-Instruct 的有限資訊:模型卡將它描述為通用聊天與 Agent 模型,列出 128K 上下文,並提供本機服務範例。這些資料無法回答它能否在長場景中持續演好一個角色。本次研究也沒有可讀取的社群原文、合格截圖或控制測試,因此不能選出 RP 贏家。

只有當你真正會使用的路由達到自己對聲音、連貫性、指令遵循與節奏的最低要求時,才選 K2。未通過時先保存紀錄,一次檢查一層:路由、提示詞組裝、可用上下文,再來才是角色卡或生成設定。短測通過後,也要多跑一段對話再開始長篇;六輪能找出摩擦,但不能證明長時間可靠。

下一步很明確:複製 endpoint 的準確 model ID,用熟悉的角色卡送出相同開場,保存六輪,再做決定。測試當下重看官方模型卡與供應商文件,因為路由和限制可能改變。本稿仍是草稿,直到社群證據與圖片門檻通過。

常見問題

Kimi K2 適合角色扮演嗎?

官方模型卡稱 Kimi-K2-Instruct 是通用聊天模型,但沒有評估角色表現。請用準確版本、角色卡和供應商做短測試。

本文指哪個版本?

主要指原版 Kimi-K2-Instruct;K2.5、K2.6、K2.7 Code 和 K3 是不同型號。

128K 上下文能保證記憶嗎?

不能。上下文是容量規格,連貫性需要透過多輪驗證。

可以本機執行嗎?

官方模型卡列出 vLLM 和 SGLang 路徑;硬體需求視設定而定。

如何與其他模型比較?

固定角色卡、開場、供應商和輪數,分別記錄口吻、連貫性、節奏與重複。

下一步

讓 Tabbit 與你並肩工作。

跨分頁調研、自動化重複的瀏覽器工作,讓每一處上下文都觸手可及。