「Kimi K2 角色扮演」不是單一固定配置。它可能指原版 Kimi-K2-Instruct checkpoint、供應商標示為 K2 0905 的路由,或後續 Kimi 型號。官方 Kimi-K2-Instruct 模型卡將它描述為通用聊天與 Agent 模型,並列出 128K 上下文;卡片沒有評量人物聲音、長對話連貫性或場景節奏。
因此,實用答案有前提:只有你實際能使用的準確 checkpoint 與 endpoint 符合角色卡和偏好,Kimi K2 才值得考慮。先跑一組短而可重複的測試,再決定是否投入長篇故事。本文提供測試表和拆解模型、提示詞組裝與供應商設定的方法,不是 Kimi K2 基準,也沒有聲稱作者親自測過 K2。
128K 是容量規格,不代表應用程式會把整段對話送給模型,也不保證供應商開放完整視窗,更不代表模型能在需要時取回正確細節。這些是不同問題,應分別檢查。
重點整理
比較前記下準確 checkpoint 或供應商 model ID;「Kimi K2」不足以識別實際路由。
將 K2-Instruct、標示為 K2 0905 的 endpoint 和後續型號視為不同候選項。
使用相同角色卡、開場、提示詞格式、供應商和輪數比較。
分開評估聲音、連貫性、指令遵循、角色主動權、節奏與重複;單篇精彩回覆不等於整場表現。
本稿沒有 K2 實測,也沒有核實社群原文或截圖;以下方法不代表 K2 表現好或不好。
Kimi K2 角色扮演速覽
| 版本或層 | 現有來源可確認的事 | 仍無法確認的角色扮演表現 |
|---|---|---|
Kimi-K2-Instruct | 官方卡將它描述為通用聊天與 Agent 模型,標示不使用長思考及 128K 上下文,並提供 vLLM、SGLang 等本機服務範例。 | 人物聲音、長對話回憶、節奏、特定場景的拒答,或特定託管服務的輸出品質。 |
| K2 0905 標籤 | 研究紀錄有搜尋發現的日期版本線索;原社群頁面無法開啟,也未核實目前供應商路由。 | 目前是否有可用路由、不同供應商是否提供相同權重,以及該版本的 RP 表現。 |
| 供應商 endpoint | 個別供應商頁面可能列出 model ID、上下文上限、請求處理方式與服務限制,使用前應確認。 | 單靠標籤無法證明 checkpoint、完整上下文或預設生成設定一致。 |
| 後續 Kimi 名稱 | K2.5、K2.6、K2.7 Code、K2.8 和 K3 在本次研究範圍內是不同版本名稱。 | 這些版本的文件、設定或使用者印象不能直接代表原版 K2。 |
| 角色扮演前端 | SillyTavern 會把角色和對話內容組成請求;官方文件說明不同的提示詞建構方式。 | 前端無法保證 endpoint 收到什麼,也不能決定模型如何回覆。 |
Kimi-K2-Instruct 的上述資訊來自官方模型卡。研究計畫列有官方 Kimi K2 專案頁作為版本名稱來源,但本輪未重新開啟。依賴目前供應狀態或版本說法前,請重新檢查官方發布頁與供應商頁面。搜尋摘要、討論串標題或相近的 Kimi 型號都不能取代查證。
比較前先確認版本與路由
先複製供應商顯示的 model ID,或本機服務設定中的 checkpoint 全名;同時記下日期、供應商與使用介面。如果畫面只有「Kimi K2」,就先標為待確認,不要猜它是 Kimi-K2-Instruct 或 K2 0905。
角色輸出來自整條流程:角色卡與對話歷史被組成提示詞,送到某個路由,再依生成設定解碼。供應商可能更改顯示的 model ID、限制上下文、套用範本或設定預設值。所以結果只適用於實際測試的這條路徑,不能推論所有 K2 名稱的服務。
把版本問題和品質問題分開。公開模型卡能確認其標示的模型定位與服務範例;供應商頁面能確認該供應商目前列出的 endpoint 和條款。兩者都沒評量角色是否能演滿五十輪。一段讓使用者喜歡的劇情,也不能證明模型的上下文容量或授權內容。
看到 K2 0905 時,先核實路由及其來源。本稿只有搜尋發現線索,沒有可讀取的一手頁面證實目前 endpoint,因此不把它寫成已測試或目前可用的模型。後續型號請分別看Kimi K2.6 概覽和Kimi K3 角色扮演指南,不要把它們當成 K2 證據。
用同一張角色卡做可重複測試
挑一張熟悉的角色卡,讓你能察覺人物走樣。先在自己的評分表寫下穩定口吻、當下目標、和玩家角色的關係、一條不可跨越的界線,以及會影響下一次回覆的近期事件。除非每個候選模型都收到完全相同內容,否則這張表只用來評分,不要額外塞進其中一個提示詞。
把相同角色卡與開場訊息送給準確 K2 路由和一個替代模型。盡量固定供應商、系統提示詞、上下文設定、採樣選項、輸出上限與對話紀錄。成本允許時,分別開三段獨立對話,每段至少六輪模型回覆。三輪可快速抓出明顯問題,但不足以說明長對話可靠。不要拿新開的 K2 對話,比已經累積更多設定的另一模型。
每個面向都用同一把簡單量表:0 = 任務被破壞;1 = 需要反覆修正;2 = 大致可用,偶爾失準;3 = 穩定符合這張卡和你的偏好。各段對話分開評分,再看中位數,而非挑最高的一次。每個 0 或 3 都附上例子或輪數。這是個人選擇工具,不是標準基準,也不代表所有使用者。
| 面向 | 記錄內容 | 可繼續的訊號 | 停止或修正的訊號 |
|---|---|---|---|
| 聲音 | 用字、句子節奏、情緒收放、人物細節 | 不必反覆提醒,仍聽得出是誰 | 變成通用敘述,或重複固定口頭禪 |
| 連貫性 | 前文事實、承諾、物件、關係和事件 | 在適當時機準確帶回相關細節 | 忘記、否定或捏造關鍵情節 |
| 指令遵循 | 角色卡規則及最新場景限制 | 遵守當下限制,也維持角色設定 | 忽略明確界線,或退回過時指令 |
| 主動權 | 誰控制玩家角色與尚未決定的選擇 | 推進場景,同時保留玩家下一步 | 替玩家決定、描述其感受或封死結果 |
| 節奏 | 新資訊、回覆長度與場景變化 | 符合你偏好的速度 | 重複解說拖慢互動,或跳過選擇 |
| 重複 | 重用語句、動作、摘要和情緒 | 只在有助理解時回顧 | 沒有新意地重複,阻礙劇情前進 |
把提示詞、角色卡版本、準確 endpoint ID、日期、設定和輸出存在本機筆記;分享前刪除私人內容。如果某個設定改變後結果變好,保留兩次輸出並註明變因。「我同時改了提示詞和 temperature」不是控制良好的比較,因為無法判斷是哪項造成差異。
分別測試上下文、記憶與重複
不要從上下文視窗數字推論記憶。在對話不同位置放入幾條事實:一條在開頭、一條在中段、一條在最近幾輪。內容可分別是具體細節、關係或承諾,以及必須持續遵守的指令。之後在自然的情節對話中詢問其中一項,再加入新事件,觀察模型會更新理解,還是固守舊狀態。
分開記錄三種結果:正確取回、遺漏、改成沒有依據的內容。也要確認該事實是否真的出現在送到模型的提示詞裡。前端可能摘要或截斷歷史;若事實未送出,問題可能在提示詞或供應商流程。若內容確實存在卻被錯誤處理,才記作觀察到的回覆問題。沒有檢查實際提示詞時,成因應標為未知。
檢查重複時,請依序閱讀整段紀錄,不要只看單次回覆。標記重複原句、動作、同一情緒宣告和不必要的摘要。有時重複是角色的一部分,例如再次提起承諾或儀式。當重複沒有新增意義、卡住場景,或迫使你再次提供資訊時,才算問題。記下重複類型,不要只寫「很重複」。
測試指令遵循時,使用容易觀察且適合劇情的規則,例如「不要替玩家角色決定行動」或「每次回覆不超過兩段短文」。把規則放在角色卡或共用提示詞中,在開場、場景轉換後及長對話後都檢查。比較期間不要更改規則。漏掉一次指令可能來自提示詞位置、上下文截斷或模型表現;單看對話不一定能判斷原因。
依照場景選擇測試重點
不同 RP 任務會暴露不同問題。先決定你在意什麼,不要用一個總分藏起取捨。
| 主要用途 | 第一個測試 | 可保留的條件 | 停止或調整的條件 |
|---|---|---|---|
| 短篇角色聊天 | 用熟悉口吻進行三次來回,明確保留玩家回合 | 符合卡片,也留下可接續的選擇 | 每輪都要糾正,或很快變得制式 |
| 慢熱關係 | 先建立小承諾,幾輪後自然回扣 | 關係隨具體互動發展,沒有強行升溫 | 忘記承諾或一直重演同一情緒 |
| 懸疑或冒險 | 早期給一條線索,再增加限制 | 使用相關線索,也讓玩家自行決定 | 捏造線索或擅自替玩家結案 |
| 設定密集的長篇 | 把幾項事實放在提示詞不同位置,再自然詢問 | 重要細節仍可取用,前端也有持續送出 | 設定擠滿提示詞,或後續取不到細節 |
| 多角色場景 | 為兩位角色設定差異並測試對話 | 聲音容易分辨,輪替清楚 | 人物混聲,或搞錯誰知道什麼 |
| 嚴格保留玩家主導 | 加一條明確的玩家控制規則 | 只推進模型角色和環境 | 替玩家敘述想法或決定 |
以上是測試場景,不是 Kimi K2 在任何類型上的成敗結論。短聊天也許可接受較低的連貫性分數,長篇戰役未必。停止標準要符合修正成本:改一個措辭可能沒關係,虛構雙方關係史則可能讓整次測試失效。
區分模型與 SillyTavern、供應商設定
角色扮演前端會實際改變提示詞。角色卡、範例對話、世界書、作者備註和近期聊天都可能被組合後再送出。SillyTavern 的 API Connections 文件說明,Chat Completions 與 Text Completions 是不同的提示詞建構方式,不代表「雲端」與「本機」的區別。endpoint 和部署方式是另一層。
回覆不理想時,依序檢查:確認選到正確 model ID;確認提示詞按預期包含角色卡和歷史且沒有重複;核對上下文與輸出限制;最後才調整生成設定。若路由套用不同範本或提前截斷歷史,調 temperature 可能只掩蓋症狀。
連線步驟見Kimi K2 SillyTavern 設定指南。Kimi K3 SillyTavern 指南和Kimi K3 設定指南討論不同型號,不能當成 K2 專用步驟。尋找比較對象時,可參考DeepSeek V3.2 角色扮演、Mistral 24B SillyTavern 指南、GLM-5.3 SillyTavern 指南與Gemma 4 SillyTavern 指南。使用同一張卡自行比較,不要把不同文章當作對照實驗。
Tabbit 可當作整理工作區,把官方模型文件、供應商說明與個人測試紀錄放在一起。這只是文件整理用途,不代表 Tabbit 託管原版 Kimi K2、提供 K2 選模器,或曾用來完成本文測試。本文沒有 K2 的 Tabbit 對話或 RP 結果。
結論:讓實際路由通過你的測試
現有一手資料只能確認 Kimi-K2-Instruct 的有限資訊:模型卡將它描述為通用聊天與 Agent 模型,列出 128K 上下文,並提供本機服務範例。這些資料無法回答它能否在長場景中持續演好一個角色。本次研究也沒有可讀取的社群原文、合格截圖或控制測試,因此不能選出 RP 贏家。
只有當你真正會使用的路由達到自己對聲音、連貫性、指令遵循與節奏的最低要求時,才選 K2。未通過時先保存紀錄,一次檢查一層:路由、提示詞組裝、可用上下文,再來才是角色卡或生成設定。短測通過後,也要多跑一段對話再開始長篇;六輪能找出摩擦,但不能證明長時間可靠。
下一步很明確:複製 endpoint 的準確 model ID,用熟悉的角色卡送出相同開場,保存六輪,再做決定。測試當下重看官方模型卡與供應商文件,因為路由和限制可能改變。本稿仍是草稿,直到社群證據與圖片門檻通過。
常見問題
Kimi K2 適合角色扮演嗎?
官方模型卡稱 Kimi-K2-Instruct 是通用聊天模型,但沒有評估角色表現。請用準確版本、角色卡和供應商做短測試。
本文指哪個版本?
主要指原版 Kimi-K2-Instruct;K2.5、K2.6、K2.7 Code 和 K3 是不同型號。
128K 上下文能保證記憶嗎?
不能。上下文是容量規格,連貫性需要透過多輪驗證。
可以本機執行嗎?
官方模型卡列出 vLLM 和 SGLang 路徑;硬體需求視設定而定。
如何與其他模型比較?
固定角色卡、開場、供應商和輪數,分別記錄口吻、連貫性、節奏與重複。