如果你需要長上下文、開放權重或低成本 Agent 路線,LongCat 2.0 值得小規模試用。但它不是單純的「便宜前沿模型」:路線、工具協議、資料條款與人工複核,和 token 單價一樣重要。
本文以 2026 年 6 月 30 日官方發布,以及 2026 年 9 月 20 日查看的模型卡為時間錨點:總參數 1.6T、啟用約 480 億、100 萬 token 上下文和 MIT 授權。當日 OpenRouter 快照的輸入/輸出價格為每百萬 token 0.30/1.20 美元。這些數字不同於 Tabbit 會話、自託管機器或一方帳戶。先讀 LongCat 2.0 模型頁 (简体中文),再按風險和任務選擇路線。
先看結論
官方提供開放權重、100 萬上下文,以及 Transformers、vLLM、SGLang 部署例子。
官方分數能說明測試涵蓋範圍,但不是中立排行榜;測試工具和任務集由發布方說明。
OpenRouter 的低價是有日期的供應商快照,不能代替資料政策、快取和穩定性核查。
社群既有稱讚它像可靠工作馬的經驗,也有程式錯誤、長文重複和工具接入問題。
放進 Agent 循環前,準備小型儲存庫、停止條件和人工驗收。
規格與入口
| 問題 | 2026-09-20 查看內容 | 不能直接推出的事 |
|---|---|---|
| 模型形態 | 稀疏專家混合;總參數 1.6T、啟用約 48B | 啟用參數不等於你的延遲或總成本。 |
| 上下文 | 官方卡片和 OpenRouter 均列 1M | 客戶端、序列化和記憶策略可能降低可用長度。 |
| 權重 | 官方列出 MIT 與下載權重 | 硬體、服務、升級和安全仍由你負責。 |
| 程式訊號 | Terminal-Bench 2.1 70.8、SWE-Bench Pro 59.5 | 不保證你的儲存庫和工具結果。 |
| API 快照 | OpenRouter 顯示輸入/輸出 $0.30/$1.20,列 AtlasCloud | 價格、供應商與遙測會變動。 |
用 什麼是 Agent 瀏覽器 區分瀏覽器助手和 API 封裝;需要比較時看 AI 瀏覽器比較,工作流可看 Tabbit Browser 實務。
主要變化與測試條件
技術公告介紹 LongCat Sparse Attention,包含串流感知、跨層和階層索引;模型卡還提到 135B N-gram Embedding,以及在數千億個 100 萬上下文 token 上訓練。其目標是讓長程式碼庫、研究資料和 Agent 軌跡更容易留在工作窗口,而不是讓每個 token 都使用相同的注意力成本。
官方列出 Claude Code、OpenClaw 和 Hermes 整合,也提供 Transformers、vLLM、SGLang 範例。這表示發布方重視程式庫編輯和工具任務,但不代表每個 harness 都能解析相同工具呼叫包裝。任務材料可看 LongCat prompts (简体中文),本文不複製系統提示詞。
官方表格列出 Terminal-Bench 2.1 70.8、SWE-Bench Pro 59.5、SWE-Bench Multilingual 77.3、FORTE 73.2、BrowseComp 79.9、RWSearch 78.8 和 IFEval 90.0。官方卡片說未標星分數來自統一內部 harness;技術公告補充 Terminal-Bench 使用 Claude Code、8c16g 沙箱和 6 小時 Agent 超時,SWE-Bench 使用 4c8g 並修正問題任務,FORTE 則是 15 個職業、45 分鐘任務、2 CPU/4GB 和最多十次重試。這些條件有助於重現,但仍不是獨立複測。詳細證據見 LongCat review (简体中文)。
四條路線不要混在一起
自託管適合不能離開控制範圍的程式碼和文件,但你要負責硬體、量化、批次、監控、升級和安全。API 路線要確認地區、付款、到期、發票、保留、訓練和 SLA;eesel 的 2026-08-04 文章是問題清單,不是今日的一方發票。
2026-09-20 的 OpenRouter 頁面顯示輸入/輸出 $0.30/$1.20、快取讀取 $0.006、1M 上下文和 AtlasCloud 單一供應商,也展示動態延遲和可用性。供應商帳單不等於自託管成本,也不是品質保證。
Tabbit 是另一個產品會話,選擇器、配額、上下文政策和資料合約可能獨立變化。本次沒有登入執行 LongCat 任務,也沒有合格截圖,所以不聲稱 Tabbit 內的品質、延遲、可用性或價格。可先看 瀏覽器自動化。
社群觀察、風險與場景
7 月 Reddit 使用者報告約 50M token 花費約 2 美元;沒有帳單、地區或重複樣本。8 月角色扮演使用者稱讚指令遵循與連貫性,但指出長故事會重複,並擔心電話要求和資料處理。X 的物理加程式測試稱 LongCat 的視覺物理結果最好,但沒有完整 prompt 或評分規則。eesel 還轉述 Agent 建構應用的正面經驗與程式 bug 的負面經驗。這些內容支持小規模試驗,不支持通用排名;可用 Agent 深度研究 設計自己的驗收。
發布前仍要確認保留、訓練、駐留與 SLA;<longcat_tool_call> 是否被你的 harness 識別;英文查詢是否穩定返回目標語言;以及自託管的硬體、電力、監控和重試成本。1M 是最大窗口,不是低價或穩定承諾。
| 場景 | 第一個測試 | 不要假設 |
|---|---|---|
| 平台團隊 | 在隔離環境執行量化版本,記錄顯存、吞吐和驗收 | 模型卡例子就是容量計畫。 |
| 程式 Agent | 小儲存庫、固定 diff 和測試,逐一檢查工具 | SWE-Bench 分數等於你的程式碼品質。 |
| 研究/RAG | 有日期的文件集和引用評分 | 長上下文消除檢索問題。 |
| 隱私敏感企業 | 先取得目前條款的書面確認 | FAQ 沒寫就是安全。 |
Tabbit 的下一步與結論
若帳戶顯示 LongCat 2.0,可先開啟公開文件頁,要求提取五點和來源連結,再人工核對。第一次不要授予寫入權限或上傳機密資料。記錄模型 ID、日期、路線、上下文、延遲、工具事件、重試和修正結果;若沒有選擇器,那是產品可用性結果,不要用 API 測試取代。
LongCat 2.0 是值得試點的長上下文工作模型。開放權重和有日期的供應商快照降低實驗門檻,但工具相容性、實際品質和資料條款仍需在真正路線中確認。選擇自託管、API、OpenRouter 或 Tabbit 時,請比較完整營運合約,不要只看輸入 token 單價。更多條件見 LongCat 評測集合 (简体中文)。
來源
常見問題
LongCat 2.0 是什麼?
LongCat 2.0 是美團發布的 MIT 授權稀疏專家混合模型。官方卡片報告總參數 1.6 兆、每個 token 約啟用 480 億參數,並提供 100 萬 token 上下文。
LongCat 2.0 是開源模型嗎?
官方 Hugging Face 卡片以 MIT 授權發布權重,並列出 Transformers、vLLM 與 SGLang 部署方式。開放權重不代表硬體、營運和支援沒有成本。
LongCat 2.0 的價格是多少?
2026 年 9 月 20 日查看的 OpenRouter 頁面顯示輸入每百萬 token 0.30 美元、輸出 1.20 美元。這是供應商快照,不是所有一方路線或 Tabbit 的統一報價。
LongCat 2.0 適合程式 Agent 嗎?
官方表格在其說明的條件下列出 Terminal-Bench 2.1 70.8 和 SWE-Bench Pro 59.5。社群回饋不一致,應先用可回滾的儲存庫和驗收測試試跑。
LongCat 2.0 會保護 API 資料嗎?
本次查看的公開資料沒有建立完整的保留、訓練、資料駐留或 SLA 政策。傳送機密程式碼或文件前,請向實際供應商確認條款。
可以在 Tabbit 使用 LongCat 2.0 嗎?
本文沒有執行已登入的 LongCat 2.0 Tabbit 任務。請查看即時選擇器和帳戶條款,不要假設 API 費用、配額或可用性會自動沿用。