官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。
| Benchmark | LongCat-2.0 | Gemini 3.1 Pro | GPT-5.5 | Claude Opus 4.6 | Claude Opus 4.7 | Claude Opus 4.8 |
|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 70.8 | 70.7* | 73.8* | - | 71.7* | 78.9* |
| SWE-bench Pro | 59.5 | 54.2* | 58.6* | 57.3* | 64.3* | 69.2* |
| SWE-bench Multilingual | 77.3 | 76.9* | - | 77.8* | 80.5* | 84.8* |
| FORTE(通用 Agent) | 73.2 | 70.3 | 77.8 | 73.2 | 77.6 | 77.2 |
| BrowseComp | 79.9 | 85.9* | 84.4* | 84.0* | 79.3* | 84.3* |
| RWSearch | 78.8 | 76.3 | 85.3 | 81.3 | 79.3 | 77.3 |
| IFEval | 90.0 | 96.1 | 95.0 | 92.2 | 88.7 | 86.0 |
| Writing Bench | 83.8 | 83.7 | 84.7 | - | 85.3 | 85.2 |
| IMO-AnswerBench | 81.8 | 90.0 | 79.5 | 75.3* | 81.8 | 75.3 |
| GPQA-diamond | 88.9 | 94.3* | 93.6* | 91.3* | 94.2* | 92.4 |
注:* = 引用自对应模型官方报告;- = 无公开可比分数。
架构:MoE,1.6T 总参数,每 token 激活约 48B(动态 33B–56B,官方 X 账号口径);HF 元数据模型大小 1.8T(含 N-gram Embedding 135B、BF16)。
上下文:原生 1M tokens(在数千亿 tokens 的百万上下文数据上训练)。
关键特性:LongCat Sparse Attention(LSA,SI/CLI/HI 三项优化)、3-step MTP 投机解码、N-gram Embedding(n-gram size=5,135B 参数)。
训练:35T+ tokens,5 万余国产算力芯片(AI ASIC superpods),全程无回滚(官方博客口径)。
适配 Harness:Claude Code、OpenClaw、Hermes(官方明示"deeply integrated")。
许可证:MIT。
官方体验入口:https://longcat.ai;联系 longcat-team@meituan.com。
口径警示:全部分数为美团自测(自建 harness、自家评分,模型卡注明"problematic tasks corrected"——AlphaSignal 指出这意味着评分前人工修正过问题任务),标 * 的对比分数来自各家官方报告,跨实验室不可直接横向比较;截至 2026-07-01 无任何独立第三方(Artificial Analysis、Scale 等)发布过 LongCat-2.0 的复测分数(AlphaSignal 原文)。
相对强弱结论(多家独立解读一致):
领先项:SWE-bench Pro 59.5 > GPT-5.5 58.6、> Gemini 3.1 Pro 54.2;Terminal-Bench 2.1 与 Gemini 3.1 Pro 打平(70.8 vs 70.7);RWSearch、FORTE 超过 Gemini 3.1 Pro。
落后项:FORTE/RWSearch/BrowseComp 全面落后 GPT-5.5(77.8/85.3/84.4 vs 73.2/78.8/79.9);GPQA-diamond、IFEval 落后 GPT-5.5 与 Gemini 3.1 Pro;Claude Opus 4.8 在 SWE-bench Pro(69.2)上领先 LongCat 近 10 分。
综合:官方图表中 LongCat-2.0 唯一稳定战胜的是 Gemini 3.1 Pro(AlphaSignal 结论),对 GPT-5.5 仅 SWE-bench Pro 一项险胜。
任务适用判断:适合仓库级编码、终端交互、长上下文 Agent 工作流;不适合需要顶尖检索(BrowseComp)、科学推理(GPQA)与严格指令跟随(IFEval)的场景。
关联文档:测评 02(官方技术博客)、测评 03(OpenRouter 第三方口径)。
LongCat 2.0