Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体LongCat 2.0

LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)

原始来源

Hugging Face(meituan-longcat/LongCat-2.0)

作者美团 LongCat 团队(官方)

原文日期2026-06-30

Tabbit 整理2026-08-19

查看原文

一句话结论

官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。

官方基准数据(模型卡原表,*为引用对方官方报告,未注明的为美团统一 harness 自测)

BenchmarkLongCat-2.0Gemini 3.1 ProGPT-5.5Claude Opus 4.6Claude Opus 4.7Claude Opus 4.8
Terminal-Bench 2.170.870.7*73.8*-71.7*78.9*
SWE-bench Pro59.554.2*58.6*57.3*64.3*69.2*
SWE-bench Multilingual77.376.9*-77.8*80.5*84.8*
FORTE(通用 Agent)73.270.377.873.277.677.2
BrowseComp79.985.9*84.4*84.0*79.3*84.3*
RWSearch78.876.385.381.379.377.3
IFEval90.096.195.092.288.786.0
Writing Bench83.883.784.7-85.385.2
IMO-AnswerBench81.890.079.575.3*81.875.3
GPQA-diamond88.994.3*93.6*91.3*94.2*92.4

注:* = 引用自对应模型官方报告;- = 无公开可比分数。

官方规格要点

  • 架构:MoE,1.6T 总参数,每 token 激活约 48B(动态 33B–56B,官方 X 账号口径);HF 元数据模型大小 1.8T(含 N-gram Embedding 135B、BF16)。

  • 上下文:原生 1M tokens(在数千亿 tokens 的百万上下文数据上训练)。

  • 关键特性:LongCat Sparse Attention(LSA,SI/CLI/HI 三项优化)、3-step MTP 投机解码、N-gram Embedding(n-gram size=5,135B 参数)。

  • 训练:35T+ tokens,5 万余国产算力芯片(AI ASIC superpods),全程无回滚(官方博客口径)。

  • 适配 Harness:Claude Code、OpenClaw、Hermes(官方明示"deeply integrated")。

  • 许可证:MIT。

  • 官方体验入口:https://longcat.ai;联系 longcat-team@meituan.com。

复核与适用边界

  • 口径警示:全部分数为美团自测(自建 harness、自家评分,模型卡注明"problematic tasks corrected"——AlphaSignal 指出这意味着评分前人工修正过问题任务),标 * 的对比分数来自各家官方报告,跨实验室不可直接横向比较;截至 2026-07-01 无任何独立第三方(Artificial Analysis、Scale 等)发布过 LongCat-2.0 的复测分数(AlphaSignal 原文)。

  • 相对强弱结论(多家独立解读一致):

    • 领先项:SWE-bench Pro 59.5 > GPT-5.5 58.6、> Gemini 3.1 Pro 54.2;Terminal-Bench 2.1 与 Gemini 3.1 Pro 打平(70.8 vs 70.7);RWSearch、FORTE 超过 Gemini 3.1 Pro。

    • 落后项:FORTE/RWSearch/BrowseComp 全面落后 GPT-5.5(77.8/85.3/84.4 vs 73.2/78.8/79.9);GPQA-diamond、IFEval 落后 GPT-5.5 与 Gemini 3.1 Pro;Claude Opus 4.8 在 SWE-bench Pro(69.2)上领先 LongCat 近 10 分。

    • 综合:官方图表中 LongCat-2.0 唯一稳定战胜的是 Gemini 3.1 Pro(AlphaSignal 结论),对 GPT-5.5 仅 SWE-bench Pro 一项险胜。

  • 任务适用判断:适合仓库级编码、终端交互、长上下文 Agent 工作流;不适合需要顶尖检索(BrowseComp)、科学推理(GPQA)与严格指令跟随(IFEval)的场景。

  • 关联文档:测评 02(官方技术博客)、测评 03(OpenRouter 第三方口径)。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

LongCat 2.0

在 Tabbit 中使用并对比模型

LongCat 2.0

相关测评

媒体LongCat 官网博客(longcat.chat)2026-06-30

LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)

媒体OpenRouter(第三方模型路由平台)2026-07-20

OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)

媒体aiprofitboardroom.com(博客,属 Julian Goldie 的 AI Profit Boardroom 社区)2026-05-29

AI Profit Boardroom 实测:LongCat 2.0 游戏构建测试与 GLM 5.2 同任务对比

媒体BenchLM.ai(第三方模型对比聚合站)2026-08-17

BenchLM 对比页:GPT-5.5 vs LongCat-2.0——"无共享基准,无法给出质量结论"的边界说明

LongCat 2.0

相关提示词

媒体LongCat 官方 API 文档站(longcat.chat)2026-07

LongCat-2.0 API 平台接入快速上手(官方 Quick Start + Chat Completions 参考 + 定价)

媒体Hugging Face2026-06-30

LongCat-2.0 聊天模板与工具调用配置(官方 Hugging Face 模型卡)

媒体LongCat 官方 API 文档站(longcat.chat);X(@NousResearch 官方账号佐证免费入口)2026-08-13

Hermes Agent 接入 LongCat-2.0 配置(官方文档 + Nous Portal 免费入口)

媒体LongCat 官方 API 文档站(longcat.chat)2026-06-30

Claude Code 接入 LongCat-2.0 配置(官方文档)