LongCat 2.0

LongCat 2.0 模型测评导航

汇总 LongCat 2.0 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。

15 条已核对来源的资料官方 · 媒体 · 社区

媒体

7 条已核对来源的资料
媒体Hugging Face(meituan-longcat/LongCat-2.0)

LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)

官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。

媒体LongCat 官网博客(longcat.chat)

LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)

官方技术博客给出了 LongCat-2.0 的完整技术底稿(LSA 稀疏注意力、N-gram Embedding、国产算力 6D 并行训练、prefill-decode 分离部署),可用于判断模型的长上下文/Agent 能力设计意图,以及复现官方基准与部署路径。

媒体OpenRouter(第三方模型路由平台)

OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)

OpenRouter 页面提供了官方之外的第三方口径:LongCat-2.0 标价 $0.30/$1.20 per 1M(采集时 60% 折扣),实际加权成交输入价仅 $0.03872/M(缓存命中率 88.9%),吞吐 P50 29 tok/s、3 天可用性 99.93%,工具调用错误率 0.90%,且真实流量主要来自 Hermes Agent(7.77B tokens)与 Claude Code(3.31B tokens)。

媒体aiprofitboardroom.com(博客,属 Julian Goldie 的 AI Profit Boardroom 社区)

AI Profit Boardroom 实测:LongCat 2.0 游戏构建测试与 GLM 5.2 同任务对比

作者自测结论与多数社区口碑相反:LongCat 2.0 做的游戏"可玩但粗糙有 bug"(一个构建甚至全黑屏),同任务下 GLM 5.2 的产物"更干净、更流畅、更精致",因此他的建议是"值得玩玩、不值得切换"——这是对 LongCat 2.0 偏负面的独立样本,需与正面证据并读。

媒体BenchLM.ai(第三方模型对比聚合站)

BenchLM 对比页:GPT-5.5 vs LongCat-2.0——"无共享基准,无法给出质量结论"的边界说明

截至 2026-08-17,BenchLM 认为 GPT-5.5 与 LongCat-2.0 之间没有任何共享的第三方基准结果(GPT-5.5 有 38 条、LongCat-2.0 为 0 条),因此"公开证据不支持任何质量结论"——这是对"LongCat 2.0 击败 GPT-5.5"类说法的权威边界提示:官方 SWE-bench Pro 59.5>58.6 尚未被任何独立来源复测。

媒体eesel AI Blog

eesel 独立核查:LongCat-2.0 的 Agent 可靠性与生产接入硬阻塞

这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。

媒体Hacker News

Hacker News 单题对比:LongCat-2.0 的科学推理错误与测试设计边界

Hacker News 的单题对比给出一个可复现但不能排名的警告样本:LongCat-2.0 在一个核燃料选择问题上给出作者判定为错误的理由,Qwen 3.7 Plus 与 Gemini Flash 给出不同答案;评论区则指出题目语义、事实背景和 n=1 设计都不足以支持普遍结论。

社区

8 条已核对来源的资料
社区X(Twitter)Articles(AlphaSignal)

AlphaSignal 深度核查:Owl Alpha 真身与 LongCat-2.0 官方宣称的现实检验

这篇发布次日发布的深度核查给出最关键的背景事实——OpenRouter 上匿名跑了两个月的免费模型 "Owl Alpha" 就是 LongCat-2.0(月处理约 10 万亿 tokens、Hermes Agent 榜单第一)——同时逐条拆解官方宣称:SWE-bench Pro 险胜 GPT-5.5 是官方自测、权重发布当时还是"计划"、开源界真正的对手是 GLM-5.2(62.1 vs 59.5)。

社区Reddit(r/SillyTavernAI)

r/SillyTavernAI 实测:LongCat 2.0 一周角色扮演(写作/越狱/重复倾向)

一周角色扮演实测显示 LongCat 2.0 在创意写作上"中了大奖":指令遵循忠实、故事连贯、无硬性拒答、叙述中立不煽情,但有两个明显毛病——对给定信息过度忠实导致重复惯性、以及需要非常具体的要求才能触达越狱内容(作者被迫使用极强的 jailbreak 提示词)。

社区Reddit(r/hermesagent)

r/hermesagent PSA:LongCat 2.0 推理档位 Bug 与模型定位(DeepSeek V4 Flash/Pro 之间)

实测确认 LongCat-2.0 的 API 只接受 low/med/high 三档 reasoning effort,收到其他档位(如 DeepSeek 系的 xhigh)会返回畸形 200 响应而非报错,导致 Hermes Agent 静默回退到 fallback provider;同一用户还给出能力定位:介于 DeepSeek-V4-Flash 与 DeepSeek-V4-Pro 之间、缓存好、PAYG 便宜。

社区Reddit(r/vibecoding)

r/vibecoding 实测:LongCat 2.0 定价"疯狂"——缓存命中免费的真实账单

用户实测 2 美元 5000 万 tokens 包:一次任务提示词 2700 万 tokens,因缓存命中只扣了 57 万 tokens——官方"缓存命中不计费、只扣未命中与输出"的规则在真实 Agent 工作流里把有效用量放大到约 2B tokens,是 LongCat 定价最反直觉的地方。

社区X(Twitter)

X 实测:DeepSeek V4 Flash / V4 Pro / LongCat 2.0 三模型同任务物理+编程测试

开发者把 DeepSeek V4 Flash 0731、DeepSeek V4 Pro 与 LongCat 2.0 放进同一个"物理 + 编程"测试(相同任务、相同条件),结果中"最让他惊讶的是 LongCat 2.0"——表现比他预期成功得多,且这是他第一次在免费档位上遇到它。

社区X(Twitter)

X(atomic.chat)对比:LongCat 2.0 vs GPT-5.5 同任务代理式游戏开发(Duck Hunt)

在 Kilo Code CLI 中让 LongCat 2.0(开源权重、本地/免费运行)与 GPT-5.5(云端付费)执行同一个任务——3 次 Agent 迭代把 game.html 里的复古 Duck Hunt 游戏做到含鸭子波次、弹药与物理——两者产物质量"运行流畅、无剪切问题、图形/物理/游戏逻辑同步",唯一区别是账单:LongCat 0 美元 vs GPT-5.5 $0.65。

社区Reddit(r/AIToolsPerformance)

r/AIToolsPerformance:LongCat 2.0 与 Kimi K3 等 1M 上下文模型的价格对比讨论

发布当天社区就注意到:同样是 1M 上下文,LongCat 2.0($0.30/$1.20)比 Kimi K3($3.00/$15.00)输入便宜约 10 倍、输出便宜约 12 倍,是当时 OpenRouter 上"最便宜的 1M+ 上下文模型"——但帖子同时提醒:列表页没有任何质量数据,"激进定价可能是抢份额,也可能是真高效"。

社区Reddit(r/LocalLLaMA)

r/LocalLLaMA 讨论:权重发布、下载体积与"AI ASIC superpods"国产算力猜测

r/LocalLLaMA 从发布起就盯住两件事:权重与量化(BF16 全量 3.55TB、FP8 2.05TB,官方出 INT8/FP8 量化版)和"AI ASIC superpods"到底是谁家的芯片(社区据华为 HCCL 致谢与 superpod 术语推断为华为 Ascend 910C),这些是判断 LongCat-2.0 可落地性的重要社区信息。

LongCat 2.0

在 Tabbit 中使用并对比模型

汇总 LongCat 2.0 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。