这篇发布次日发布的深度核查给出最关键的背景事实——OpenRouter 上匿名跑了两个月的免费模型 "Owl Alpha" 就是 LongCat-2.0(月处理约 10 万亿 tokens、Hermes Agent 榜单第一)——同时逐条拆解官方宣称:SWE-bench Pro 险胜 GPT-5.5 是官方自测、权重发布当时还是"计划"、开源界真正的对手是 GLM-5.2(62.1 vs 59.5)。
Owl Alpha 匿名在 OpenRouter 运行两个月,开发者调用时不知道厂商与内部结构;发布时月处理约 10 万亿 tokens,超过 OpenRouter 上 Hermes Agent 榜单任何模型。
唯一非官方自报的证据:两个月的匿名使用量——"这是整个发布中最强的证据,也是美团唯一没有自己生成的一项"。
风险披露:Owl Alpha 的 OpenRouter 列表披露提示词与补全可能被提供方记录用于改进模型——免费用户两个月里在不知情的情况下喂养了训练信号。
零计算专家(Zero-Computation Experts):简单 token(变量名、括号)走近乎空的计算路径,难 token 走完整专家栈;按 token 路由而非按请求。
LSA:官方承认索引器本身成为新瓶颈(逐层逐 token 打分仍二次方、访存模式不匹配硬件预取);SI/CLI/HI 三招对应修复;风险是"错误路由把需要完整推理的 token 发到廉价路径时会静默失败",且没有公开数字说明发生频率。
N-gram Embedding:n-gram size 5、约 128B 参数(官方口径 135B)、有效词表扩展约 900 倍;MoE+N-gram 使有效稀疏度约 97%,N-gram 占比 <10%(>30% 后收益递减)。
MOPD:后训练分成 Agent / Reasoning / Interaction 三组专家,用门控网络在推理时按任务路由——"最可能真正新颖的部分",多数实验室只做权重平均合并。
官方称首次完全在国产集群训练万亿参数模型(约 5 万加速器、无 Nvidia),但未点名芯片商;官方致谢华为 HCCL 通信库,独立估算指向华为 Ascend 910C。
官方工程声明:月硬件故障率降 70%+、35T tokens 全程无回滚无不可恢复 loss 突刺——"在不成熟的非 CUDA 硬件上做到这点是真实成果"。
官方自测表中 LongCat-2.0 唯一稳定战胜的是 Gemini 3.1 Pro;对 GPT-5.5 仅 SWE-bench Pro 险胜(59.5 vs 58.6),其余全面落后(FORTE 73.2 vs 77.8、RWSearch 78.8 vs 85.3、BrowseComp 79.9 vs 84.4)。
Claude Opus 4.8 对 LongCat-2.0 是更大威胁:同测试 SWE-bench Pro 69.2(领先近 10 分),Opus 4.7 也有 64.3。
三项宣称逐条变薄:
权重当时未发布——GitHub 明写 "Model weights coming soon, stay tuned"(上线 10 小时仅 76 stars/4 forks);媒体"美团开源"是描述计划而非发布。(注:截至 2026-08-18,权重已在 HF 发布,此点已过期。)
最强开源对手 GLM-5.2 不在官方对比图上:GLM-5.2 同测试 SWE-bench Pro 62.1 > 59.5,且 MIT 权重早两周可下载。
官方图全为自家 harness、自家评分,且注明"problematic tasks corrected";截至发布无 Artificial Analysis、Scale 等任何独立第三方分数。
免费缓存命中对"反复重读同一上下文的 Agent"(单仓库编码 Agent、单长文档研究 Agent)最划算;一次性 one-shot 提示词几乎享受不到。
DeepSeek V4-Pro 标价仍低于 LongCat-2.0;想验证基准就用 GLM-5.2(权重可下载、SWE-bench Pro 更高);浏览、多步工具链、任务中判断仍由闭源前沿模型领先。
文章发布于 2026-07-01(发布次日),"权重未发布"与部分价格数据($0.69/$2.78 per 1M)已过时:权重现已在 HF 发布(提示词目录 02),官方当前定价为 ¥5/¥20(提示词目录 01),OpenRouter 现价 $0.30/$1.20(测评 03)。
文章是分析性评论而非受控测评,数字均转引自官方与平台,但"10 万亿 tokens/月""GLM-5.2 62.1"等关键数据未附独立原始来源链接(作者称 source links 在首条回复),引用时按第二手处理。
与官方文档(测评 01、02)结合阅读效果最佳:官方给全量细节,本文给批判框架。
LongCat 2.0