OpenRouter(第三方模型路由平台)平台遥测
OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)
OpenRouter 页面提供了官方之外的第三方口径:LongCat-2.0 标价 $0.30/$1.20 per 1M(采集时 60% 折扣),实际加权成交输入价仅 $0.03872/M(缓存命中率 88.9%),吞吐 P50 29 tok/s、3 天可用性 99.93%,工具调用错误率 0.90%,且真实流量主要来自 Hermes Agent(7.77B tokens)与 Claude Code(3.31B tokens)。
- 证据类型
- 平台遥测
- 边界
- Artificial Analysis 的 Coding Index 45.3(优于 49% 模型)明显低于官方 SWE-bench Pro 59.5 的观感——两者基准集不同,第三方指数对 LongCat 的排序并不靠前,是判断"适合哪些任务"的重要修正项。
Hugging Face(meituan-longcat/LongCat-2.0)厂商自报
LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)
官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。
- 证据类型
- 厂商自报
- 边界
- 落后项:FORTE/RWSearch/BrowseComp 全面落后 GPT-5.5(77.8/85.3/84.4 vs 73.2/78.8/79.9);GPQA-diamond、IFEval 落后 GPT-5.5 与 Gemini 3.1 Pro;Claude Opus 4.8 在 SWE-bench Pro(69.2)上领先 LongCat 近 10 分。
LongCat 官网博客(longcat.chat)厂商自报
LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)
官方技术博客给出了 LongCat-2.0 的完整技术底稿(LSA 稀疏注意力、N-gram Embedding、国产算力 6D 并行训练、prefill-decode 分离部署),可用于判断模型的长上下文/Agent 能力设计意图,以及复现官方基准与部署路径。
- 证据类型
- 厂商自报
- 边界
- 适用边界:博客是工程说明而非独立测评,官方吞吐/可靠性数字(如故障率降 70%+)无第三方复核;部署方案面向超大规模集群,对个人开发者仅有 SGLang cookbook 参考价值。