Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

LongCat 2.0 · 官方来源 · 平台遥测

OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)

OpenRouter 页面提供了官方之外的第三方口径:LongCat-2.0 标价 $0.30/$1.20 per 1M(采集时 60% 折扣),实际加权成交输入价仅 $0.03872/M(缓存命中率 88.9%),吞吐 P50 29 tok/s、3 天可用性 99.93%,工具调用错误率 0.90%,且真实流量主要来自 Hermes Agent(7.77B tokens)与 Claude Code(3.31B tokens)。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

官方来源平台遥测编辑日期 2026-09-20

测试条件速查

模型/版本
LongCat-2.0;来源日期:2026-07-20。
harness/任务
模型与定价;模型 ID:`meituan/longcat-2.0`(页面版本 20260720);48B 激活 / 1.6T 总参数 MoE;上下文 1M;仅文本。
样本/缺口
局限记录:Artificial Analysis 的 Coding Index 45.3(优于 49% 模型)明显低于官方 SWE-bench Pro 59.5 的观感——两者基准集不同,第三方指数对 LongCat 的排序并不靠前,是判断"适合哪些任务"的重要修正项。;单提供方(AtlasCloud)意味着无多路由冗余;99.93% 可用性为近 3 天快照。

关键数据与适用场景

一句话结论

OpenRouter 页面提供了官方之外的第三方口径:LongCat-2.0 标价 $0.30/$1.20 per 1M(采集时 60% 折扣),实际加权成交输入价仅 $0.03872/M(缓存命中率 88.9%),吞吐 P50 29 tok/s、3 天可用性 99.93%,工具调用错误率 0.90%,且真实流量主要来自 Hermes Agent(7.77B tokens)与 Claude Code(3.31B tokens)。

关键数据(2026-08-18 采集)

模型与定价

  • 模型 ID:meituan/longcat-2.0(页面版本 20260720);48B 激活 / 1.6T 总参数 MoE;上下文 1M;仅文本。

  • 标价:IN $0.30 / OUT $1.20 per 1M(60% off 限时);发布价 $0.30/$1.20(r/AIToolsPerformance 同日确认)。

  • 实际成交:加权平均输入 $0.03872/M、输出 $1.20/M(缓存与折扣使实际价远低于标价);提供方 AtlasCloud,缓存命中率 88.92%,Token 份额 100%(单提供方)。

  • 价格历史图显示 7 月 24 日至 8 月 18 日输入有效价在 0–$0.08/1M 区间波动。

性能与可用性

  • 吞吐:P50 29 tok/s(全时段平均);P99 54 / P95 46 / P90 42 / P75 35 tok/s。

  • 延迟:P50 1.82s;E2E P50 13.75s(P99 159.74s)。

  • 工具调用错误率:0.90%(AtlasCloud)。

  • Uptime 3 天 100.00%;Availability 99.93%;OpenRouter 自身可用性 99.85%。

第三方基准(Artificial Analysis,页面展示)

基准分数说明
Coding Index45.3优于 49% 的对比模型
GPQA Diamond78.0%研究生级科学推理
HLE(Humanity's Last Exam)33.7%综合难题
AA-LCR62.7%长上下文推理
GDPval-AA26.5%经济价值任务
CritPt2.6%研究级物理推理
SciCode35.4%科学计算编程
AA-Omniscience Accuracy29.6%知识问答正确率
AA-Omniscience 非幻觉率24.6%未答对时的防幻觉比例

真实应用流量(Apps 排行,反映生产用途)

  1. Hermes Agent — 7.77B tokens(Nous Research 开源 Agent)

  2. Claude Code — 3.31B tokens

  3. pi — 2.27B tokens

  4. Halluna — 1.84B tokens

  5. TokenTool — 1.49B tokens

复核与适用边界

  • 数据为平台实时遥测,可随时在原文链接复核;但价格折扣、可用性、基准分数都会随时间变化,引用需标注采集日期。

  • 与官方定价差异:OpenRouter 标价($0.30/$1.20)与官方直连定价(¥5/¥20 per 1M 原价)不是同一计费体系,且 OpenRouter 端缓存命中价显著摊薄实际成本;两者不可直接换算比较。

  • Artificial Analysis 的 Coding Index 45.3(优于 49% 模型)明显低于官方 SWE-bench Pro 59.5 的观感——两者基准集不同,第三方指数对 LongCat 的排序并不靠前,是判断"适合哪些任务"的重要修正项。

  • 单提供方(AtlasCloud)意味着无多路由冗余;99.93% 可用性为近 3 天快照。

  • 免费端点 meituan/longcat-2.0:free($0.00/1M)同时存在于 OpenRouter 与 Nous Portal 目录,是低成本试用的入口(见提示词目录 03、06)。

能支持的判断

  • 数据为平台实时遥测,可随时在原文链接复核;但价格折扣、可用性、基准分数都会随时间变化,引用需标注采集日期。
  • 与官方定价差异:OpenRouter 标价($0.30/$1.20)与官方直连定价(¥5/¥20 per 1M 原价)不是同一计费体系,且 OpenRouter 端缓存命中价显著摊薄实际成本;两者不可直接换算比较。

不能支持的判断

  • Artificial Analysis 的 Coding Index 45.3(优于 49% 模型)明显低于官方 SWE-bench Pro 59.5 的观感——两者基准集不同,第三方指数对 LongCat 的排序并不靠前,是判断"适合哪些任务"的重要修正项。
  • 单提供方(AtlasCloud)意味着无多路由冗余;99.93% 可用性为近 3 天快照。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

OpenRouter(第三方模型路由平台) · OpenRouter 平台遥测 + Artificial Analysis 评测数据 · 原文发布日期 2026-07-20 · 本站编辑日期 2026-09-20

打开原始来源

LongCat 2.0

在 Tabbit 中比较 LongCat 2.0

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

LongCat 2.0:变化、使用方式,以及低价没有告诉你的事

LongCat 2.0 提供 100 万上下文、开放权重和低价 API,但工具兼容、数据条款与实际运维成本仍需单独核实。

相关评测

LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)官方技术博客给出了 LongCat-2.0 的完整技术底稿(LSA 稀疏注意力、N-gram Embedding、国产算力 6D 并行训练、prefill-decode 分离部署),可用于判断模型的长上下文/Agent 能力设计意图,以及复现官方基准与部署路径。eesel 独立核查:LongCat-2.0 的 Agent 可靠性与生产接入硬阻塞这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。AlphaSignal 深度核查:Owl Alpha 真身与 LongCat-2.0 官方宣称的现实检验这篇发布次日发布的深度核查给出最关键的背景事实——OpenRouter 上匿名跑了两个月的免费模型 "Owl Alpha" 就是 LongCat-2.0(月处理约 10 万亿 tokens、Hermes Agent 榜单第一)——同时逐条拆解官方宣称:SWE-bench Pro 险胜 GPT-5.5 是官方自测、权重发布当时还是"计划"、开源界真正的对手是 GLM-5.2(62.1 vs 59.5)。LongCat-2.0 聊天模板与工具调用配置(官方 Hugging Face 模型卡)The official model card’s chat template and tool-call examples are converted into a local inference configuration check.Claude Code 接入 LongCat-2.0 配置(官方文档)The LongCat Claude Code guide configures a compatible endpoint and keeps the first task in a disposable worktree.Hermes Agent 接入 LongCat-2.0 配置(官方文档 + Nous Portal 免费入口)来源「Hermes Agent 接入 LongCat-2.0 配置(官方文档 + Nous Portal 免费入口)」整理为可执行的任务指南;运行环境、输入与验收边界按该来源保留。OpenClaw 接入 LongCat-2.0 配置(官方文档)来源「OpenClaw 接入 LongCat-2.0 配置(官方文档)」整理为可执行的任务指南;运行环境、输入与验收边界按该来源保留。