Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

LongCat 2.0 · 媒体来源 · 厂商自报

LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)

官方技术博客给出了 LongCat-2.0 的完整技术底稿(LSA 稀疏注意力、N-gram Embedding、国产算力 6D 并行训练、prefill-decode 分离部署),可用于判断模型的长上下文/Agent 能力设计意图,以及复现官方基准与部署路径。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源厂商自报编辑日期 2026-09-20

测试条件速查

模型/版本
LongCat-2.0;来源日期:2026-06-30。
harness/任务
发布口径(与模型卡一致);1.6T 总参数、每 token 激活约 48B 的 MoE;完整训练与大规模部署全部使用国产算力集群。
样本/缺口
局限记录:适用边界:博客是工程说明而非独立测评,官方吞吐/可靠性数字(如故障率降 70%+)无第三方复核;部署方案面向超大规模集群,对个人开发者仅有 SGLang cookbook 参考价值。;关联文档:测评 01(官方基准表)、测评 04(AlphaSignal 核查)。

关键数据与适用场景

一句话结论

官方技术博客给出了 LongCat-2.0 的完整技术底稿(LSA 稀疏注意力、N-gram Embedding、国产算力 6D 并行训练、prefill-decode 分离部署),可用于判断模型的长上下文/Agent 能力设计意图,以及复现官方基准与部署路径。

官方核心内容

发布口径(与模型卡一致)

  • 1.6T 总参数、每 token 激活约 48B 的 MoE;完整训练与大规模部署全部使用国产算力集群。

  • 预训练:5 万余国产算力芯片、耗时月余、35T+ tokens、全程无回滚、无不可恢复 loss 突刺。

  • 长程能力:LongCat 稀疏注意力 + 数千亿 tokens 的百万上下文数据训练 + 专门后训练 → 编程与智能体任务表现强劲。

  • 深度适配 Claude Code、OpenClaw、Hermes;在线体验 https://longcat.chat;API 接入 https://longcat.chat/platform/docs/。

架构升级(官方原文要点)

  1. LongCat 稀疏注意力(LSA)——由 DeepSeek 稀疏注意力(DSA)演进,针对 DSA 中 Lightning Indexer 的"索引输出不连续 + 二次方索引评分"瓶颈:

    • Streaming-aware Indexing (SI):硬件对齐连续访问 + 动态随机选择,碎片化显存访问转顺序读取,合并 HBM 访问。

    • Cross-Layer Indexing (CLI):相邻层注意力显著 Token 分布一致,一次索引供多个连续层复用(训练期跨层蒸馏支撑)。

    • Hierarchical Indexing (HI):两阶段由粗到细打分(block 级粗召回 → 候选内细选),按需启用。

    • 三组件正交、可独立开关;全部扩展到 3-step MTP 投机解码(Target 模型每 2 层共享索引;3 个 draft 步共用一次索引)。

  2. N-gram Embedding:继承自 LongCat-Flash-Lite;n-gram size=5,135B 参数;将 embedding 空间扩展超 100 倍。扩展原则:MoE 稀疏度已过甜点(~97%),N-gram 占比约束在最优区间(<10% 总参数;实验显示 >50% 时优势消失)。

训练(国产算力基建)

  • 6D 并行:TP/CP/EP/DP/PP 之外引入 EMBP 并行 N-gram Embedding。

  • 超节点:物理超节点最多 48 台机器,节点内全互联、节点间 RoCE;带来约 30% 预训练吞吐提升。

  • 显存优化:ZeRO-1、选择性重计算、OOM 自动卸载、填充词元路由至零计算专家。

  • Muon 优化器大规模部署(TP 并行、DP 状态去冗余、对称矩阵乘核函数专项优化)。

  • 长上下文:LSA 预热 forward-only + KL 损失;all-gather 上下文并行扩展至 512 路以上;计算通信重叠(ScMoE、top-k 索引与 KV all-gather 重叠)。

  • 可靠性:通信/计算双路径确定性算子;规约算子二叉树分段累加;比特翻转检测;故障自动识别/切流/恢复,修复链路压测后复用。

推理与部署(服务层)

  • 显存受限下百万上下文推理:absorb 计算模式(prefill/decode)、indexer 与 MLA prolog 并行、KV-cache 并行(KVP)切分多卡;ScMoE 用控核能力让 dense 流与 MoE 流完全并行;super kernel 减算子启动开销;Weight Prefetch 利用大 L2 cache 隐藏 I/O 延迟;200Gbps 网卡 layer-wise KV-cache 传输。

  • 部署:prefill–decode(PD)分离;Prefill 节点用多节点 Chunked Pipeline Parallel (CPP) 缩小 Expert-Parallel 域 + Attention Sequence Parallelism (SP);Decode 节点用 KVP 切 KV-cache。

  • 官方部署入口:GPU 用 SGLang cookbook,NPU 用 SGLang-FluentLLM;权重在 GitHub https://github.com/meituan-longcat/LongCat-2.0 与 HF 发布(MIT)。

复核与适用边界

  • 博客与模型卡同源(同团队、同日发布),技术细节互为印证;与 AlphaSignal 的独立解读(测评 04)在 LSA 三策略、N-gram、MOPD 三专家组等描述上一致(AlphaSignal 补充:N-gram 约 128B vs 官方 135B,存在小口径差)。

  • 博客未点名芯片厂商("国产算力芯片");社区据官方致谢 HCCL(华为通信库)推断为华为 Ascend 910C(r/LocalLLaMA 讨论,见测评 14),属推断而非官方确认。

  • 适用边界:博客是工程说明而非独立测评,官方吞吐/可靠性数字(如故障率降 70%+)无第三方复核;部署方案面向超大规模集群,对个人开发者仅有 SGLang cookbook 参考价值。

  • 关联文档:测评 01(官方基准表)、测评 04(AlphaSignal 核查)。

能支持的判断

  • 博客与模型卡同源(同团队、同日发布),技术细节互为印证;与 AlphaSignal 的独立解读(测评 04)在 LSA 三策略、N-gram、MOPD 三专家组等描述上一致(AlphaSignal 补充:N-gram 约 128B vs 官方 135B,存在小口径差)。
  • 博客未点名芯片厂商("国产算力芯片");社区据官方致谢 HCCL(华为通信库)推断为华为 Ascend 910C(r/LocalLLaMA 讨论,见测评 14),属推断而非官方确认。

不能支持的判断

  • 适用边界:博客是工程说明而非独立测评,官方吞吐/可靠性数字(如故障率降 70%+)无第三方复核;部署方案面向超大规模集群,对个人开发者仅有 SGLang cookbook 参考价值。
  • 关联文档:测评 01(官方基准表)、测评 04(AlphaSignal 核查)。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

LongCat 官网博客(longcat.chat) · 美团 LongCat 团队(官方) · 原文发布日期 2026-06-30 · 本站编辑日期 2026-09-20

打开原始来源

LongCat 2.0

在 Tabbit 中比较 LongCat 2.0

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

LongCat 2.0:变化、使用方式,以及低价没有告诉你的事

LongCat 2.0 提供 100 万上下文、开放权重和低价 API,但工具兼容、数据条款与实际运维成本仍需单独核实。

相关评测

LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)官方模型卡是判断 LongCat-2.0 适用任务的第一手权威依据:它在 SWE-bench Pro(59.5)超过 GPT-5.5(58.6)与 Gemini 3.1 Pro(54.2),Terminal-Bench 2.1 达 70.8,但在 BrowseComp/GPQA/IFEval 等多项上落后于 GPT-5.5 与 Claude Opus 4.8——即"编码与 Agent 任务强、检索与通用推理非顶尖"。eesel 独立核查:LongCat-2.0 的 Agent 可靠性与生产接入硬阻塞这篇独立核查把 LongCat-2.0 拆成“模型能否完成 Agent 工作”和“产品能否进入企业生产”两件事:公开用户报告支持其作为便宜、稳定的编码执行器,但上下文规格、工具契约和数据治理文档不足以通过敏感数据生产审核。OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)OpenRouter 页面提供了官方之外的第三方口径:LongCat-2.0 标价 $0.30/$1.20 per 1M(采集时 60% 折扣),实际加权成交输入价仅 $0.03872/M(缓存命中率 88.9%),吞吐 P50 29 tok/s、3 天可用性 99.93%,工具调用错误率 0.90%,且真实流量主要来自 Hermes Agent(7.77B tokens)与 Claude Code(3.31B tokens)。AI Profit Boardroom 实测:LongCat 2.0 游戏构建测试与 GLM 5.2 同任务对比作者自测结论与多数社区口碑相反:LongCat 2.0 做的游戏"可玩但粗糙有 bug"(一个构建甚至全黑屏),同任务下 GLM 5.2 的产物"更干净、更流畅、更精致",因此他的建议是"值得玩玩、不值得切换"——这是对 LongCat 2.0 偏负面的独立样本,需与正面证据并读。LongCat-2.0 聊天模板与工具调用配置(官方 Hugging Face 模型卡)The official model card’s chat template and tool-call examples are converted into a local inference configuration check.Claude Code 接入 LongCat-2.0 配置(官方文档)The LongCat Claude Code guide configures a compatible endpoint and keeps the first task in a disposable worktree.Hermes Agent 接入 LongCat-2.0 配置(官方文档 + Nous Portal 免费入口)来源「Hermes Agent 接入 LongCat-2.0 配置(官方文档 + Nous Portal 免费入口)」整理为可执行的任务指南;运行环境、输入与验收边界按该来源保留。OpenClaw 接入 LongCat-2.0 配置(官方文档)来源「OpenClaw 接入 LongCat-2.0 配置(官方文档)」整理为可执行的任务指南;运行环境、输入与验收边界按该来源保留。