Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
提示词
社区LongCat Flash Thinking

LongCat-Flash-Thinking-2601:官方 SGLang/vLLM 部署与 MTP 配置

原始来源

GitHub

作者Meituan LongCat Team / LongCat repository maintainers

Tabbit 整理2026-08-19

查看原文

一句话结论

官方部署指南给出了 LongCat-Flash-Thinking-2601 在 SGLang 和 vLLM 上的单机、多机及 Multi-Token Prediction(MTP)启动参数,可作为复现部署的起点。

适用场景

  • 适合的任务:自托管 560B MoE 权重、工具 Agent 服务和需要张量/专家并行的推理部署。

  • 不适合的任务:没有多卡节点、无法满足 FP8/BF16 显存要求,或希望直接在消费级单卡上运行的场景。

  • 适用的模型版本:LongCat-Flash-Thinking-2601 与官方 FP8 权重名。

  • 适用的客户端、Agent 或 API:SGLang、vLLM;需按实际集群替换主节点变量。

  • 推荐的推理档位和参数:先用单节点 FP8 配置验证服务,再按官方参数启用多节点;MTP 只在确认引擎版本支持后开启。

可直接使用的内容

官方指南称 FP8 至少需要一台 8×H20-141G 节点,BF16 至少需要两台 8×H800-80G 节点。以下命令来自页面,可据此建立最小部署配置。

SGLang:单节点 FP8

python3 -m sglang.launch_server \
    --model meituan-longcat/LongCat-Flash-Thinking-2601-FP8 \
    --trust-remote-code \
    --attention-backend flashinfer \
    --enable-ep-moe \
    --tp 8

vLLM:单节点 FP8

vllm serve meituan-longcat/LongCat-Flash-Thinking-2601-FP8 \
    --trust-remote-code \
    --enable-expert-parallel \
    --tensor-parallel-size 8

MTP 追加参数

SGLang:

--speculative-draft-model-path meituan-longcat/LongCat-Flash-Thinking-2601 \
--speculative-algorithm NEXTN \
--speculative-num-draft-tokens 2 \
--speculative-num-steps 1 \
--speculative-eagle-topk 1

vLLM:

--speculative_config '{"model": "meituan-longcat/LongCat-Flash-Thinking-2601", "num_speculative_tokens": 1, "method":"longcat_flash_mtp"}'

测试/工作流步骤

  1. 先确认下载的是官方 FP8 或 BF16 权重,并核对 SGLang/vLLM 版本是否包含 LongCat 适配。

  2. 在单节点上启动服务,先用短输入和无工具请求做连通性检查。

  3. 再接入工具调用和长上下文负载,记录显存、吞吐、首 token 延迟和专家并行稳定性。

  4. 只有基线稳定后再追加 MTP;将 MTP 开关前后的质量、延迟和错误率分开记录。

  5. 多节点时替换 $MASTER_IP、$NODE_RANK 等变量,并保留节点拓扑、并行度和权重精度。

原始证据与数据

  • 官方指南给出的硬件边界:FP8 至少 1 个 8×H20-141G 节点;BF16 至少 2 个 8×H800-80G 节点。

  • SGLang 单节点参数为 --enable-ep-moe --tp 8;vLLM 单节点参数为 --enable-expert-parallel --tensor-parallel-size 8。

  • 指南链接到 SGLang PR #9824 与 vLLM PR #23991,并明确称当前为 basic adaptations。

  • MTP 参数分别使用 SGLang 的 NEXTN 配置和 vLLM 的 longcat_flash_mtp 方法。

适用边界

  • 官方命令是部署模板,不是本次独立实测;没有给出具体吞吐、延迟、显存余量或服务并发数据。

  • 560B 总参数和 MoE 专家并行使硬件、驱动、通信拓扑和引擎版本成为关键变量;不能把“至少一节点”理解为任意 8 卡机器都能稳定运行。

  • 多节点命令中的 $MASTER_IP、$NODE_RANK 需要由部署者填写,不能原样复制到生产环境。

  • MTP 可能改变生成行为和速度,必须在目标任务上单独回归,不应默认开启。

来源摘录或观察(仅做合规短引)

指南把该适配描述为 “basic adaptations”,因此应把命令视为版本敏感的起始配置,而不是性能保证。

Tabbit 小编提醒

提示词内容来自公开资料与 Tabbit 编辑整理。引用前请查看原文授权与适用范围。

LongCat Flash Thinking

在 Tabbit 中使用

LongCat Flash Thinking

相关提示词

媒体Hugging Face

LongCat-Flash-Thinking-2601:官方聊天模板、工具调用与思维历史配置

LongCat Flash Thinking

相关测评

媒体arXiv

LongCat-Flash-Thinking-2601:Heavy Thinking、环境噪声与 Agent 基准

媒体LongCat API Platform2025-09-22

LongCat-Flash-Thinking:API 别名升级、自动路由与服务退役边界

社区Reddit / r/LocalLLaMA

LongCat-Flash-Thinking-2601:LocalLLaMA 社区的初步阅读与部署观察