官方部署指南给出了 LongCat-Flash-Thinking-2601 在 SGLang 和 vLLM 上的单机、多机及 Multi-Token Prediction(MTP)启动参数,可作为复现部署的起点。
适合的任务:自托管 560B MoE 权重、工具 Agent 服务和需要张量/专家并行的推理部署。
不适合的任务:没有多卡节点、无法满足 FP8/BF16 显存要求,或希望直接在消费级单卡上运行的场景。
适用的模型版本:LongCat-Flash-Thinking-2601 与官方 FP8 权重名。
适用的客户端、Agent 或 API:SGLang、vLLM;需按实际集群替换主节点变量。
推荐的推理档位和参数:先用单节点 FP8 配置验证服务,再按官方参数启用多节点;MTP 只在确认引擎版本支持后开启。
官方指南称 FP8 至少需要一台 8×H20-141G 节点,BF16 至少需要两台 8×H800-80G 节点。以下命令来自页面,可据此建立最小部署配置。
python3 -m sglang.launch_server \
--model meituan-longcat/LongCat-Flash-Thinking-2601-FP8 \
--trust-remote-code \
--attention-backend flashinfer \
--enable-ep-moe \
--tp 8vllm serve meituan-longcat/LongCat-Flash-Thinking-2601-FP8 \
--trust-remote-code \
--enable-expert-parallel \
--tensor-parallel-size 8SGLang:
--speculative-draft-model-path meituan-longcat/LongCat-Flash-Thinking-2601 \
--speculative-algorithm NEXTN \
--speculative-num-draft-tokens 2 \
--speculative-num-steps 1 \
--speculative-eagle-topk 1vLLM:
--speculative_config '{"model": "meituan-longcat/LongCat-Flash-Thinking-2601", "num_speculative_tokens": 1, "method":"longcat_flash_mtp"}'先确认下载的是官方 FP8 或 BF16 权重,并核对 SGLang/vLLM 版本是否包含 LongCat 适配。
在单节点上启动服务,先用短输入和无工具请求做连通性检查。
再接入工具调用和长上下文负载,记录显存、吞吐、首 token 延迟和专家并行稳定性。
只有基线稳定后再追加 MTP;将 MTP 开关前后的质量、延迟和错误率分开记录。
多节点时替换 $MASTER_IP、$NODE_RANK 等变量,并保留节点拓扑、并行度和权重精度。
官方指南给出的硬件边界:FP8 至少 1 个 8×H20-141G 节点;BF16 至少 2 个 8×H800-80G 节点。
SGLang 单节点参数为 --enable-ep-moe --tp 8;vLLM 单节点参数为 --enable-expert-parallel --tensor-parallel-size 8。
指南链接到 SGLang PR #9824 与 vLLM PR #23991,并明确称当前为 basic adaptations。
MTP 参数分别使用 SGLang 的 NEXTN 配置和 vLLM 的 longcat_flash_mtp 方法。
官方命令是部署模板,不是本次独立实测;没有给出具体吞吐、延迟、显存余量或服务并发数据。
560B 总参数和 MoE 专家并行使硬件、驱动、通信拓扑和引擎版本成为关键变量;不能把“至少一节点”理解为任意 8 卡机器都能稳定运行。
多节点命令中的 $MASTER_IP、$NODE_RANK 需要由部署者填写,不能原样复制到生产环境。
MTP 可能改变生成行为和速度,必须在目标任务上单独回归,不应默认开启。
指南把该适配描述为 “basic adaptations”,因此应把命令视为版本敏感的起始配置,而不是性能保证。
LongCat Flash Thinking