这份 Cookbook 给出了 LongCat-2.0-FP8 在 B300、B200、H200、H20 上用 SGLang 启动、调参和验证的可复用路径,适合先按已验证拓扑部署,再逐步打开实验性并行选项。
适合的任务:自托管 LongCat-2.0-FP8;多卡/多节点推理;需要 OpenAI 兼容接口、长上下文和可控思考开关的服务
不适合的任务:单张消费级 GPU;没有多卡集群或无法承担 FP8 权重存储的快速试用
适用的模型版本:meituan-longcat/LongCat-2.0-FP8
适用的客户端、Agent 或 API:SGLang server、OpenAI SDK、cURL;部署后通过本地 /v1/chat/completions
推荐的推理档位和参数:先使用 Balanced 验证矩阵;服务端保留 BF16 KV cache、静态显存比例 0.92,单次验证请求关闭 thinking 以减少变量
Cookbook 说明 LongCat 支持位于 SGLang main,正式版本包含前应使用 nightly wheel 或 rolling nightly Docker。
pip install --upgrade pip
pip install uv
# B300 / CUDA 13
SGLANG_WHL_INDEX=https://docs.sglang.ai/whl/cu130
# CUDA 12.9 时改用:
# SGLANG_WHL_INDEX=https://docs.sglang.ai/whl/cu129
uv pip install --prerelease=allow \
--extra-index-url "\${SGLANG_WHL_INDEX}" \
"sglang[all]"| 硬件 | 节点/卡数 | Cookbook 的并行配置 |
|---|---|---|
| B300 | 单节点 8 卡 | TP=8、EP=8;页面说明该配方已端到端验证 |
| H200 / B200 / H20 | 两节点共 16 卡 | TP=16、EP=16;命令生成器会注入多节点 rank 参数 |
部署前必须把 HOST_IP、PORT、NODE0_IP、NODE_RANK 等环境值填入 Cookbook 的配置面板;不要把示例地址直接用于生产。
把生成器给出的完整命令作为主命令,仅确认下列 LongCat 相关项存在:
--trust-remote-code
--nsa-prefill-backend fa3
--chunked-prefill-size 2048
--kv-cache-dtype bfloat16
--mem-fraction-static 0.92
--model-loader-extra-config '{"enable_multithread_load":true,"num_threads":12}'Cookbook 明确建议不要手工追加 fp8-gemm-runner-backend,让 SGLang 按 LongCat FP8 scale layout 自动选择后端。长上下文、多节点、PD 分离等开关应通过页面生成器按硬件矩阵选择,避免自行拼接未验证组合。
服务启动后,先发送不启用思考的短请求,确认端口、模型名和 chat template 均可用:
curl http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "meituan-longcat/LongCat-2.0-FP8",
"messages": [
{"role": "user", "content": "A shop has 17 apples and sells 8. Then it buys 6 more. Answer with only the final number."}
],
"max_tokens": 32,
"chat_template_kwargs": {"enable_thinking": false}
}'预期最终答案为 15。OpenAI SDK 等价配置是 base_url 指向 http://localhost:30000/v1、api_key 使用任意非空占位值,并在 extra_body 中传入 chat_template_kwargs.enable_thinking=false。
下载 LongCat-2.0-FP8 权重并核对集群 GPU、CUDA 与 SGLang nightly 版本。
按 B300 8 卡或 H200/B200/H20 两节点 16 卡选择 Cookbook 的 Balanced 配方。
填入节点 IP、端口和 rank;先只保留页面生成的已验证命令。
先关闭 thinking 发送 17-8+6 健康检查;再逐步开启思考、并发和长上下文压测。
记录启动时间、显存、吞吐、KV cache 命中与错误日志;任何新并行组合都单独标注为实验配置。
Cookbook 的硬件矩阵:B300 单节点 8 GPU 使用 TP=8/EP=8;H200、B200、H20 使用两节点 16 GPU、TP=16/EP=16。
Cookbook 的默认建议:FA3 预填充、chunked prefill 2048、BF16 KV cache、静态显存比例 0.92、多线程加载 12 线程。
Cookbook 的 B300 验证:8x B300、CUDA graph capture 成功;GSM8K 200 题准确率 98.0%,1314 题准确率 95.8904109589041%。
该页面把模型定位为 FP8 权重、LongCat Sparse Attention、n-gram embedding 的稀疏 MoE 服务配方;并提供 OpenAI 兼容 cURL/Python 请求。
该来源是部署方官方 Cookbook,不是跨硬件独立性能评测;GSM8K 数据属于 SGLang/配方验证口径,不能推导通用能力排名。
B300 配方明确端到端验证,其他硬件在页面中以两节点矩阵展示;实际稳定性仍取决于驱动、网络、显存和 nightly 版本。
1M 训练上下文不等于所有部署都能稳定承载 1M 请求;应先用目标上下文长度做压力测试。
SGLang 文档要求的 nightly 版本和命令参数会变化;复现时记录文档日期与 commit/镜像标签。
页面称该页提供“config-driven recipes”,并把已验证配方与 Playground 实验选项分开。
页面明确提示不要手工传入 FP8 GEMM runner backend,而应让 SGLang 自动选择。
LongCat 2.0