Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
提示词
媒体LongCat 2.0

SGLang 官方 LongCat-2.0-FP8 多卡部署配置与验证流程

原始来源

SGLang 官方 Cookbook

作者SGLang 团队

Tabbit 整理2026-08-19

查看原文

一句话结论

这份 Cookbook 给出了 LongCat-2.0-FP8 在 B300、B200、H200、H20 上用 SGLang 启动、调参和验证的可复用路径,适合先按已验证拓扑部署,再逐步打开实验性并行选项。

适用场景

  • 适合的任务:自托管 LongCat-2.0-FP8;多卡/多节点推理;需要 OpenAI 兼容接口、长上下文和可控思考开关的服务

  • 不适合的任务:单张消费级 GPU;没有多卡集群或无法承担 FP8 权重存储的快速试用

  • 适用的模型版本:meituan-longcat/LongCat-2.0-FP8

  • 适用的客户端、Agent 或 API:SGLang server、OpenAI SDK、cURL;部署后通过本地 /v1/chat/completions

  • 推荐的推理档位和参数:先使用 Balanced 验证矩阵;服务端保留 BF16 KV cache、静态显存比例 0.92,单次验证请求关闭 thinking 以减少变量

可直接使用的内容

1. 安装 SGLang nightly

Cookbook 说明 LongCat 支持位于 SGLang main,正式版本包含前应使用 nightly wheel 或 rolling nightly Docker。

pip install --upgrade pip
pip install uv

# B300 / CUDA 13
SGLANG_WHL_INDEX=https://docs.sglang.ai/whl/cu130
# CUDA 12.9 时改用:
# SGLANG_WHL_INDEX=https://docs.sglang.ai/whl/cu129

uv pip install --prerelease=allow \
  --extra-index-url "\${SGLANG_WHL_INDEX}" \
  "sglang[all]"

2. 先选择已验证拓扑

硬件节点/卡数Cookbook 的并行配置
B300单节点 8 卡TP=8、EP=8;页面说明该配方已端到端验证
H200 / B200 / H20两节点共 16 卡TP=16、EP=16;命令生成器会注入多节点 rank 参数

部署前必须把 HOST_IP、PORT、NODE0_IP、NODE_RANK 等环境值填入 Cookbook 的配置面板;不要把示例地址直接用于生产。

3. LongCat 预填充路径的关键参数

把生成器给出的完整命令作为主命令,仅确认下列 LongCat 相关项存在:

--trust-remote-code
--nsa-prefill-backend fa3
--chunked-prefill-size 2048
--kv-cache-dtype bfloat16
--mem-fraction-static 0.92
--model-loader-extra-config '{"enable_multithread_load":true,"num_threads":12}'

Cookbook 明确建议不要手工追加 fp8-gemm-runner-backend,让 SGLang 按 LongCat FP8 scale layout 自动选择后端。长上下文、多节点、PD 分离等开关应通过页面生成器按硬件矩阵选择,避免自行拼接未验证组合。

4. 最小健康检查

服务启动后,先发送不启用思考的短请求,确认端口、模型名和 chat template 均可用:

curl http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "meituan-longcat/LongCat-2.0-FP8",
    "messages": [
      {"role": "user", "content": "A shop has 17 apples and sells 8. Then it buys 6 more. Answer with only the final number."}
    ],
    "max_tokens": 32,
    "chat_template_kwargs": {"enable_thinking": false}
  }'

预期最终答案为 15。OpenAI SDK 等价配置是 base_url 指向 http://localhost:30000/v1、api_key 使用任意非空占位值,并在 extra_body 中传入 chat_template_kwargs.enable_thinking=false。

测试/工作流步骤

  1. 下载 LongCat-2.0-FP8 权重并核对集群 GPU、CUDA 与 SGLang nightly 版本。

  2. 按 B300 8 卡或 H200/B200/H20 两节点 16 卡选择 Cookbook 的 Balanced 配方。

  3. 填入节点 IP、端口和 rank;先只保留页面生成的已验证命令。

  4. 先关闭 thinking 发送 17-8+6 健康检查;再逐步开启思考、并发和长上下文压测。

  5. 记录启动时间、显存、吞吐、KV cache 命中与错误日志;任何新并行组合都单独标注为实验配置。

原始证据与数据

  • Cookbook 的硬件矩阵:B300 单节点 8 GPU 使用 TP=8/EP=8;H200、B200、H20 使用两节点 16 GPU、TP=16/EP=16。

  • Cookbook 的默认建议:FA3 预填充、chunked prefill 2048、BF16 KV cache、静态显存比例 0.92、多线程加载 12 线程。

  • Cookbook 的 B300 验证:8x B300、CUDA graph capture 成功;GSM8K 200 题准确率 98.0%,1314 题准确率 95.8904109589041%。

  • 该页面把模型定位为 FP8 权重、LongCat Sparse Attention、n-gram embedding 的稀疏 MoE 服务配方;并提供 OpenAI 兼容 cURL/Python 请求。

适用边界

  • 该来源是部署方官方 Cookbook,不是跨硬件独立性能评测;GSM8K 数据属于 SGLang/配方验证口径,不能推导通用能力排名。

  • B300 配方明确端到端验证,其他硬件在页面中以两节点矩阵展示;实际稳定性仍取决于驱动、网络、显存和 nightly 版本。

  • 1M 训练上下文不等于所有部署都能稳定承载 1M 请求;应先用目标上下文长度做压力测试。

  • SGLang 文档要求的 nightly 版本和命令参数会变化;复现时记录文档日期与 commit/镜像标签。

来源摘录或观察(仅做合规短引)

  • 页面称该页提供“config-driven recipes”,并把已验证配方与 Playground 实验选项分开。

  • 页面明确提示不要手工传入 FP8 GEMM runner backend,而应让 SGLang 自动选择。

Tabbit 小编提醒

提示词内容来自公开资料与 Tabbit 编辑整理。引用前请查看原文授权与适用范围。

LongCat 2.0

在 Tabbit 中使用

LongCat 2.0

相关提示词

媒体LongCat 官方 API 文档站(longcat.chat)2026-07

LongCat-2.0 API 平台接入快速上手(官方 Quick Start + Chat Completions 参考 + 定价)

媒体Hugging Face2026-06-30

LongCat-2.0 聊天模板与工具调用配置(官方 Hugging Face 模型卡)

媒体LongCat 官方 API 文档站(longcat.chat);X(@NousResearch 官方账号佐证免费入口)2026-08-13

Hermes Agent 接入 LongCat-2.0 配置(官方文档 + Nous Portal 免费入口)

媒体LongCat 官方 API 文档站(longcat.chat)2026-06-30

Claude Code 接入 LongCat-2.0 配置(官方文档)

LongCat 2.0

相关测评

媒体Hugging Face(meituan-longcat/LongCat-2.0)2026-06-30

LongCat-2.0 官方模型卡:规格与官方基准(含与 Gemini/GPT-5.5/Claude Opus 对比表)

媒体LongCat 官网博客(longcat.chat)2026-06-30

LongCat-2.0 官方技术博客:架构、国产算力训练与推理部署(发布说明)

媒体OpenRouter(第三方模型路由平台)2026-07-20

OpenRouter 渠道数据:LongCat-2.0 定价、实测性能与第三方基准(Artificial Analysis)

媒体aiprofitboardroom.com(博客,属 Julian Goldie 的 AI Profit Boardroom 社区)2026-05-29

AI Profit Boardroom 实测:LongCat 2.0 游戏构建测试与 GLM 5.2 同任务对比