这份官方配方给出了 Kimi K3 的 vLLM 容器、GPU/驱动门槛、跨节点通信后端和 OpenAI 兼容客户端示例,适合先做部署可行性验证。
适合的任务:数据中心级自托管、视觉输入服务、长上下文推理和多节点 MoE 部署。
不适合的任务:个人电脑、单张消费级 GPU 或没有 CUDA 13/r580+ 驱动条件的环境。
适用的模型版本:moonshotai/Kimi-K3;页面仍保留 pre-release 标记,应以当前容器和配方状态为准。
适用的客户端、Agent 或 API:vLLM OpenAI-compatible server、Python OpenAI SDK。
推荐的推理档位和参数:页面未固定 reasoning effort;示例 max_tokens=2048,长上下文场景按任务调整 max-model-len。
镜像与硬件基线:
vllm/vllm-openai:kimi-k3
CUDA 13 (cu130);主机需要 r580+ NVIDIA driver
NVIDIA:至少 8× GB300,多节点用于生产流量
ROCm:vllm/vllm-openai_rocm:kimi-k3,至少 8× MI355X/MI350XOpenAI 兼容客户端与视觉输入:
import time
from openai import OpenAI
client = OpenAI(
api_key="EMPTY",
base_url="http://localhost:8000/v1",
timeout=3600,
)
messages = [{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": "https://ofasys-multimodal-wlcb-3-toshanghai.oss-accelerate.aliyuncs.com/wpf272043/keepme/image/receipt.png"
},
},
{"type": "text", "text": "Read all the text in the image."},
],
}]
start = time.time()
response = client.chat.completions.create(
model="moonshotai/Kimi-K3",
messages=messages,
max_tokens=2048,
)
print(f"Response costs: {time.time() - start:.2f}s")
print(response.choices[0].message.content)在至少 8 张 GB300 或 MI355X/MI350X 的节点上选择对应容器,先验证驱动、CUDA/ROCm 和显存可用性。
启动 vLLM OpenAI-compatible server;跨节点 RDMA 使用 --all2all-backend deepep_v2,NVLink 使用 --all2all-backend flashinfer_nvlink_one_sided。
MoE 部署可试用 deep_gemm_mega_moe;配方注明该后端不兼容跨节点 RDMA,必须按互联拓扑选择。
用上述视觉请求做 smoke test,再测纯文本、工具调用和不同 max-model-len。
若开启 Model Runner v2/Rust Frontend,记录 VLLM_USE_V2_MODEL_RUNNER=1 与 VLLM_USE_RUST_FRONTEND=1 的版本和结果。
工具调用必须做 schema 校验;页面提示 K3 偶尔会生成自身 parser 不接受的格式,需要验证后重试。
vLLM 配方明确给出 vllm/vllm-openai:kimi-k3、CUDA 13/cu130、r580+ 驱动和至少 8× GB300 的门槛。
AMD 配方使用 vllm/vllm-openai_rocm:kimi-k3,门槛为至少 8× MI355X/MI350X。
页面列出 RDMA、NVLink、MoE 后端、FP8 KV、DCP、NCCL 和工具调用 parser 的具体注意事项。
示例使用 localhost:8000/v1、模型名 moonshotai/Kimi-K3、timeout=3600 和 max_tokens=2048。
配方是部署说明,不是吞吐、延迟或质量基准;“至少 8 张卡”不能推导出生产容量或 1M context 的可用并发。
页面仍标注 pre-release,容器、驱动、后端和参数可能随 vLLM/Kimi K3 更新。
不应把示例图片 URL 当作业务数据;生产环境应替换为自有、合规的测试样本。
记录 vLLM 镜像 digest、驱动/CUDA、GPU 型号和互联方式;按配方分别跑视觉 OCR、长文本、工具调用三组 smoke test。每组记录首 token 延迟、生成速度、显存、KV cache、parser 重试和错误日志,再改变 max-model-len 做容量曲线。
原文硬件前置条件为:“At least 8x GB300.”
Kimi K3