Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
提示词
媒体Kimi K3

Kimi K3 vLLM 多节点推理配置

原始来源

vLLM Recipes

作者vLLM 社区/官方配方页

Tabbit 整理2026-08-19

查看原文

一句话结论

这份官方配方给出了 Kimi K3 的 vLLM 容器、GPU/驱动门槛、跨节点通信后端和 OpenAI 兼容客户端示例,适合先做部署可行性验证。

适用场景

  • 适合的任务:数据中心级自托管、视觉输入服务、长上下文推理和多节点 MoE 部署。

  • 不适合的任务:个人电脑、单张消费级 GPU 或没有 CUDA 13/r580+ 驱动条件的环境。

  • 适用的模型版本:moonshotai/Kimi-K3;页面仍保留 pre-release 标记,应以当前容器和配方状态为准。

  • 适用的客户端、Agent 或 API:vLLM OpenAI-compatible server、Python OpenAI SDK。

  • 推荐的推理档位和参数:页面未固定 reasoning effort;示例 max_tokens=2048,长上下文场景按任务调整 max-model-len。

可直接使用的内容

镜像与硬件基线:

vllm/vllm-openai:kimi-k3
CUDA 13 (cu130);主机需要 r580+ NVIDIA driver
NVIDIA:至少 8× GB300,多节点用于生产流量
ROCm:vllm/vllm-openai_rocm:kimi-k3,至少 8× MI355X/MI350X

OpenAI 兼容客户端与视觉输入:

import time
from openai import OpenAI

client = OpenAI(
    api_key="EMPTY",
    base_url="http://localhost:8000/v1",
    timeout=3600,
)

messages = [{
    "role": "user",
    "content": [
        {
            "type": "image_url",
            "image_url": {
                "url": "https://ofasys-multimodal-wlcb-3-toshanghai.oss-accelerate.aliyuncs.com/wpf272043/keepme/image/receipt.png"
            },
        },
        {"type": "text", "text": "Read all the text in the image."},
    ],
}]

start = time.time()
response = client.chat.completions.create(
    model="moonshotai/Kimi-K3",
    messages=messages,
    max_tokens=2048,
)
print(f"Response costs: {time.time() - start:.2f}s")
print(response.choices[0].message.content)

测试/工作流步骤

  1. 在至少 8 张 GB300 或 MI355X/MI350X 的节点上选择对应容器,先验证驱动、CUDA/ROCm 和显存可用性。

  2. 启动 vLLM OpenAI-compatible server;跨节点 RDMA 使用 --all2all-backend deepep_v2,NVLink 使用 --all2all-backend flashinfer_nvlink_one_sided。

  3. MoE 部署可试用 deep_gemm_mega_moe;配方注明该后端不兼容跨节点 RDMA,必须按互联拓扑选择。

  4. 用上述视觉请求做 smoke test,再测纯文本、工具调用和不同 max-model-len。

  5. 若开启 Model Runner v2/Rust Frontend,记录 VLLM_USE_V2_MODEL_RUNNER=1 与 VLLM_USE_RUST_FRONTEND=1 的版本和结果。

  6. 工具调用必须做 schema 校验;页面提示 K3 偶尔会生成自身 parser 不接受的格式,需要验证后重试。

原始证据与数据

  • vLLM 配方明确给出 vllm/vllm-openai:kimi-k3、CUDA 13/cu130、r580+ 驱动和至少 8× GB300 的门槛。

  • AMD 配方使用 vllm/vllm-openai_rocm:kimi-k3,门槛为至少 8× MI355X/MI350X。

  • 页面列出 RDMA、NVLink、MoE 后端、FP8 KV、DCP、NCCL 和工具调用 parser 的具体注意事项。

  • 示例使用 localhost:8000/v1、模型名 moonshotai/Kimi-K3、timeout=3600 和 max_tokens=2048。

适用边界

  • 配方是部署说明,不是吞吐、延迟或质量基准;“至少 8 张卡”不能推导出生产容量或 1M context 的可用并发。

  • 页面仍标注 pre-release,容器、驱动、后端和参数可能随 vLLM/Kimi K3 更新。

  • 不应把示例图片 URL 当作业务数据;生产环境应替换为自有、合规的测试样本。

复现步骤

记录 vLLM 镜像 digest、驱动/CUDA、GPU 型号和互联方式;按配方分别跑视觉 OCR、长文本、工具调用三组 smoke test。每组记录首 token 延迟、生成速度、显存、KV cache、parser 重试和错误日志,再改变 max-model-len 做容量曲线。

来源摘录或观察(仅做合规短引)

原文硬件前置条件为:“At least 8x GB300.”

Tabbit 小编提醒

提示词内容来自公开资料与 Tabbit 编辑整理。引用前请查看原文授权与适用范围。

Kimi K3

在 Tabbit 中使用

Kimi K3

相关提示词

媒体Google / Business Compass LLC

Kimi K3 提示词工程指南

媒体Google / Together AI

Kimi K3:完整开发者指南

媒体Google / Kimi API Platform

Kimi 提示词最佳实践

媒体Google / Kimi API Platform

使用 Kimi K3 构建 Agent

Kimi K3

相关测评

媒体Google / Semgrep

Kimi K3 的代码安全测评:表面强劲,精度不足

媒体Google / MindStudio

Kimi K3 实战编码测评:真的像宣传的那么好吗?

媒体Google / Simon Willison

Kimi K3 与 pelican benchmark:我们还能学到什么

媒体Google / NxCode

Kimi K3 benchmark 详解:coding-agent 测评指南