Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
提示词与工作流

Kimi K3 · configuration

在 vLLM 上验证 Kimi K3 多节点部署条件

围绕“在 vLLM 上验证 Kimi K3 多节点部署条件”整理来源中的任务边界、输入和执行环境;完整步骤与限制见详情。

来源待核验数据中心 GPU、CUDA/驱动、vLLM 容器和跨节点网络;个人电脑不适用。

前置条件与输入

  • GPU 与驱动信息
  • 节点拓扑
  • 容器/模型路径
  • 服务端口与健康检查

一句话结论

这份官方配方给出了 Kimi K3 的 vLLM 容器、GPU/驱动门槛、跨节点通信后端和 OpenAI 兼容客户端示例,适合先做部署可行性验证。

适用场景

  • 适合的任务:数据中心级自托管、视觉输入服务、长上下文推理和多节点 MoE 部署。

  • 不适合的任务:个人电脑、单张消费级 GPU 或没有 CUDA 13/r580+ 驱动条件的环境。

  • 适用的模型版本:moonshotai/Kimi-K3;页面仍保留 pre-release 标记,应以当前容器和配方状态为准。

  • 适用的客户端、Agent 或 API:vLLM OpenAI-compatible server、Python OpenAI SDK。

  • 推荐的推理档位和参数:页面未固定 reasoning effort;示例 max_tokens=2048,长上下文场景按任务调整 max-model-len。

可直接使用的内容

镜像与硬件基线:

vllm/vllm-openai:kimi-k3
CUDA 13 (cu130);主机需要 r580+ NVIDIA driver
NVIDIA:至少 8× GB300,多节点用于生产流量
ROCm:vllm/vllm-openai_rocm:kimi-k3,至少 8× MI355X/MI350X

OpenAI 兼容客户端与视觉输入:

import time
from openai import OpenAI

client = OpenAI(
    api_key="EMPTY",
    base_url="http://localhost:8000/v1",
    timeout=3600,
)

messages = [{
    "role": "user",
    "content": [
        {
            "type": "image_url",
            "image_url": {
                "url": "https://ofasys-multimodal-wlcb-3-toshanghai.oss-accelerate.aliyuncs.com/wpf272043/keepme/image/receipt.png"
            },
        },
        {"type": "text", "text": "Read all the text in the image."},
    ],
}]

start = time.time()
response = client.chat.completions.create(
    model="moonshotai/Kimi-K3",
    messages=messages,
    max_tokens=2048,
)
print(f"Response costs: {time.time() - start:.2f}s")
print(response.choices[0].message.content)

测试/工作流步骤

  1. 在至少 8 张 GB300 或 MI355X/MI350X 的节点上选择对应容器,先验证驱动、CUDA/ROCm 和显存可用性。

  2. 启动 vLLM OpenAI-compatible server;跨节点 RDMA 使用 --all2all-backend deepep_v2,NVLink 使用 --all2all-backend flashinfer_nvlink_one_sided。

  3. MoE 部署可试用 deep_gemm_mega_moe;配方注明该后端不兼容跨节点 RDMA,必须按互联拓扑选择。

  4. 用上述视觉请求做 smoke test,再测纯文本、工具调用和不同 max-model-len。

  5. 若开启 Model Runner v2/Rust Frontend,记录 VLLM_USE_V2_MODEL_RUNNER=1 与 VLLM_USE_RUST_FRONTEND=1 的版本和结果。

  6. 工具调用必须做 schema 校验;页面提示 K3 偶尔会生成自身 parser 不接受的格式,需要验证后重试。

原始证据与数据

  • vLLM 配方明确给出 vllm/vllm-openai:kimi-k3、CUDA 13/cu130、r580+ 驱动和至少 8× GB300 的门槛。

  • AMD 配方使用 vllm/vllm-openai_rocm:kimi-k3,门槛为至少 8× MI355X/MI350X。

  • 页面列出 RDMA、NVLink、MoE 后端、FP8 KV、DCP、NCCL 和工具调用 parser 的具体注意事项。

  • 示例使用 localhost:8000/v1、模型名 moonshotai/Kimi-K3、timeout=3600 和 max_tokens=2048。

适用边界

  • 配方是部署说明,不是吞吐、延迟或质量基准;“至少 8 张卡”不能推导出生产容量或 1M context 的可用并发。

  • 页面仍标注 pre-release,容器、驱动、后端和参数可能随 vLLM/Kimi K3 更新。

  • 不应把示例图片 URL 当作业务数据;生产环境应替换为自有、合规的测试样本。

复现步骤

记录 vLLM 镜像 digest、驱动/CUDA、GPU 型号和互联方式;按配方分别跑视觉 OCR、长文本、工具调用三组 smoke test。每组记录首 token 延迟、生成速度、显存、KV cache、parser 重试和错误日志,再改变 max-model-len 做容量曲线。

来源摘录或观察(仅做合规短引)

原文硬件前置条件为:“At least 8x GB300.”

来源与日期

vLLM Recipes · 原文日期: 未公开 · 编辑日期: 2026-09-20

阅读原始来源
变量检查

无必填变量

相关提示词

把 Kimi K3 的 Agent loop 拆成可控步骤配置 Kimi K3 的开发者调用与多模态输入搭建 Kimi K3 API 与 Agent loop让 Kimi K3 在 OpenCode 中调用 Firecrawl 获取网页资料

相关测评

Kimi K3 代码安全评估:基准强不等于精度够实战编码:简单任务接近,陷阱任务暴露可靠性差距Coding Agent 证据足够严肃,但不支持“通用最佳”受限网络安全评估中超过 GLM-5.2,但 ACE 为 0/41

模型深度阅读

定价 · 简体中文

Kimi K3 价格:API 成本、会员方案与预算计算

用官方费率解释 Kimi K3 的 API 价格、缓存写入、会员方案和三种实际预算场景。

Kimi K3

在 Tabbit 中使用 Kimi K3

请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。