如何本地部署Kimi K2.5:vLLM与SGLang完全教程(含H200 TP8配置与常见坑)

发布时间:2026/10/4 21:08:03
如何本地部署Kimi K2.5:vLLM与SGLang完全教程(含H200 TP8配置与常见坑)
如何本地部署Kimi K2.5vLLM与SGLang完全教程含H200 TP8配置与常见坑【免费下载链接】Kimi-K2.5Open Visual Agentic Intelligence项目地址: https://gitcode.com/gh_mirrors/ki/Kimi-K2.5本文带你用 vLLM 或 SGLang 在本地部署Kimi K2.5——月之暗面开源的 1 万亿参数原生多模态 Agent 大模型。文章覆盖 H200 TP8 推荐配置、关键参数说明与新手最容易踩的坑照着做即可跑通。 先认识一下 Kimi K2.5Kimi K2.5 是基于 Kimi-K2-Base 在约 15 万亿图文混合 Token 上持续预训练得到的开源原生多模态智能体模型支持视觉理解、即时Instant与思考Thinking双模式、对话与 Agent 范式。核心规格如下规格说明架构Mixture-of-ExpertsMoE总参数1T激活 32B专家数量384 个专家每 Token 选 8 个上下文长度256K注意力机制MLA视觉编码器MoonViT400M量化方式原生 INT4 量化完整的模型介绍、评测榜单AIME 2025 得分 96.1、SWE-Bench Verified 76.8 等可查阅 README.md更深入的技术细节见 tech_report.pdf。 由于采用原生 INT4 量化权重体积大幅缩小8 卡 H200 即可承载整个模型。 部署前环境与硬件清单硬件参考官方示例为单节点 8×H200张量并行 TP8。显存紧张的机器可以关注后文的 KTransformers CPUGPU 异构方案。软件要求推理引擎推荐三选一vLLM、SGLang、KTransformerstransformers最低版本要求4.57.1注意kimi_k2reasoning parser 等特性目前合入的是nightly / 最新版引擎稳定旧版本可能无法识别该模型建议直接使用 nightly 构建详见 docs/deploy_guidance.md vLLM 部署一行命令拉起 H200 TP8 服务第 1 步安装 nightly 版 vLLM模型目前仅提供在 vLLM 的 nightly wheel 中uv pip install -U vllm \ --torch-backendauto \ --extra-index-url https://wheels.vllm.ai/nightly第 2 步启动 H200 单节点 TP8 服务vllm serve $MODEL_PATH -tp 8 \ --mm-encoder-tp-mode data \ --trust-remote-code \ --tool-call-parser kimi_k2 \ --reasoning-parser kimi_k2关键参数速读参数为什么必须加-tp 8张量并行切分到 8 张 H200这是承载 1T 参数的基础--tool-call-parser kimi_k2开启工具调用Function Calling所必需--reasoning-parser kimi_k2K2.5 默认开启思考模式缺少它会导致推理内容解析错误--mm-encoder-tp-mode data多模态编码器的并行模式设置--trust-remote-code加载模型自带的自定义代码⚡ SGLang 部署最快上手方式SGLang 的最新 main 分支已支持 Kimi K2.5安装更简单pip install sglang githttps://github.com/sgl-project/sglang.git#subdirectorypython pip install nvidia-cudnn-cu129.16.0.29同样是 H200 单节点 TP8启动命令与 vLLM 几乎一致sglang serve --model-path $MODEL_PATH --tp 8 \ --trust-remote-code \ --tool-call-parser kimi_k2 \ --reasoning-parser kimi_k2 两个 parser 参数在 SGLang 下同样是必选项--tool-call-parser用于工具调用--reasoning-parser用于正确解析思考reasoning内容。️ 显存不够KTransformers CPUGPU 异构方案如果买不到 8 张 H200KTransformers 支持CPUGPU 混合推理MoE 专家拆到 CPU注意力留在 GPU。官方在 8×L20 2×Intel 6454S 上实测Prefill640.12 tokens/sDecode24.51 tokens/s48 路并发启动方式为python -m sglang.launch_server并追加--kt-amx-method AMXINT4、--kt-cpuinfer 64等 KTransformers 专属参数完整命令可直接参考 docs/deploy_guidance.md 中的 KTransformers 一节。✅ 部署后验证与调用要点服务启动后它提供OpenAI 兼容 API可直接用openaiSDK 调用。几个容易忽略的配置细节采样参数Thinking 模式建议temperature1.0Instant 模式建议temperature0.6top_p统一建议0.95切换到即时模式InstantvLLM / SGLang 部署下需在请求extra_body中传{chat_template_kwargs: {thinking: False}}视频输入为实验性能力目前仅官方 API 支持验证部署是否正确可使用官方的 Kimi Vendor Verifier 工具调用示例含图片输入、思考/即时模式切换见 README.md 第 6 节 Model Usage。️ 常见坑清单新手必看症状原因与解决启动报模型架构不识别用了稳定旧版引擎。K2.5 相关特性仍在nightly / 最新 main中请升级回复里思考过程混进正文漏加--reasoning-parser kimi_k2vLLM、SGLang 都要加工具调用Function Calling失败漏加--tool-call-parser kimi_k2OOM 显存不足确认使用原生 INT4 量化权重并保证 TP8 切分或用 KTransformers 异构方案输出格式异常transformers版本低于 4.57.1请先升级想让模型快速回答别思考通过extra_body传chat_template_kwargs.thinkingFalse切换 Instant 模式 延伸阅读与资料路径部署命令与参数原始出处docs/deploy_guidance.md模型介绍、评测结果与 API 调用示例README.md完整技术报告tech_report.pdf开源协议代码与权重均为 Modified MITLICENSE 提示推理引擎更新频繁官方给出的命令仅为示例而非最优配置追求更高吞吐时请持续关注 vLLM / SGLang 上游的最新实践。总结Kimi K2.5 本地部署的核心就三件事——装 nightly 引擎、按 H200 TP8 配置启动、别忘两个kimi_k2parser 参数。搞定这三步你就拥有了一台可多模态、可思考、可调工具的私有 Agent 大脑。【免费下载链接】Kimi-K2.5Open Visual Agentic Intelligence项目地址: https://gitcode.com/gh_mirrors/ki/Kimi-K2.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考