Redis 作者新作:DwarfStar,专为 DeepSeek V4 优化的本地推理引擎

发布时间:2026/8/5 1:26:36
Redis 作者新作:DwarfStar,专为 DeepSeek V4 优化的本地推理引擎
AntonRedis 作者开源了 DwarfStar一个小型原生推理引擎专为 DeepSeek V4 Flash 和 PRO 优化支持 Mac Metal、NVIDIA CUDA 和 ROCm 三端。在 MacBook M5 Max 上跑 DeepSeek V4 Flash不需要云 API——这就是 DwarfStar 的承诺。这个项目解决什么问题DeepSeek V4 系列模型虽然强大但在消费级硬件上运行需要大量工程投入。llama.cpp 虽然通用但 DeepSeek V4 的 MoE 架构、KV 缓存和激进的量化方案有特殊需求——通用推理引擎无法充分利用这些特性。DwarfStar 是一个故意狭隘的推理引擎只为 DeepSeek V4 Flash/PRO 和 GLM 5.2 优化不追求成为通用的 GGUF 加载器。模型加载、prompt 渲染、工具调用、KV 状态、HTTP 服务器和 coding agent 是一体化构建和测试的。核心亮点三端原生支持MetalMac、CUDANVIDIA、ROCmAMD Strix Halo覆盖当前所有主流本地 AI 硬件。Anton 自己用的是 MacBook M5 Max但这个项目从第一天就不是Mac-only。激进的 MoE 量化专为 DeepSeek V4 的 routed-expert 设计 2bit 非对称量化——只对路由专家量化到 IQ2_XXS共享专家和投影层保持原精度。这种不对称设计在质量和体积间找到了最优平衡使得 96GB 的 MacBook 也能运行 DeepSeek V4 Flash。SSD 流式加载内存不足时利用本地高速 SSD 进行模型流式加载让 96GB 以下的机器也能运行大模型。这是消费级硬件跑大模型的实用解法。多机协作两台 MacBook 通过 RDMA 实现张量并行支持 4bit DeepSeek Flash 分布式推理流水线并行可串联多台机器汇总显存运行更大模型。这不是实验室 Demo是真实可用的分布式推理方案。老旧 GPU 翻新8×L40SAda Lovelace 架构在 vLLM 上已不被支持但 DwarfStar 的 micro-batching 解码让这台服务器跑出 120 t/s 聚合生成速度和 2000 t/s prefill。旧显卡突然有了新用途。内置 coding agent模型加载、prompt 渲染、工具调用、KV 状态、HTTP 服务器和 coding agent 是一体化构建的。不是一个推理库是一个可以跑 coding agent 的完整服务。开发透明项目坦诚说明使用了 GPT 5.5/5.6 和 Claude Fable 辅助开发同时明确依赖 llama.cpp/GGML 的开路工作。“如果你不喜欢 AI 开发的代码这个软件不适合你”——这种坦诚在当前 AI 工程圈很罕见。快速上手# 下载模型96/128GB RAM 机器imatrix 调优的 q2 量化./download_model.sh q2-imatrix# 或更高内存机器./download_model.sh q4-imatrix# 512GB 机器跑 PRO./download_model.sh pro-q2-imatrix支持 Metal、CUDA、ROCm 三种后端自动检测编译即用。技术细节为什么不做通用 GGUF 加载器Anton 的选择有深意DeepSeek V4 的 GGUF 包含了特定张量布局、量化混合和可选 MTP 状态任意 GGUF 文件不会满足引擎的期望。与其做成能跑所有 GGUF 但都不快的通用引擎不如做成只为一个模型做到极致的专用引擎。2bit 不对称量化2bit 量化通常被视为不可用的极限压缩。但 DwarfStar 的 2bit 只量化路由专家——这些专家是模型中最大的参数块也是最容易量化的部分。共享专家、投影和路由逻辑保持原精度保证了质量底线。MXFP4 原生支持项目保留了 DeepSeek 发布的 MXFP4 路由专家权重不做重新量化。在 Blackwell CUDA 设备上使用原生 FP4 矩阵指令和 FP4 激活其他 CUDA 设备使用 Q8 激活。这意味着新硬件不需要降级旧硬件不会被排除。我的评价DwarfStar 不是又一个通用 GGUF 推理引擎——它走了一条不同路线为一个具体模型做到极致而不是为所有模型做到够用。对 Mac 用户来说这是目前运行 DeepSeek V4 最轻量的本地方案。相比 llama.cppDwarfStar 专门为 MoE 的量化和 KV 缓存做了针对性优化。对服务器场景老旧 Ada 架构 GPU 终于有了利用价值。不过项目坦诚标为 betaAPI 仍在快速变化。Anton 自己也说了软件变化非常快。如果你正在构建本地 DeepSeek 应用值得持续关注但不建议在生产环境依赖它。横向对比方案通用性DeepSeek V4 优化易用性多 GPU适合谁llama.cpp极高中等极高有限所有人vLLM高高中等支持服务器场景DwarfStar低极高中等支持DeepSeek 用户Ollama高低极高低快速实验DwarfStar 在 DeepSeek V4 场景下是最优选择但通用场景仍推荐 llama.cpp。它是一个专用工具不是万能钥匙。