从 0731 到 V4.1 Flash:一次发布看懂 Flash 系列的「轻量化」演进路线
从 0731 到 V4.1 Flash一次发布看懂 Flash 系列的「轻量化」演进路线【免费下载链接】DeepSeek-V4-Flash-0731项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Flash-07312026 年 4 月 24 日DeepSeek V4 系列以「Pro Flash」双版本形态登场百万级上下文与大幅下调的 API 定价让 Flash 版第一次站到聚光灯下7 月 31 日V4-Flash 正式版即本仓库 DeepSeek-V4-Flash-0731上线Agent 能力较预览版跃升一个量级9 月中旬全新架构的 V4.1 Flash 又以「552B 参数、输入激活仅 8B、原生多模态」刷新了业界对「轻量模型」的认知。半年内两次迭代Flash 系列始终在做同一件事把「轻」做进架构基因再用工程手段把「轻」变成可量化的低延迟、高吞吐与低成本。本文以 0731 正式版的完整仓库为解剖样本从 config.json、inference/model.py 与 inference/kernel.py 等源码出发逐层拆解 Flash 系列的轻量化设计再对照 V4.1 Flash 的公开参数还原这条「越轻越强」的演进路线。一、0731 版把「轻」写进架构基因的正式版预览版发布后的三个月里社区对 Flash 的评价经历了从「性价比之选」到「Agent 杀手锏」的转变。7 月 31 日上线的 V4-Flash-0731 正式版在 README.md 中被官方明确描述为「substantially enhanced agentic capabilities」——Agent 能力的大幅增强而非简单扩参。打开仓库根目录的 model.safetensors.index.jsontotal_size: 166878536440约 166.9 GB48 个分片。这是一个仍包含 DSpark 投机解码模块的完整权重其「轻」体现在两层总参数大激活参数小稀疏 MoE 架构下config.json 显示 43 层、256 个路由专家 1 个共享专家、每 token 激活 6 个专家配合 4096 的 hidden size 与 2048 的专家中间维度。推理时真正参与计算的只有很小一部分权重这是吞吐与延迟的第一来源。量化从权重贯穿到激活expert_dtype: fp4意味着专家权重以 FP4 存储quantization_config又定义了 FP8e4m3动态激活量化。轻量化不是部署时的可选操作而是出厂即标配。如果把 166.9 GB 拆开看大部分开销来自 DSpark 投机解码模块draft 模型 马尔可夫头 置信度头。这也解释了为什么 V4.1 Flash 的「基础模型仅 113.6GB」会成为社区热点——去掉投机解码附件的纯主干才是 Flash 轻量化的真实底盘。二、源码里的轻量化工程MLA、MoE 与 FP4/FP8 三板斧在 inference/model.py 中轻量化不是口号而是一套可运行的工程实现。注意力滑窗 KV 压缩 索引检索。Flash 没有走「全量长上下文注意力」的笨重路线。Attention类inference/model.py第 442 行起实现了 MLAMulti-head Latent Attention用q_lora_rank1024的低秩 Q 投影和分组低秩 O 投影压缩注意力算力sliding_window: 128限定近距离注意力范围真正撑起百万上下文的是Compressor与Indexer——前者通过可学习的门控池化把每compress_ratio4 或 128见 config 中的compress_ratios数组个连续 token 压成一个 KV后者用一个独立的带 Hadamard 旋转的压缩器打分从压缩后的 KV 中选出 top-512 的索引参与稀疏注意力。KV 缓存以 1M/4 ≈ 26 万条常驻内存占用被压到传统方案的几十分之一。MoE前 3 层连路由都省了。num_hash_layers: 3意味着前 3 层使用 hash 路由——Gate.forward中直接查tid2eid表inference/model.py第 581-583 行按 token id 硬路由到固定专家连门控打分矩阵都无需计算。其余层用sqrtsoftplus打分 top-6 选择 1 个共享专家兜底。这是一种激进的「轻」在浅层放弃学习式路由换回确定的、可缓存的路由开销。量化FP4 权重 FP8 激活量化粒度小到 32 元素。inference/kernel.py 中的fp4_quant_kernel以 block_size32 对激活做 FP4 量化scale 使用float8_e8m0fnu指数格式MXFP 风格配合fast_round_scale的位运算幂次缩放fp4_gemm直接吃 FP4 权重矩阵做乘加。rotate_activation用随机 Hadamard 旋转把信息摊匀后再量化缓解低比特下的离群值问题——这是把「量化损失」转化为「可接受的精度-速度权衡」的关键一招。投机解码DSpark 让「轻」直接变快。DSparkBlock与DSparkMarkovHead、DSparkConfidenceHeadinference/model.py第 750-815 行构成完整的投机解码模块主模型每步产出候选draft 模块马尔可夫头 置信度头一次预测dspark_block_size5个 token 并给出接受概率。README 中 vLLM 只需一行--speculative-config {method:dspark,...}即可开启SGLang 侧同样内置--speculative-algorithm DSPARK。轻量化的尽头是延迟而投机解码正是把延迟红利兑换成生成速度的引擎。三、Agent 能力的跃迁0731 为什么是「正式版」0731 与预览版最大的差异不在参数而在 Agent 相关基准上的全面爆发。README 的对比表给出了完整证据Benchmark0731 正式版预览版V4-Pro 预览版Terminal Bench 2.182.761.872.1DeepSWE54.47.312.8Cybergym76.738.752.7NL2Repo54.239.438.5Agents Last Exam25.215.816.5Terminal Bench 提升 20.9 分、DeepSWE 从 7.3 飙到 54.4、Cybergym 从 38.7 翻倍到 76.7——在所有公开 Agent 基准上0731 以远小于 Pro 的激活参数反超 Pro 预览版。这印证了社区分析中的核心观点Flash 的能力跃迁来自后训练对 Agent 行为的强化而非模型规模。仓库为此配套了完整的工程化支撑。encoding/encoding_dsv4.py 提供 OpenAI 兼容消息到模型输入串的编码实现核心是 DSML 标记语言【免费下载链接】DeepSeek-V4-Flash-0731项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Flash-0731创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考