YOLOv13改进策略【注意力机制篇】| 2024 VMamba VSS 状态空间扫描,线性复杂度的全局注意力

发布时间:2026/10/3 8:39:32
YOLOv13改进策略【注意力机制篇】| 2024 VMamba VSS 状态空间扫描,线性复杂度的全局注意力
本文基于YOLOv13 官方仓库(iMoonLab/yolov13,ultralytics 8.3.63 fork)实测整理,Windows/CPU 全程可跑。VMamba(Zhu et al.,NeurIPS 2024《VMamba: Visual State Space Model》,arXiv 2401.10166,官方源码 github.com/MzeroMiko/VMamba)把 Mamba 的选择性状态空间搬进视觉:SS2D 用 4 方向交叉扫描把 2D 特征图摊成 4 条序列各自做 S6 递推,再按原方向合并——全局感受野、复杂度随像素线性长,没有 QK^T。本文把官方 VSSBlock(SS2D v0 naive 路径:d_model=256、d_state=16、4 方向扫描)插进 v13n 层 8 之后,实测+1,093,888 参数、GFLOPs 6.54→7.28,与官方类 naive 路径逐位一致(max diff = 0;使用官方 naive/参考实现路径,CUDA selective_scan 未启用,训练大图会更慢但数值一致),1 轮冒烟训练正常完成。前言注意力的账本是 O(N²):20×20 的 P5 出口还好,80×80 的 P3 上就是一场灾难。2024 年 Mamba 给了另一本账——状态空间递推:一条序列从头扫到尾,每个位置只维护一个隐状态,“看过多少"记在状态里而不是两两相似度里,复杂度 O(N)。VMamba 的贡献是把