CenterPoint — Center-based 3D Object Detection and Tracking论文精读
一、论文基本信息项目内容标题Center-based 3D Object Detection and Tracking作者Tianwei Yin, Xingyi Zhou, Philipp Krähenbühl单位UT Austin发表arXiv 2020NeurIPS 2020 nuScenes挑战赛 Top 4中3个方案采用代码https://github.com/tianweiy/CenterPoint关键词3D目标检测、3D目标跟踪、中心点表示、点云、自动驾驶二、研究动机与核心思想2.1 核心问题3D世界中的物体不遵循任何特定朝向而基于框anchor的检测器难以枚举所有朝向也难以用轴对齐框去拟合旋转物体。2.2 Anchor-based方法的困境问题说明朝向枚举困难需要为每个朝向设置不同anchor模板计算负担大轴对齐框不适配3D旋转框无法用2D轴对齐框良好近似IoU阈值敏感训练依赖2D Box IoU进行正负样本分配不同类别/数据集需不同阈值转弯场景失效车辆左转时anchor-based方法难以检测旋转物体见Figure 12.3 核心洞察将3D物体表示为点中心点而非框。点没有内在朝向 → 大幅减少搜索空间点表示天然旋转不变 → backbone学习旋转等变性点表示简化跟踪 → 轨迹就是时空中的路径三、方法详解3.1 整体框架点云 → [3D Backbone (VoxelNet/PointPillars)] → BEV特征图M ↓ [第一阶段中心点检测头] - 热力图中心点 - 尺寸/高度/朝向/速度回归 ↓ [第二阶段精炼] - 5个表面中心点特征提取 - IoU引导置信度 框回归精炼 ↓ [跟踪贪心最近点匹配]3.2 第一阶段中心点检测① 中心热力图头Center Heatmap Head输出KKK通道热力图Y^∈[0,1]W×H×K\hat{Y} \in [0,1]^{W \times H \times K}Y^∈[0,1]W×H×KKKK为类别数训练目标在每个GT物体中心的BEV投影处渲染2D高斯核使用Focal Loss监督关键改进 — 增大高斯半径σmax(f(w,l), τ),τ2\sigma \max(f(w, l),\ \tau), \quad \tau 2σmax(f(w,l),τ),τ2原因BEV俯视图中物体比图像中更稀疏标准CenterNet的高斯半径导致监督信号过于稀疏。增大半径使模型获得更密集的监督。② 回归头Regression Heads在中心点特征处回归以下属性属性维度说明亚体素偏移oooR2\mathbb{R}^2R2补偿体素化和stride引入的量化误差离地高度hgh_ghgR\mathbb{R}R补充BEV投影丢失的高程信息3D尺寸sssR3\mathbb{R}^3R3回归对数尺寸处理不同尺度朝向(sinα,cosα)(\sin\alpha, \cos\alpha)(sinα,cosα)R2\mathbb{R}^2R2连续回归目标每个属性使用独立的卷积分支训练时仅在GT中心位置用L1 Loss监督③ 速度头Velocity Head与跟踪预测2D速度v∈R2v \in \mathbb{R}^2v∈R2当前帧与上一帧物体位置差需要两帧输入当前帧 前一帧同样用L1 Loss监督跟踪算法极简用负速度将当前帧检测中心投影回上一帧与已有轨迹进行最近距离贪心匹配未匹配轨迹保留T3T3T3帧后删除无需卡尔曼滤波器跟踪仅需1ms3.3 第二阶段精炼Two-Stage Refinement动机第一阶段所有属性都从中心点特征推断但传感器通常只能看到物体侧面中心点可能无观测方法第一阶段预测的3D框 → 提取5个点的特征 → MLP → 置信度分数 框精炼 ↑ 框中心 4个外侧面中心 顶面和底面中心与框中心在BEV重合从backbone的BEV特征图MMM中用双线性插值提取特征拼接5个点特征 → 共享2层MLP → 两个分支置信度目标IoU引导Imin(1, max(0, 2×IoUt−0.5))I \min(1,\ \max(0,\ 2 \times \text{IoU}_t - 0.5))Imin(1,max(0,2×IoUt−0.5))Lscore−Itlog(I^t)−(1−It)log(1−I^t)L_{\text{score}} -I_t \log(\hat{I}_t) - (1-I_t)\log(1-\hat{I}_t)Lscore−Itlog(I^t)−(1−It)log(1−I^t)最终置信度Q^tY^t⋅I^t\hat{Q}_t \sqrt{\hat{Y}_t \cdot \hat{I}_t}Q^tY^t⋅I^t第一阶段类别分数与第二阶段IoU分数的几何平均3.4 网络架构细节组件结构第一阶段共享层3×3 Conv BN ReLU各回归分支2个 3×3 ConvBN ReLU第二阶段MLP2层共享MLPBN ReLU Dropout 0.3→ 2个3层FC分支3.5 训练配置项目nuScenesWaymo检测范围[−51.2,51.2]2[-51.2, 51.2]^2[−51.2,51.2]2m,[−5,3][-5, 3][−5,3]m[−75.2,75.2]2[-75.2, 75.2]^2[−75.2,75.2]2m,[−2,4][-2, 4][−2,4]mVoxel大小0.1×0.1×0.2 m0.1×0.1×0.15 mPillar大小0.2×0.2 m0.32×0.32 m优化器AdamWAdamW学习率1e-3 (one-cycle)3e-3 (one-cycle)Batch Size16 (4×V100)—Epochs2030数据增强翻转 缩放 旋转 GT采样翻转 缩放 旋转二阶段采样128个框1:1正负比IoU0.55为正同左四、实验结果4.1 Waymo测试集 — 3D检测方法Vehicle mAPH (L2)Pedestrian mAPH (L2)PointPillars55.145.1PPBA59.155.8RCD64.7—CenterPoint71.866.4超越此前所有方法车辆 7.1 mAPH行人 10.6 mAPH4.2 nuScenes测试集 — 3D检测方法mAP↑NDS↑PKL↓PointPillars40.155.01.00CBGS (2019冠军)52.863.30.77CenterPoint58.065.50.69超越去年冠军 5.2 mAP, 2.2 NDS4.3 3D跟踪Waymo测试集方法Vehicle MOTA (L2)Pedestrian MOTA (L2)AB3D (官方基线)40.137.7CenterPoint59.456.6超越官方基线 19.4 / 18.9 MOTAnuScenes测试集方法AMOTA↑IDS↓AB3D15.19027Chiu et al. (2019冠军)55.0950CenterPoint63.8760超越去年冠军 8.8 AMOTA跟踪仅需1ms4.4 推理速度数据集速度Waymo11 FPSnuScenes16 FPS五、关键消融实验5.1 Center-based vs Anchor-based核心对比Waymo验证集Backbone方法VehiclePedestrian平均 mAPHVoxelNetAnchor-based66.154.460.3VoxelNetCenter-based66.562.764.6 (4.3)PointPillarsAnchor-based64.150.857.5PointPillarsCenter-based66.557.462.0 (4.5)仅切换表示方式anchor→center即获得3-4 mAP提升5.2 不同朝向角度的性能Waymo验证集方法车辆 0°-15°车辆 30°-45°行人 0°-15°行人 30°-45°Anchor-based67.145.455.926.5Center-based67.851.6 (6.2)64.035.7 (9.2)对大角度旋转物体center-based优势极为显著。5.3 一阶段 vs 二阶段配置VehiclePedestrian额外耗时一阶段66.562.7—框中心特征68.064.95ms表面中心特征68.365.36ms密集采样(6×6)68.265.48ms5个表面中心点特征即可达到与密集采样相当的性能且更快更简单。5.4 跟踪器对比nuScenes验证集检测器跟踪器AMOTA跟踪耗时CenterPointPoint (本文)63.71msCenterPointKalman Filter60.073msCBGSPoint59.81msCBGSKalman Filter56.173ms简单的最近点匹配全面优于卡尔曼滤波器且快73倍。六、与SECOND的关系CenterPoint论文明确引用SECOND作为其3D backbone之一VoxelNet/SECOND对比维度SECOND (2018)CenterPoint (2020)检测表示Anchor-basedCenter-based (anchor-free)检测头RPN 固定anchor热力图关键点检测角度回归正弦损失 方向分类器sin/cos连续回归跟踪无速度预测 最近点匹配二阶段无5点特征精炼数据集KITTIWaymo nuScenes核心贡献稀疏卷积加速表示方式革新CenterPoint可视为在SECOND等backbone之上用更优的输出表示点代替框进一步提升性能。七、论文核心贡献总结✅提出center-based 3D检测框架将3D物体表示为点而非框天然旋转不变减少搜索空间✅设计轻量二阶段精炼仅提取5个表面中心点特征6ms即获2 mAP提升✅极简跟踪算法速度预测 贪心最近点匹配1ms完成无需卡尔曼滤波✅SOTA性能Waymo和nuScenes双榜第一NeurIPS 2020挑战赛Top4中3个方案采用八、局限性与讨论局限说明nuScenes二阶段无提升32线LiDAR仅30k点/帧点太稀疏限制了精炼效果行人检测受限于体素分辨率PointPillars中行人通常仅占1个像素依赖BEV投影仍丢失部分3D几何信息相比全3D方法未利用图像信息纯LiDAR方法未融合相机语义后续工作可改进九、一句话总结CenterPoint证明了一个简洁而深刻的洞察在3D世界中用点表示物体比用框更自然、更高效、更准确——检测是找中心点跟踪是连点成线。