文章背景图

DETR学习

2026-08-27
3
-
- 分钟

一、DETR 框架概览

DETR(DEtection TRansformer)将目标检测重构为集合预测问题,是首个真正意义上的端到端目标检测框架。其核心贡献在于:

  • 彻底移除人工先验:不再依赖 Anchor 生成与 NMS 后处理,把繁琐的调参工作交给模型自身。

  • Transformer 全局建模:CNN 提取特征后,通过 Transformer Encoder 进行全局交互,使每个特征点都能感知图像中其他区域的信息,有效消除冗余框。

  • 并行解码输出:Decoder 不带掩码,一次性并行输出 100 个固定数量的检测框,大幅提升推理时效性。


二、基于集合的目标函数与二分图匹配

2.1 匹配策略

  • 将 100 个预测框与 Ground Truth 的对应关系转化为二分图匹配问题,使用匈牙利算法求得最优的一对一匹配。

  • 训练时“先匹配后算账”,推理时则直接通过 0.7 置信度阈值​ 筛选前景物体,无需再运行匹配逻辑。

2.2 损失函数设计

损失类型

设计细节

动机

分类损失

去掉对数运算(log)

避免与边界框损失的取值空间差异过大

边界框损失

L1 Loss + Generalized IoU Loss

缓解大框导致 L1 损失过大的问题,归一化梯度差异


三、模型网络架构

输入图像 → ResNet Backbone → 1×1卷积降维 → 位置编码 → Transformer Encoder → Transformer Decoder → FFN检测头

3.1 输入与特征投射

  • 输入图片经 ResNet 提取 2048 维特征,再通过 1×1 卷积降维至 256 维,并加入固定位置编码(Transformer 本身不包含位置信息)。

3.2 编码器(Encoder)

  • 序列拉直后送入 6 层 Transformer Encoder,强化全局语义特征,为 Decoder 提供支撑。

  • 可视化显示 Encoder 能有效恢复遮挡物体的完整轮廓,甚至具备初步分割能力。

3.3 解码器(Decoder)与 Object Query

  • 引入 100×256 的可学习位置嵌入作为 Object Query,与全局特征在 Decoder 中通过交叉注意力交互,生成 100 个预测。

  • Object Query 自发学习到类似 Anchor 的空间偏好模式(如“询问”左下角或中心的大横向物体),成功替代了手工设计的 Anchor。

  • Decoder 注意力聚焦于物体边缘、蹄子等细微处,有效解决严重遮挡问题,与 Encoder 形成互补。

3.4 辅助损失机制

  • 每一层 Decoder 后均接入共享参数的 FFN 计算辅助损失,相当于给模型加“阶段性考核”,加速收敛并稳定训练。


四、模型性能与消融实验

4.1 整体表现(COCO 数据集)

模型

AP

备注

DETR 基线

44%

与 Faster R-CNN DC5 相当,但推理速度较慢、参数量更大

Faster R-CNN

~44%

小物体领先 DETR 4 个点

DETR(大物体)

反超 6 个点

得益于全局注意力机制

  • 大物体检测:DETR 显著优于基线,全局建模优势明显。

  • 小物体检测:因缺乏多尺度特征,表现较差。

  • 效率对比:参数量与计算量相近时,DETR 推理速度仅为 Faster R-CNN 的一半,且精度提升微乎其微。

4.2 编码器层数分析

  • Encoder 层数增加可持续提升性能,但需权衡参数量与速度。3 层左右较为均衡,原论文取 6 层是偏理论最优的选择。


五、Object Query 的可学习特性

  • 100 个 Query 自发学习到类似 Anchor 的空间偏好模式,例如:

    • 绿色点:小横向边界框

    • 红色点:大横向边界框

  • 因 COCO 数据集中图像中心常存在大物体,所有 Query 都倾向于“询问”中心区域,印证了模型对数据分布的高度敏感。


六、框架局限性与后续演进

6.1 原版 DETR 的短板

问题

具体表现

训练耗时过长

COCO 数据集需训练 500 个 Epoch,收敛极慢

小物体检测差

缺乏多尺度特征融合,小目标精度不足

6.2 Deformable DETR —— 里程碑式改进

  • 核心改进:引入可变形注意力多尺度特征

  • 效果:仅需常规训练时长即可大幅提升小物体性能,补齐了原版的两大短板。

  • 代价:需自写 CUDA 算子,平台适配与部署较原版繁琐。原版 DETR 虽性能稍逊,但胜在开箱即用,这也是其能成为经典基座的重要原因。

6.3 学术影响力

  • DETR 催生了大批后续工作,被对标为与 ResNet、ViT、CLIP​ 并列的计算机视觉里程碑式工作

  • 其通用性已拓展至全景分割、目标追踪、视频分割等任务,成功开辟了一个全新的研究赛道。


七、核心总结

DETR 的本质是用可学习的 Object Query 替代传统 Anchor,用二分图匹配取代 NMS,把以前靠人工经验调参的“死规矩”,全换成了让模型自己学的“活路子”。

传统检测器

DETR

手工设计 Anchor

可学习 Object Query

NMS 后处理

二分图匹配(一对一)

局部特征提取

全局 Transformer 建模

串行/密集预测

并行固定数量输出

一句话概括:DETR 用 Transformer 的全局建模能力和匈牙利算法的严格匹配,实现了目标检测从“繁琐后处理”到“端到端极简”的跨越,虽初期存在效率与小物体短板,但其开创性的框架设计直接推动了检测领域的新一轮范式革命。


💡 延伸建议:感兴趣的同学可阅读 Facebook Research 开源的 DETR 代码库,代码质量极高,是极佳的学习范本。

首页 关于

文章目录