RTDETRv2 与 EfficientDet#
选择最优的神经网络架构是任何计算机视觉项目的决定性选择。这份全面的技术对比剖析了两个有影响力的目标检测模型:基于 Transformer 的先进检测器 RTDETRv2,以及高度可扩展的卷积神经网络 EfficientDet。我们将评估它们的独特架构、性能指标、训练方法和理想的部署方案,帮助你为 AI 管道做出基于数据的决策。
RTDETRv2:实时检测 Transformer#
在继承原版 RT-DETR 成功的基础上,RTDETRv2 进一步完善了基于 Transformer 的目标检测范式。通过优化编码器和解码器结构,它在保持实时推理速度的同时提供了高准确率,有效地弥合了传统 CNN 与视觉 Transformer 之间的差距。
模型详情
作者:Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
组织:Baidu
日期:2024-07-24
链接:Arxiv、GitHub、Docs
架构与核心优势#
RTDETRv2 采用混合架构,将强大的 CNN 主干网络(通常为 ResNet 或 HGNet)与高效的 Transformer 解码器相结合。RTDETRv2 最具决定性的特征是其能够原生跳过非极大值抑制(NMS)。传统检测器需要 NMS 来过滤掉重复的边界框,在后处理期间会增加可变的推理延迟。RTDETRv2 将检测建模为一个直接集合预测问题,利用二分图匹配来输出唯一的预测结果。
该模型在 GPU 内存充足的服务器端部署中表现出色。其全局注意力机制提供了卓越的上下文感知能力,使其非常擅长在自动化安全报警系统或密集人群监控等拥挤、复杂的环境中分离重叠对象。
局限性#
尽管功能强大,但 Transformer 架构在训练期间天然比标准 CNN 需要更多的 CUDA 内存。此外,微调 RTDETRv2 可能需要更长的训练数据收敛时间,这使得快速原型制作稍微更加消耗资源。
EfficientDet:可扩展且高效的 CNN#
EfficientDet 引入了一系列针对广泛资源限制下的准确率和效率进行优化的目标检测模型。它仍然是可扩展机器视觉设计的一个经典范例。
模型详情
作者:Mingxing Tan、Ruoming Pang 和 Quoc V. Le
组织:Google
Date:2019-11-20
链接:Arxiv、GitHub、Docs
架构与核心优势#
EfficientDet 的创新在于两个关键领域:双向特征金字塔网络(BiFPN)和复合缩放方法。BiFPN 通过引入可学习的权重来了解不同输入特征的重要性,同时重复应用自顶向下和自底向上的多尺度特征融合,从而实现简单且快速的多尺度特征提取。复合缩放方法则同时对网络的解析度、深度和宽度进行统一缩放。
EfficientDet 模型从超轻量级的 D0 到庞大的 D7 不等。这使它们在需要开发者平衡严格的计算预算与准确率要求的边缘 AI部署中具有极高的通用性,例如早期的移动端增强现实应用程序。
局限性#
EfficientDet 是一种较旧的架构,严重依赖锚框和传统的 NMS 后处理管道。锚框生成过程需要仔细的超参数调整,并且 NMS 步骤可能会成为在Raspberry Pi等嵌入式硬件上部署的瓶颈。它还缺乏对姿态估计或旋转边界框 (OBB)等现代任务的原生支持。
性能与指标对比#
要理解这些模型之间的确切权衡,需要分析它们的吞吐量和参数效率。下表概述了现代 RTDETRv2 系列与可扩展 EfficientDet 系列的比较。
| 模型 | 尺寸 (像素) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
如上所示,在中等规模的 EfficientDet 模型参数量相近的情况下,RTDETRv2 实现了显著更高的平均准确率均值 (mAP),这极大地利用了其 Transformer 架构来提升准确率。
应用场景与建议#
选择 RT-DETR 还是 EfficientDet 取决于你的具体项目需求、部署限制和生态系统偏好。
何时选择 RT-DETR#
RT-DETR 在以下情况是一个强有力的选择:
- 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构以实现无 NMS 的端到端目标检测的项目。
- 高精度、延迟要求宽松的场景: 将检测精度置于首位,且可以容忍稍高推理延迟的应用。
- 大目标检测: 以中大型目标为主的场景,在这种场景下,Transformer 的全局注意力机制具有天然优势。
何时选择 EfficientDet#
推荐使用 EfficientDet 的场景:
- Google Cloud 和 TPU 流水线: 与 Google Cloud Vision API 或 TPU 基础设施深度集成的系统,EfficientDet 在其中具有原生优化优势。
- 复合缩放研究: 专注于研究平衡网络深度、宽度和分辨率缩放效果的学术基准测试。
- **通过TFLite进行移动端部署:**专门要求为Android或嵌入式Linux设备导出TensorFlow Lite的项目。
何时选择 Ultralytics (YOLO26)#
对于大多数新项目,Ultralytics YOLO26 提供了性能与开发者体验的最佳结合:
- 无 NMS 的边缘部署: 需要一致、低延迟推理且无需复杂非极大值抑制后处理的应用。
- 仅 CPU 环境: 没有专用 GPU 加速的设备,YOLO26 带来的高达 43% 的 CPU 推理提速可提供决定性优势。
- 小目标检测: 诸如航拍无人机图像或物联网传感器分析等具有挑战性的场景,其中 ProgLoss 和 STAL 显著提高了微小目标的准确率。
Ultralytics 的替代方案:推进最先进技术#
尽管 RTDETRv2 和 EfficientDet 各有强大的优势,但现代 AI 开发要求框架能够提供无缝的开发者体验以及尖端的性能。Ultralytics 生态系统为计算机视觉任务提供了一种更加精简的方法。
如果你正在探索最先进的检测技术,新发布的 Ultralytics YOLO26 综合了 CNN 和 Transformer 的最佳特性。
YOLO26 实现了端到端免 NMS 设计,将 RTDETRv2 的部署简便性引入了超高效的 YOLO 架构中。此外,它引入了受大模型训练创新启发的 MuSGD 优化器,可带来更卓越的训练稳定性。通过移除 DFL(移除了分布焦点损失以简化导出并提升对边缘/低功耗设备的兼容性),YOLO26 的 CPU 推理速度比前几代产品快高达 43%,使其成为相较于较重模型而言,进行边缘计算的绝佳选择。此外,ProgLoss + STAL 提供了改进的损失函数,在小目标识别方面取得了显著提升,这对于物联网、机器人和航空影像至关重要。
Ultralytics Python 软件包提供的易用性是无与伦比的。开发者可以使用直观的 API 来训练、验证和导出模型,该 API 抽象掉了研究代码库通常所需的样板代码。
from ultralytics import RTDETR
# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export for optimized inference on TensorRT
model.export(format="engine")Ultralytics 模型原生支持多项任务,包括实例分割和图像分类,为多样化的行业需求提供了一个多功能的工具包。此外,在现代 Ultralytics 模型中移除分布焦点损失(DFL)简化了计算图,保证了向嵌入式NPU 和 TPU的更顺畅导出。
为了实现无缝的数据标注和模型管理,Ultralytics 平台提供了一个全面的云环境来监督整个机器学习生命周期,使其成为在生产环境中部署强大计算机视觉解决方案的首选。