RTDETRv2 与 EfficientDet#
为任何计算机视觉项目选择最佳神经网络架构,都是一项关键决策。这篇全面的技术对比深入剖析了两种有影响力的目标检测模型:基于 Transformer 的先进检测器 RTDETRv2,以及高度可扩展的卷积神经网络 EfficientDet。我们将评估它们各自的架构、性能指标、训练方法和理想部署场景,帮助你为 AI 流程做出数据驱动的决策。
RTDETRv2:实时检测 Transformer#
在原版 RT-DETR 成功的基础上,RTDETRv2 改进了基于 Transformer 的目标检测范式。通过优化编码器和解码器结构,它在保持实时推理速度的同时实现了高精度,有效弥合了传统 CNN 和视觉 Transformer 之间的差距。
模型详情
- 作者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
- 组织: 百度
- 日期: 2024-07-24
- 链接: Arxiv、GitHub、文档
架构与核心优势#
RTDETRv2 采用混合架构,将强大的 CNN 骨干网络(通常为 ResNet 或 HGNet)与高效的 Transformer 解码器相结合。RTDETRv2 最显著的特点是原生支持绕过非极大值抑制(NMS)。传统检测器需要借助 NMS 过滤重复边界框,这会在后处理期间增加不稳定的推理延迟。RTDETRv2 将检测建模为直接集合预测问题,通过二分图匹配输出唯一预测结果。
该模型在 GPU 内存充足的服务器端部署环境中表现出色。其全局注意力机制能提供出色的上下文感知能力,因此特别擅长分离密集、杂乱环境中的重叠对象,例如自动化安全报警系统或密集人群监控场景。
局限性#
虽然 Transformer 架构功能强大,但与标准 CNN 相比,训练时固有地需要更多 CUDA 内存。此外,微调 RTDETRv2 可能需要较长的训练数据收敛时间,因此快速原型开发的资源开销会略高。
EfficientDet:可扩展、高效的 CNN#
EfficientDet 推出了一系列目标检测模型,可在各种资源限制下兼顾精度和效率。它仍是可扩展机器视觉设计的经典范例。
模型详情
架构与核心优势#
EfficientDet 的创新体现在两个关键领域:双向特征金字塔网络(BiFPN)和复合缩放方法。BiFPN 通过引入可学习权重来学习不同输入特征的重要性,并反复进行自上而下和自下而上的多尺度特征融合,从而实现简单、快速的多尺度特征提取;复合缩放方法则同时对网络的分辨率、深度和宽度进行统一缩放。
EfficientDet 模型涵盖从超轻量级 D0 到庞大的 D7。因此,它们非常适用于边缘 AI部署;在这类场景中,开发者必须在有限的计算预算和精度要求之间取得平衡,例如早期移动端增强现实应用。
局限性#
EfficientDet 是一种较旧的架构,严重依赖锚框和传统的 NMS 后处理流程。生成锚框需要仔细进行超参数调优,而 NMS 步骤可能会成为 Raspberry Pi 等嵌入式硬件上的部署瓶颈。它也不原生支持姿态估计或有向边界框(OBB)等现代任务。
性能与指标对比#
要准确了解这些模型之间的权衡,需要分析它们的吞吐量和参数效率。下表概述了现代 RTDETRv2 系列与可扩展 EfficientDet 系列的对比。
| 模型 | 尺寸 (像素) | mAP验证集 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (ms) | 参数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
如上所示,RTDETRv2 的平均精度均值(mAP)达到或超过了尺寸相近的 EfficientDet 模型,同时 GPU 运行速度快得多(例如,RTDETRv2-l 的 mAP 为 53.4、耗时 9.76 毫秒,而 EfficientDet-d6 的 mAP 为 52.6、耗时 89.29 毫秒);它充分利用 Transformer 架构来提升精度。
用例与建议#
在 RT-DETR 和 EfficientDet 之间做选择,取决于你的具体项目需求、部署限制和生态系统偏好。
何时选择 RT-DETR#
以下场景适合选择 RT-DETR:
- 基于 Transformer 的检测研究:探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测。
- 对延迟要求灵活的高精度场景:检测准确率至关重要,且可以接受略高推理延迟的应用。
- 大型目标检测:场景中的目标以中大型为主,此时 Transformer 的全局注意力机制能够发挥天然优势。
何时选择 EfficientDet#
以下情况推荐使用 EfficientDet:
- Google Cloud 和 TPU 流水线:与 Google Cloud Vision API 或 TPU 基础设施深度集成,且 EfficientDet 能进行原生优化的系统。
- 复合缩放研究:侧重研究网络深度、宽度和分辨率平衡缩放效果的学术基准测试。
- 通过 LiteRT 进行移动端部署:需要导出为 LiteRT(原名 TensorFlow Lite),以用于 Android 或嵌入式 Linux 设备的项目。
何时选择 Ultralytics (YOLO26)#
对于大多数新项目,Ultralytics YOLO26在性能与开发体验之间实现了最佳平衡:
- 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
- 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
- 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。
Ultralytics 替代方案:推动技术达到最先进水平#
虽然 RTDETRv2 和 EfficientDet 各有优势,但现代 AI 开发需要的不仅是前沿性能,还需要流畅的开发者体验框架。Ultralytics 生态系统为计算机视觉任务提供了更加精简流畅的解决方案。
如果你正在探索最先进的检测技术,最新发布的 Ultralytics YOLO26融合了 CNN 和 Transformer 的优点。
YOLO26 实现了可选的端到端无 NMS 设计(nms=False),将 RTDETRv2 的部署简便性带入超高效的 YOLO 架构。此外,它还引入了MuSGD 优化器,其灵感源于 LLM 训练创新,可大幅提升训练稳定性。通过移除 DFL(移除分布焦点损失,简化导出并提升对边缘设备和低功耗设备的兼容性),YOLO26 的 CPU 推理速度比前代产品最高快 43%,因此相较于更大型的模型,它是边缘计算的出色选择。此外,ProgLoss + STAL 带来了改进的损失函数,显著提升了小目标识别能力,这对 IoT、机器人和航空影像至关重要。
Ultralytics Python 软件包的易用性无与伦比。开发者可以通过直观的 API 训练、验证和导出模型,而无需编写研究代码库通常要求的大量样板代码。
from ultralytics import RTDETR
# 从 Ultralytics 生态系统加载预训练的 RT-DETR 模型
model = RTDETR("rtdetr-l.pt")
# 使用 COCO8 数据集训练模型
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 导出模型,以便使用 TensorRT 优化推理
model.export(format="engine")Ultralytics 模型原生支持多种任务,包括实例分割和图像分类,为各种行业需求提供了多功能工具包。此外,现代 Ultralytics 模型移除了分布焦点损失 (DFL),简化了计算图,确保模型能够更顺畅地导出到嵌入式 NPU 和 TPU。
为了轻松完成数据标注和模型管理,Ultralytics Platform提供了全面的云端环境,帮助你管理整个机器学习生命周期,是在生产环境中部署稳健计算机视觉解决方案的首选。