RTDETRv2 与 EfficientDet#
选择最优的神经网络架构是任何计算机视觉项目中的关键决策。本技术对比全面剖析了两种具有重要影响力的目标检测模型:RTDETRv2(一种先进的基于 Transformer 的检测器)和 EfficientDet(一种高度可扩展的卷积神经网络)。我们将评估它们各自的架构、性能指标、训练方法以及理想的部署场景,帮助你为 AI 流水线做出数据驱动的决策。
RTDETRv2:实时检测 Transformer#
RTDETRv2 在原始 RT-DETR 成功的基础上,进一步改进了基于 Transformer 的目标检测范式。通过优化编码器和解码器结构,它在保持实时推理速度的同时实现了高精度,有效弥合了传统 CNN 与视觉 Transformer 之间的差距。
模型详情
- 作者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
- 组织: Baidu
- 日期: 2024-07-24
- 链接: Arxiv、GitHub、文档
架构与核心优势#
RTDETRv2 采用混合架构,将强大的 CNN 主干网络(通常为 ResNet 或 HGNet)与高效的 Transformer 解码器相结合。RTDETRv2 最具代表性的特征是能够原生绕过非极大值抑制(NMS)。传统检测器需要使用 NMS 过滤重复的边界框,这会在后处理过程中增加不稳定的推理延迟。RTDETRv2 将检测建模为直接的集合预测问题,利用二分图匹配输出唯一预测结果。
该模型非常适合部署在 GPU 内存充足的服务器端。其全局注意力机制提供了出色的上下文感知能力,因此非常擅长在自动化安防报警系统或密集人群监控等拥挤、杂乱的环境中分离重叠目标。
限制#
Transformer 架构虽然功能强大,但在训练期间通常比标准 CNN 需要更多 CUDA 内存。此外,微调 RTDETRv2 可能需要更长的训练数据收敛时间,因此快速原型开发的资源消耗会略高。
EfficientDet:可扩展且高效的 CNN#
EfficientDet 推出了一系列目标检测模型,针对广泛的资源约束进行了精度和效率优化。它仍然是可扩展机器视觉设计的经典范例。
模型详情
架构与核心优势#
EfficientDet 的创新主要体现在两个关键方面:双向特征金字塔网络(BiFPN)和复合缩放方法。BiFPN 通过引入可学习权重来学习不同输入特征的重要性,并反复执行自顶向下和自底向上的多尺度特征融合,从而实现简单快速的多尺度特征提取;复合缩放方法则同时均匀缩放网络的分辨率、深度和宽度。
EfficientDet 模型范围从超轻量级的 D0 到大型的 D7。这使其非常适合边缘 AI部署,开发者需要在有限的计算预算与精度要求之间取得平衡,例如早期的移动增强现实应用。
限制#
EfficientDet 是一种较老的架构,高度依赖锚框和传统的 NMS 后处理流程。锚框生成过程需要仔细进行超参数调优,而 NMS 步骤可能会在 Raspberry Pi 等嵌入式硬件上造成部署瓶颈。此外,它不原生支持姿态估计或有向边界框(OBB)等现代任务。
性能与指标对比#
要准确理解这些模型之间的权衡,需要分析它们的吞吐量和参数效率。下表概述了现代 RTDETRv2 系列与可扩展 EfficientDet 系列之间的对比。
| 模型 | 尺寸 (像素) | mAPval 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (毫秒) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
如上所示,与中端 EfficientDet 模型的参数量相当时,RTDETRv2 实现了显著更高的平均精度(mAP),并充分利用其 Transformer 架构来提升精度。
使用场景与建议#
在 RT-DETR 和 EfficientDet 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。
何时选择 RT-DETR#
RT-DETR 适合以下场景:
- 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测的项目。
- 高精度且延迟灵活的场景: 将检测精度置于首要位置,并且可以接受略高推理延迟的应用。
- 大型目标检测: 主要包含中大型目标的场景,在这些场景中,Transformer 的全局注意力机制具有天然优势。
何时选择 EfficientDet#
以下场景推荐使用 EfficientDet:
- **Google Cloud 和 TPU 流水线:**与 Google Cloud Vision API 或 TPU 基础设施深度集成的系统,EfficientDet 在其中具有原生优化。
- **复合缩放研究:**专注于研究网络深度、宽度和分辨率均衡缩放效果的学术基准测试。
- **通过 TFLite 进行移动端部署:**明确要求导出为 TensorFlow Lite 以用于 Android 或嵌入式 Linux 设备的项目。
何时选择 Ultralytics (YOLO26)#
对于大多数新项目,Ultralytics YOLO26 在性能和开发者体验之间提供了最佳组合:
- 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
- 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
- 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。
Ultralytics 替代方案:推进先进技术#
RTDETRv2 和 EfficientDet 都各具优势,但现代 AI 开发需要能够将无缝的开发者体验与前沿性能相结合的框架。Ultralytics 生态系统为计算机视觉任务提供了更加简化的解决方案。
如果你正在探索先进的检测技术,新发布的 Ultralytics YOLO26融合了 CNN 和 Transformer 的优点。
YOLO26 实现了端到端无 NMS 设计,将 RTDETRv2 的部署简便性带入超高效的 YOLO 架构。此外,它还引入了MuSGD 优化器——其灵感来自 LLM 训练创新——从而实现更出色的训练稳定性。借助移除 DFL(移除分布焦点损失,以简化导出并提升对边缘设备和低功耗设备的兼容性),YOLO26 的 CPU 推理速度比前代产品最高提升 43%,使其相比更庞大的模型成为边缘计算的出色选择。此外,ProgLoss + STAL 提供了改进的损失函数,在小目标识别方面取得了显著提升,这对于 IoT、机器人和航空影像至关重要。
Ultralytics Python 包提供了无与伦比的易用性。开发者可以通过直观的 API 训练、验证和导出模型,无需编写研究代码仓库通常要求的大量样板代码。
from ultralytics import RTDETR
# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export for optimized inference on TensorRT
model.export(format="engine")Ultralytics 模型原生支持多种任务,包括实例分割和图像分类,为各行业的不同需求提供了灵活的工具包。此外,现代 Ultralytics 模型移除了分布焦点损失(DFL),简化了计算图,确保能够更顺畅地导出到嵌入式 NPU 和 TPU。
对于无缝的数据标注和模型管理,Ultralytics Platform提供了全面的云环境,用于管理整个机器学习生命周期,使其成为在生产环境中部署可靠计算机视觉解决方案的首选。