Ultralytics YOLO27:
Get Started

RTDETRv2 与 EfficientDet#

为任何计算机视觉项目选择最佳神经网络架构,都是一项关键决策。这篇全面的技术对比深入剖析了两种有影响力的目标检测模型:基于 Transformer 的先进检测器 RTDETRv2,以及高度可扩展的卷积神经网络 EfficientDet。我们将评估它们各自的架构、性能指标、训练方法和理想部署场景,帮助你为 AI 流程做出数据驱动的决策。

RTDETRv2:实时检测 Transformer#

在原版 RT-DETR 成功的基础上,RTDETRv2 改进了基于 Transformer 的目标检测范式。通过优化编码器和解码器结构,它在保持实时推理速度的同时实现了高精度,有效弥合了传统 CNN 和视觉 Transformer 之间的差距。

模型详情

  • 作者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
  • 组织: 百度
  • 日期: 2024-07-24
  • 链接: Arxiv、GitHub、文档

架构与核心优势#

RTDETRv2 采用混合架构,将强大的 CNN 骨干网络(通常为 ResNet 或 HGNet)与高效的 Transformer 解码器相结合。RTDETRv2 最显著的特点是原生支持绕过非极大值抑制(NMS)。传统检测器需要借助 NMS 过滤重复边界框,这会在后处理期间增加不稳定的推理延迟。RTDETRv2 将检测建模为直接集合预测问题,通过二分图匹配输出唯一预测结果。

该模型在 GPU 内存充足的服务器端部署环境中表现出色。其全局注意力机制能提供出色的上下文感知能力,因此特别擅长分离密集、杂乱环境中的重叠对象,例如自动化安全报警系统或密集人群监控场景。

局限性#

虽然 Transformer 架构功能强大,但与标准 CNN 相比,训练时固有地需要更多 CUDA 内存。此外,微调 RTDETRv2 可能需要较长的训练数据收敛时间,因此快速原型开发的资源开销会略高。

进一步了解 RTDETRv2

EfficientDet:可扩展、高效的 CNN#

EfficientDet 推出了一系列目标检测模型,可在各种资源限制下兼顾精度和效率。它仍是可扩展机器视觉设计的经典范例。

模型详情

  • 作者: Mingxing Tan、Ruoming Pang 和 Quoc V. Le
  • 组织:Google
  • 日期: 2019-11-20
  • 链接: Arxiv、GitHub、文档

架构与核心优势#

EfficientDet 的创新体现在两个关键领域:双向特征金字塔网络(BiFPN)和复合缩放方法。BiFPN 通过引入可学习权重来学习不同输入特征的重要性,并反复进行自上而下和自下而上的多尺度特征融合,从而实现简单、快速的多尺度特征提取;复合缩放方法则同时对网络的分辨率、深度和宽度进行统一缩放。

EfficientDet 模型涵盖从超轻量级 D0 到庞大的 D7。因此,它们非常适用于边缘 AI部署;在这类场景中,开发者必须在有限的计算预算和精度要求之间取得平衡,例如早期移动端增强现实应用。

局限性#

EfficientDet 是一种较旧的架构,严重依赖锚框和传统的 NMS 后处理流程。生成锚框需要仔细进行超参数调优,而 NMS 步骤可能会成为 Raspberry Pi 等嵌入式硬件上的部署瓶颈。它也不原生支持姿态估计或有向边界框(OBB)等现代任务。

了解 EfficientDet 的更多信息

性能与指标对比#

要准确了解这些模型之间的权衡,需要分析它们的吞吐量和参数效率。下表概述了现代 RTDETRv2 系列与可扩展 EfficientDet 系列的对比。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

如上所示,RTDETRv2 的平均精度均值(mAP)达到或超过了尺寸相近的 EfficientDet 模型,同时 GPU 运行速度快得多(例如,RTDETRv2-l 的 mAP 为 53.4、耗时 9.76 毫秒,而 EfficientDet-d6 的 mAP 为 52.6、耗时 89.29 毫秒);它充分利用 Transformer 架构来提升精度。

用例与建议#

在 RT-DETR 和 EfficientDet 之间做选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 RT-DETR#

以下场景适合选择 RT-DETR:

  • 基于 Transformer 的检测研究:探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测。
  • 对延迟要求灵活的高精度场景:检测准确率至关重要,且可以接受略高推理延迟的应用。
  • 大型目标检测:场景中的目标以中大型为主,此时 Transformer 的全局注意力机制能够发挥天然优势。

何时选择 EfficientDet#

以下情况推荐使用 EfficientDet:

  • Google Cloud 和 TPU 流水线:与 Google Cloud Vision API 或 TPU 基础设施深度集成,且 EfficientDet 能进行原生优化的系统。
  • 复合缩放研究:侧重研究网络深度、宽度和分辨率平衡缩放效果的学术基准测试。
  • 通过 LiteRT 进行移动端部署:需要导出为 LiteRT(原名 TensorFlow Lite),以用于 Android 或嵌入式 Linux 设备的项目。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26在性能与开发体验之间实现了最佳平衡:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

Ultralytics 替代方案:推动技术达到最先进水平#

虽然 RTDETRv2 和 EfficientDet 各有优势,但现代 AI 开发需要的不仅是前沿性能,还需要流畅的开发者体验框架。Ultralytics 生态系统为计算机视觉任务提供了更加精简流畅的解决方案。

如果你正在探索最先进的检测技术,最新发布的 Ultralytics YOLO26融合了 CNN 和 Transformer 的优点。

为什么选择 YOLO26?

YOLO26 实现了可选的端到端无 NMS 设计(nms=False),将 RTDETRv2 的部署简便性带入超高效的 YOLO 架构。此外,它还引入了MuSGD 优化器,其灵感源于 LLM 训练创新,可大幅提升训练稳定性。通过移除 DFL(移除分布焦点损失,简化导出并提升对边缘设备和低功耗设备的兼容性),YOLO26 的 CPU 推理速度比前代产品最高快 43%,因此相较于更大型的模型,它是边缘计算的出色选择。此外,ProgLoss + STAL 带来了改进的损失函数,显著提升了小目标识别能力,这对 IoT、机器人和航空影像至关重要。

Ultralytics Python 软件包的易用性无与伦比。开发者可以通过直观的 API 训练、验证和导出模型,而无需编写研究代码库通常要求的大量样板代码。

from ultralytics import RTDETR

# 从 Ultralytics 生态系统加载预训练的 RT-DETR 模型
model = RTDETR("rtdetr-l.pt")

# 使用 COCO8 数据集训练模型
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# 导出模型,以便使用 TensorRT 优化推理
model.export(format="engine")

Ultralytics 模型原生支持多种任务,包括实例分割和图像分类,为各种行业需求提供了多功能工具包。此外,现代 Ultralytics 模型移除了分布焦点损失 (DFL),简化了计算图,确保模型能够更顺畅地导出到嵌入式 NPU 和 TPU。

为了轻松完成数据标注和模型管理,Ultralytics Platform提供了全面的云端环境,帮助你管理整个机器学习生命周期,是在生产环境中部署稳健计算机视觉解决方案的首选。

评论