Ultralytics YOLO27:
Get Started

RTDETRv2 与 PP-YOLOE+ 对比#

计算机视觉领域发展迅速,涌现出多种架构方案来解决复杂的实时目标检测难题。近期最值得关注的进展包括 RTDETRv2 和 PP-YOLOE+。这两种强大的模型采用了截然不同的设计理念来实现视觉识别。虽然它们都致力于提供高性能检测,但其底层机制、训练范式和理想部署场景差异显著。

本指南深入探讨这两种模型的技术细节,对比其架构、性能指标和生态系统支持,帮助开发者和研究人员根据具体部署需求选择最佳方案。

模型概述#

在分析性能数据之前,先了解每种模型的来源和架构目标很重要。两者都源自百度的研究团队,但代表了目标检测领域中不同的发展方向。

RTDETRv2#

RTDETRv2 代表了基于 Transformer 的视觉架构的一次重大飞跃。它在原始实时检测 Transformer 的基础上,将 CNN 主干网络与高效的混合编码器和 Transformer 解码器结合起来。其最突出的特点是原生支持端到端预测,完全省去了后处理阶段的非极大值抑制 (NMS)。

  • 作者:Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
  • 组织: 百度
  • 日期: 2024-07-24
  • Arxiv: 2407.17140
  • GitHub:RT-DETR 仓库

进一步了解 RTDETRv2

PP-YOLOE+#

PP-YOLOE+ 是 YOLO 系列的高级迭代版本,针对高性能工业应用进行了深度优化。它采用可扩展的 CNN 架构和无锚框检测头。为了实现出色的速度与准确率平衡,它引入了 ET-head 和广义焦点损失函数等强大技术,以改进小目标检测。

进一步了解 PP-YOLOE+

生态系统集成

虽然这两种模型都有各自独立的研究代码库,但你可以直接在 Ultralytics Python 包中轻松试用原始 RT-DETR,并享受统一的 API 和精简的导出选项。

架构差异#

这两种模型的根本区别在于处理视觉上下文和生成预测的方式。

PP-YOLOE+ 采用传统但经过高度优化的卷积神经网络 (CNN) 主干网络。它依靠局部感受野提取特征,因此在标准部署中速度极快、效率很高。不过,它仍然需要标准的 NMS 后处理来筛除重叠边界框,这可能会在密集场景中造成延迟瓶颈。

相比之下,RTDETRv2 采用混合编码器和 Transformer 解码器,让模型能够同时捕获整张图像中的全局上下文。注意力机制可以自然地理解目标之间的关系,使模型无需 NMS 即可直接输出最终边界框。这种端到端方法可以确保推理延迟稳定,不受检测到的目标数量影响。

性能指标与对比#

评估 YOLO 性能指标时,平衡准确率 (mAP)、计算成本 (FLOPs) 和推理速度至关重要。下表展示了这两种模型在不同尺寸下的性能。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

在 COCO 数据集上,PP-YOLOE+x 的 mAPval 略高,达到 54.7%;RTDETRv2 模型的准确率通常也很有竞争力,并且得益于无 NMS 设计,延迟表现稳定。不过,在参数量和 FLOPs 方面,PP-YOLOE+ 的小型模型仍有明显优势,因此非常适合边缘部署。

Ultralytics 的优势:YOLO26 登场#

RTDETRv2 和 PP-YOLOE+ 都实力不俗,但最先进的技术仍在不断发展。对于追求速度、准确率和生态系统支持之间最佳平衡的开发者而言,Ultralytics YOLO26代表了新的行业标准。

YOLO26 融合了 CNN 和 Transformer 的优势。它采用可选的端到端无 NMS推理模式 (nms=False),这是由现代架构首创的;启用后,可以消除后处理瓶颈。此外,它还引入了革命性的MuSGD 优化器,这是一种受 LLM 训练创新启发的混合方案,可确保训练高度稳定、快速收敛。

针对边缘设备优化

与需要大量 CUDA 内存的重型 Transformer 模型不同,YOLO26 移除了分布焦点损失 (DFL),并针对边缘计算进行了专门优化,CPU 推理速度比前代产品最高快 43%。

此外,YOLO26 不局限于简单的目标检测。它原生支持多种任务,开箱即用即可执行实例分割、姿势估计和有向边界框(OBB),而 PP-YOLOE+ 则主要专注于边界框检测。

训练方法与生态系统#

与独立的研究代码库相比,Ultralytics 生态系统在训练效率和易用性方面更具优势。PP-YOLOE+ 依赖 PaddlePaddle 框架,而 RTDETRv2 通常需要复杂的环境配置;通过 Ultralytics 集成模型则能获得流畅无缝的体验。

使用 Ultralytics API,你可以享受较低的训练内存需求、自动化数据集处理和简化的超参数调优。此外,只需一条命令,就能将模型部署为 ONNX 或 TensorRT 等生产环境格式。

代码示例:简化推理流程#

下面演示如何使用 Ultralytics Python 包轻松搭配 RT-DETR 和推荐的 YOLO26 模型:

from ultralytics import RTDETR, YOLO

# 初始化 RT-DETR 模型(Ultralytics 支持原始 RT-DETR-L 和 RT-DETR-X)
model_rtdetr = RTDETR("rtdetr-l.pt")

# 在测试图像上执行无 NMS 推理
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()

# 如需更快速度和更强多功能性,可初始化最新的 YOLO26 模型
model_yolo26 = YOLO("yolo26n.pt")

# 通过优化内存占用,轻松训练 YOLO26 模型
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)

# 导出为 TensorRT,用于边缘部署
model_yolo26.export(format="engine")

实际应用与用例#

在这些架构之间做选择,通常取决于具体的硬件和应用需求。

  • RTDETRv2 在服务器端环境和复杂场景理解方面表现出色。其全局注意力机制使其在人群管理和密集医学图像分析中极为有效,因为重叠对象通常会导致标准 NMS 算法失效。
  • PP-YOLOE+ 非常适合高速工业检测,以及深度投入 PaddlePaddle 生态系统的环境。其较小尺寸模型的参数量较低,因此适用于某些机器人应用。
  • Ultralytics YOLO26 是全面商业部署的通用推荐方案。凭借增强的 ProgLoss + STAL 函数,它显著提升了小目标识别能力,这对航空无人机作业和智慧城市交通监控至关重要。

用例与建议#

在 RT-DETR 和 PP-YOLOE+ 之间做选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 RT-DETR#

以下场景适合选择 RT-DETR:

  • 基于 Transformer 的检测研究:探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测。
  • 对延迟要求灵活的高精度场景:检测准确率至关重要,且可以接受略高推理延迟的应用。
  • 大型目标检测:场景中的目标以中大型为主,此时 Transformer 的全局注意力机制能够发挥天然优势。

何时选择 PP-YOLOE+#

以下情况推荐使用 PP-YOLOE+:

  • 集成 PaddlePaddle 生态系统:已有基于百度 PaddlePaddle框架和工具构建基础设施的组织。
  • Paddle Lite 边缘部署:部署到专门针对 Paddle Lite 或 Paddle 推理引擎进行了高度优化的推理内核的硬件上。
  • 高精度服务端检测:在强大的 GPU 服务器上优先追求最高检测准确率,且不受框架依赖限制的场景。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26在性能与开发体验之间实现了最佳平衡:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

结论#

RTDETRv2 和 PP-YOLOE+ 都拓展了计算机视觉的能力边界,证明了 Transformer 和高度优化的 CNN 架构都切实可行。不过,部署碎片化研究代码库的复杂性可能会拖慢生产进度。

对于现代 AI 工程师来说,借助 Ultralytics Platform 能带来无可比拟的优势。迁移到无缝集成的模型(如 YOLO11 或尖端的 YOLO26),团队就能实现尽可能高的精度与速度比,同时大幅降低内存需求和开发开销。

评论