Ultralytics YOLO27:
Get Started

RTDETRv2 与 YOLO11#

计算机视觉领域不断发展,新的架构持续拓展边缘设备和云服务器上的可能性。在当前实时目标检测领域,两个最受瞩目的竞争者是 RTDETRv2 和 YOLO11。这两款模型都具备出色的性能,但它们代表了截然不同的架构理念:基于 Transformer 的方案与高度优化的卷积神经网络 (CNN)。

在这篇全面的技术对比中,我们将探讨这两款模型的架构、性能指标、训练方法和理想使用场景,帮助你为下一个人工智能应用做出明智的选择。

RTDETRv2:基于 Transformer 的挑战者#

RTDETRv2 是在原始实时检测 Transformer 的基础上发展而来,它利用注意力机制处理视觉数据。通过将图像块视为序列,它能够全面理解图像上下文,因此特别适合检测复杂场景中大量重叠的目标。

模型详情:

架构优势与劣势#

RTDETRv2 的主要创新是其端到端、无需 NMS 的架构。移除非极大值抑制 (NMS) 后,后处理流程得以简化。此外,与原始 RT-DETR 模型相比,它改进了多尺度特征提取能力,因此能更好地识别不同尺寸的目标。

不过,由于依赖 Transformer,RTDETRv2 在训练期间通常需要多得多的内存。与传统 CNN 相比,Transformer 通常收敛更慢,且需要大量额外的 CUDA 内存,因此消费级硬件上的研究人员或在受限的边缘 AI环境中部署模型的开发者较难使用它。

进一步了解 RTDETRv2

Ultralytics YOLO11:CNN 效率的巅峰#

Ultralytics 多年来持续开展基础研究,并在此基础上发布了 YOLO11,为 YOLO 系列带来了重大飞跃。它改进了 CNN 架构,实现了前所未有的速度和精度,同时保留了社区所期待的灵活性和开发者友好型生态系统。

模型详情:

Ultralytics 优势#

YOLO11 的性能平衡尤为突出。它在速度和精度之间实现了出色的权衡,因此能够灵活应对各种真实世界的部署场景,从大型云计算集群到轻量级移动设备都适用。

此外,Ultralytics YOLO 模型以训练和推理时内存占用较低而闻名。Transformer 模型很容易耗尽显存,而 YOLO11 则允许你在标准 GPU 上使用更大的批量大小。此外,YOLO11 不仅限于目标检测,还具备出色的多功能性,原生支持实例分割、图像分类、姿态估计和有向边界框 (OBB)。

性能与指标对比#

对比具体数据可见,尽管 RTDETRv2 的精度表现出色,YOLO11 提供了更细分的模型尺寸选择,推理速度也更快,尤其是在 TensorRT 上。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

如表格所示,与 RTDETRv2-x 相比,YOLO11x 模型的 mAPval 更高,达到 54.7%,同时 FLOPs 更少 (195.3B 对 259B),且在 TensorRT 上推理更快 (11.3ms 对 15.03ms)。YOLO11 nano 和 small 版本为 Raspberry Pi 等受限设备提供了无与伦比的轻量级选择。

生态系统、易用性与训练#

Ultralytics 模型的鲜明特点是流畅的用户体验。ultralytics Python 包提供统一、直观的 API,可处理繁重的数据增强、分布式训练和模型导出任务。RTDETRv2 的研究代码库需要编写大量样板代码并进行复杂配置,而 Ultralytics 则提供了从入门到精通的一站式流程。

值得一提的是,Ultralytics 生态系统非常完善,原生支持同时运行 RT-DETR 和 YOLO 模型!借助 Ultralytics 的完善生态系统,包括与 Weights & Biases 和 Comet ML 的集成,你可以轻松跟踪实验。

from ultralytics import RTDETR, YOLO

# 通过 Ultralytics API 轻松加载 RTDETR 模型
model_rtdetr = RTDETR("rtdetr-l.pt")

# 加载高度优化的 YOLO11 模型
model_yolo = YOLO("yolo11n.pt")

# 以极高的内存效率训练 YOLO11
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# 将训练好的 YOLO 模型导出为 ONNX 格式
model_yolo.export(format="onnx")
简化工作流程

训练效率在机器学习中至关重要。Ultralytics 模型使用预训练权重,收敛速度很快。如果你想在不编写代码的情况下管理数据集、训练任务和部署端点,可以使用 Ultralytics Platform,获得一体化 MLOps 体验。

实际应用#

选择这些架构时,通常要根据项目的具体部署限制来决定。

RTDETRv2 的优势场景: RTDETRv2 的 Transformer 主干网络在目标密集、严重遮挡且需要全局上下文的场景中效果显著。它常用于学术研究和计算预算不如基于注意力的关系映射重要的应用。

YOLO11 的主场: YOLO11 是实用型真实世界部署的公认首选。其内存占用极低、推理速度极快,非常适合:

  • 智能制造: 使用工业 PC 在生产线上实时检测缺陷。
  • 农业: 在无人机上部署模型,实时监测作物健康状况,并用于自动化采收机器人。
  • 零售分析: 并行处理多个摄像头视频流,以管理队列和跟踪库存,无需部署庞大的服务器集群。

用例与建议#

选择 RT-DETR 还是 YOLO11,取决于你的具体项目需求、部署限制和生态偏好。

何时选择 RT-DETR#

以下场景适合选择 RT-DETR:

  • 基于 Transformer 的检测研究:探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测。
  • 对延迟要求灵活的高精度场景:检测准确率至关重要,且可以接受略高推理延迟的应用。
  • 大型目标检测:场景中的目标以中大型为主,此时 Transformer 的全局注意力机制能够发挥天然优势。

何时选择 YOLO11#

以下场景推荐使用 YOLO11:

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26在性能与开发体验之间实现了最佳平衡:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

展望未来:YOLO26 登场#

如果你正在启动新项目,也应该考虑新一代视觉 AI:Ultralytics YOLO26。YOLO26 于 2026 年 1 月发布,融合了两种方案的优势。它引入了可选的端到端、无需 NMS 的检测头 (nms=False,最早由 YOLOv10 提出),像 RTDETRv2 一样省去了 NMS 后处理,同时具备 CNN 无与伦比的速度。

YOLO26 采用受 LLM 训练创新启发的 MuSGD 优化器,实现极其稳定、快速的收敛;通过移除分布焦点损失 (DFL),CPU 推理速度最高可提升 43%。其专用的 ProgLoss + STAL 损失函数大幅提升了小目标识别能力,因此 YOLO26 是现代计算机视觉流程的终极推荐。

无论你选择凭借成熟多功能性的 YOLO11、运用注意力机制的 RTDETRv2,还是追求极致边缘性能的前沿模型 YOLO26,Ultralytics 文档都提供了助你在计算机视觉领域取得成功所需的全部资源。

评论