Ultralytics YOLO27:

RTDETRv2 与 YOLO11#

计算机视觉领域不断发展,新架构持续拓展边缘设备和云服务器上的可能性边界。在当前实时目标检测领域,最具代表性的两大竞争者是 RTDETRv2YOLO11。虽然这两个模型都能提供卓越的性能,但它们代表了截然不同的架构理念:基于 Transformer 的方法与高度优化的卷积神经网络 (CNN)。

在这篇全面的技术对比中,我们将探讨这两个模型的架构、性能指标、训练方法和理想使用场景,帮助你为下一个人工智能应用做出明智的选择。

RTDETRv2:基于 Transformer 的挑战者#

RTDETRv2 作为原始实时检测 Transformer 的演进版本推出,利用注意力机制处理视觉数据。通过将图像块视为序列,它能够全局理解图像上下文,这对于检测复杂场景中大量重叠的目标非常有利。

模型详情:

架构优势与不足#

RTDETRv2 的主要创新是其端到端、无需 NMS 的架构。通过移除非极大值抑制 (NMS),它简化了后处理流程。此外,与原始 RT-DETR 模型相比,其多尺度特征提取能力得到改进,因此能够更好地识别不同大小的目标。

然而,由于依赖 Transformer,RTDETRv2 在训练期间通常需要显著更多的内存。与传统 CNN 相比,Transformer 通常收敛速度更慢,并且需要多得多的 CUDA 内存,这使得它们对于使用消费级硬件的研究人员,或部署到受限的 边缘 AI 环境中时,不太容易使用。

了解更多关于 RT-DETR 的信息

Ultralytics YOLO11:CNN 效率的巅峰#

基于多年的基础研究,Ultralytics 发布了 YOLO11,实现了 YOLO 产品线的巨大飞跃。它改进了 CNN 架构,以实现前所未有的速度和准确率,同时保留了社区所期待的灵活性和开发者友好型生态系统。

模型详情:

Ultralytics 的优势#

YOLO11 的 性能平衡 表现出色。它在速度和准确率之间实现了非凡的权衡,因此能够出色地适应各种现实世界的部署场景,从大型 云计算 集群到轻量级移动设备。

此外,Ultralytics YOLO 模型还因训练和推理期间更低的内存使用量而闻名。与容易耗尽显存的 Transformer 模型不同,YOLO11 允许在标准 GPU 上使用更大的批量大小。此外,YOLO11 不仅限于目标检测;它还具备出色的 多功能性,原生支持 实例分割图像分类姿态估计定向边界框 (OBB)

性能与指标对比#

比较原始数据后可以明显看出,虽然 RTDETRv2 能够实现令人印象深刻的准确率,但 YOLO11 提供了更加细分的模型尺寸选择,并具备更高的推理速度,尤其是在 TensorRT 上。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

如表格所示,YOLO11x 模型的 mAPval 达到更高的 54.7%,同时使用更少的 FLOPs(194.9B 对 259B),并且与 RTDETRv2-x 变体相比,在 TensorRT 上提供更快的推理速度(11.3ms 对 15.03ms)。YOLO11 的 nano 和 small 变体为 Raspberry Pi 等受限设备提供了无与伦比的轻量级选项。

生态系统、易用性与训练#

Ultralytics 模型的显著特点是简化流畅的用户体验。ultralytics Python 软件包提供统一且直观的 API,可处理数据增强、分布式训练和模型导出等繁重工作。RTDETRv2 的研究代码库需要大量样板代码和配置,而 Ultralytics 提供了从“零基础到高手”的完整流程。

有趣的是,Ultralytics 生态系统非常强大,原生支持同时运行 RT-DETR 模型和 YOLO 模型!这样你就可以利用 Ultralytics 的 维护完善的生态系统,包括与 Weights & BiasesComet ML 的集成,轻松跟踪实验。

from ultralytics import RTDETR, YOLO

# Load an RTDETR model seamlessly through the Ultralytics API
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load a highly optimized YOLO11 model
model_yolo = YOLO("yolo11n.pt")

# Train YOLO11 with highly efficient memory usage
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the trained YOLO model to ONNX format
model_yolo.export(format="onnx")
简化你的工作流程

训练效率在机器学习中至关重要。Ultralytics 模型使用预训练权重,能够快速收敛。要在无需编写代码的情况下管理数据集、训练运行和部署端点,可以探索 Ultralytics Platform,获得集成式 MLOps 体验。

实际应用#

在这些架构之间进行选择,通常取决于项目的具体部署限制。

RTDETRv2 的优势场景: RTDETRv2 的 Transformer 主干网络在目标密集、严重遮挡且需要全局上下文的场景中非常有效。它通常用于学术研究和相关应用的评估,在这些场景中,相比基于注意力的关系映射原始能力,计算预算并不是首要考虑因素。

YOLO11 的主导场景: YOLO11 是实用型现实世界部署中当之无愧的冠军。其极小的内存占用和闪电般的推理速度使其非常适合:

  • 智能制造 使用工业 PC 在生产线上运行实时缺陷检测。
  • 农业 部署在无人机上进行实时作物健康监测,并支持自动化收割机器人。
  • 零售分析 同时处理多个摄像头视频流,用于队列管理和库存跟踪,无需大型服务器集群。

使用场景与建议#

在 RT-DETR 和 YOLO11 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 RT-DETR#

RT-DETR 适合以下场景:

  • 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测的项目。
  • 高精度且延迟灵活的场景: 将检测精度置于首要位置,并且可以接受略高推理延迟的应用。
  • 大型目标检测: 主要包含中大型目标的场景,在这些场景中,Transformer 的全局注意力机制具有天然优势。

何时选择 YOLO11#

推荐在以下场景使用 YOLO11:

  • 生产级边缘部署:Raspberry PiNVIDIA Jetson 等设备上运行的商业应用,其中可靠性和持续维护至关重要。
  • 多任务视觉应用: 需要在统一框架中实现检测分割姿态估计OBB 的项目。
  • 快速原型开发与部署: 需要借助简洁高效的 Ultralytics Python API,快速完成从数据采集到生产部署的团队。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26 在性能和开发者体验之间提供了最佳组合:

  • 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
  • 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
  • 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。

展望未来:YOLO26 的到来#

如果你正在启动一个新项目,还应考虑下一代视觉 AI:Ultralytics YOLO26。YOLO26 于 2026 年 1 月发布,融合了两者的优势。它引入了 端到端无 NMS 设计(首次在 YOLOv10 中开创),像 RTDETRv2 一样完全消除了后处理延迟,同时具备 CNN 无与伦比的速度。

YOLO26 采用了 MuSGD 优化器——其灵感来自 LLM 训练创新——能够实现极其稳定且快速的收敛;同时,通过移除分布焦点损失 (DFL),可实现最高 快 43% 的 CPU 推理速度。借助显著提升小目标识别能力的专用 ProgLoss + STAL 损失函数,YOLO26 是任何现代计算机视觉流程的终极推荐方案。

无论你选择 YOLO11 的成熟多功能性、RTDETRv2 的注意力机制,还是追求极致边缘性能的前沿 YOLO26,Ultralytics 文档 都提供了在计算机视觉之旅中取得成功所需的全部资源。

评论