RTDETRv2 与 YOLO11#
计算机视觉领域在不断演进,新的架构不断突破边缘设备和云服务器的性能极限。在当前的实时目标检测领域,RTDETRv2 和 YOLO11 是两个最突出的竞争者。尽管这两种模型都表现出色,但它们代表了完全不同的架构理念:基于 Transformer 的方法与高度优化的卷积神经网络(CNN)。
在这份全面的技术对比中,我们将探索这两种模型的架构、性能指标、训练方法以及理想应用场景,帮助你为下一个人工智能应用程序做出明智的决策。
RTDETRv2:基于 Transformer 的挑战者#
作为原始实时检测 Transformer 的进化版,RTDETRv2 利用注意力机制处理视觉数据。通过将图像块视为序列,它实现了对图像上下文的全局理解,这对于在复杂场景中检测严重重叠的目标非常有帮助。
模型详情:
- 作者: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang 和 Yi Liu
- 机构: 百度
- 日期: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETR Repository
- Docs: RTDETRv2 Documentation
架构的优势与劣势#
RTDETRv2 的核心创新在于其端到端无 NMS 的架构。通过消除非极大值抑制(NMS),它简化了后处理流程。此外,其多尺度特征提取能力相较于原始的 RT-DETR model 得到了提升,能够更好地识别不同尺寸的目标。
然而,由于它依赖于 Transformer,RTDETRv2 在训练期间通常会产生显著更高的内存需求。与传统 CNN 相比,Transformer 通常收敛较慢且需要大量额外的 CUDA 内存,这使得在消费级硬件上操作或部署到受限的 edge AI 环境中的研究人员更难使用它。
Ultralytics YOLO11:CNN 效率的巅峰#
基于多年的基础研究,Ultralytics 发布了 YOLO11,这是 YOLO 系列的巨大飞跃。它优化了 CNN 架构,实现了前所未有的速度和精度,同时保持了社区所期待的灵活性和开发者友好的生态系统。
模型详情:
- 作者: Glenn Jocher 和 Jing Qiu
- 组织: Ultralytics
- 日期: 2024年9月27日
- GitHub: Ultralytics Repository
Ultralytics 的优势#
YOLO11 的亮点在于其性能平衡。它在速度和准确率之间实现了出色的权衡,使其在各种现实世界的部署场景中具有极高的通用性,从大规模 cloud computing 集群到轻量级移动设备。
此外,Ultralytics YOLO 模型以其在训练和推理期间较低的内存占用而闻名。与容易耗尽 VRAM 的 Transformer 模型不同,YOLO11 允许在标准 GPU 上使用更大的批量大小。不仅如此,YOLO11 不仅局限于单纯的目标检测;它还具有令人惊叹的多功能性,原生支持 Instance Segmentation、Image Classification、Pose Estimation 以及 Oriented Bounding Boxes (OBB)。
性能与指标对比#
当比较原始数字时,很明显 RTDETRv2 虽然达到了令人印象深刻的精度,但 YOLO11 提供了更细致的模型尺寸选择,并且在 TensorRT 上具备更优的推理速度。
| 模型 | 尺寸 (像素) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
正如表格所示,与 RTDETRv2-x 变体相比,YOLO11x 模型实现了高达 54.7% 的卓越 mAPval,同时使用了更少的 FLOPs(194.9B 对比 259B),并在 TensorRT 上提供了更快的推理速度(11.3ms 对比 15.03ms)。nano 和 small YOLO11 变体为 Raspberry Pi 等受限设备提供了无与伦比的轻量级选项。
生态系统、易用性与训练#
ultralytics Python 包提供了一个统一、直观的 API,负责处理 data augmentation、分布式训练和模型导出的繁重工作。虽然 RTDETRv2 的研究代码库需要大量的样板代码和配置,但 Ultralytics 提供了一个“从零到精通”的管道。
有趣的是,Ultralytics 生态系统非常强大,它原生支持在 YOLO 模型旁边运行 RT-DETR 模型!这使你可以利用 Ultralytics 的维护良好的生态系统(包括与 Weights & Biases 和 Comet ML 的集成)轻松追踪实验。
from ultralytics import RTDETR, YOLO
# Load an RTDETR model seamlessly through the Ultralytics API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load a highly optimized YOLO11 model
model_yolo = YOLO("yolo11n.pt")
# Train YOLO11 with highly efficient memory usage
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained YOLO model to ONNX format
model_yolo.export(format="onnx")训练效率在机器学习中至关重要。Ultralytics 模型使用能够快速收敛的预训练权重。若要无需编写代码即可管理数据集、训练运行和部署端到端,请探索 Ultralytics Platform 以获得集成化的 MLOps 体验。
实际应用场景#
在这些架构之间进行选择,通常取决于你项目特定的部署限制。
RTDETRv2 的优势场景: RTDETRv2 的 Transformer 主干在存在密集、严重遮挡目标且需要全局上下文的场景中非常有效。它常用于学术研究和那些计算预算相比原始基于注意力机制的关系映射不太重要的应用中。
YOLO11 的主导地位: YOLO11 是实际生产部署中无可争议的冠军。其极小的内存占用和极快的推理速度使其成为以下场景的理想选择:
- Smart Manufacturing: 使用工业 PC 在生产线上运行实时缺陷检测。
- Agriculture: 部署在无人机上用于实时作物健康监测和自动化收割机器人。
- Retail Analytics: 同时处理多个摄像头流以进行队列管理和库存追踪,而无需庞大的服务器集群。
应用场景与建议#
在 RT-DETR 和 YOLO11 之间做出选择,取决于你的具体项目需求、部署约束和生态系统偏好。
何时选择 RT-DETR#
RT-DETR 在以下情况是一个强有力的选择:
- 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构以实现无 NMS 的端到端目标检测的项目。
- 高精度、延迟要求宽松的场景: 将检测精度置于首位,且可以容忍稍高推理延迟的应用。
- 大目标检测: 以中大型目标为主的场景,在这种场景下,Transformer 的全局注意力机制具有天然优势。
何时选择 YOLO11#
YOLO11 推荐用于:
- **生产边缘部署:**在诸如Raspberry Pi或NVIDIA Jetson等设备上的商业应用,可靠性和主动维护至关重要。
- **多任务视觉应用:**需要在单个统一框架内进行detection、segmentation、pose estimation和OBB的项目。
- **快速原型制作与部署:**需要使用简化的Ultralytics Python API从数据收集快速过渡到生产的团队。
何时选择 Ultralytics (YOLO26)#
对于大多数新项目,Ultralytics YOLO26 提供了性能与开发者体验的最佳结合:
- 无 NMS 的边缘部署: 需要一致、低延迟推理且无需复杂非极大值抑制后处理的应用。
- 仅 CPU 环境: 没有专用 GPU 加速的设备,YOLO26 带来的高达 43% 的 CPU 推理提速可提供决定性优势。
- 小目标检测: 诸如航拍无人机图像或物联网传感器分析等具有挑战性的场景,其中 ProgLoss 和 STAL 显著提高了微小目标的准确率。
展望未来:YOLO26 的到来#
如果你正在开始一个新的项目,你也应该考虑新一代视觉 AI:Ultralytics YOLO26。发布于 2026 年 1 月的 YOLO26 融合了两者的优点。它引入了端到端无 NMS 设计(最早在 YOLOv10 中首创),就像 RTDETRv2 一样完全消除了后处理延迟,但具备 CNN 无与伦比的速度。
YOLO26 采用了受 LLM 训练创新启发的 MuSGD Optimizer,实现了极度稳定且快速的收敛,并通过移除分布焦点损失(DFL)实现了高达 43% 的 CPU 推理提速。凭借其专业的 ProgLoss + STAL 损失函数,极大地提升了小目标识别能力,YOLO26 是任何现代计算机视觉流水线的终极推荐。
无论你是选择 YOLO11 以获得其经过验证的通用性、选择 RTDETRv2 以利用其注意力机制,还是选择尖端的 YOLO26 以获得极致的边缘性能,Ultralytics documentation 都提供了你在计算机视觉之旅中取得成功所需的全部资源。