RTDETRv2 与 YOLO11#
计算机视觉领域不断发展,新架构持续拓展边缘设备和云服务器上的可能性边界。在当前实时目标检测领域,最具代表性的两大竞争者是 RTDETRv2 和 YOLO11。虽然这两个模型都能提供卓越的性能,但它们代表了截然不同的架构理念:基于 Transformer 的方法与高度优化的卷积神经网络 (CNN)。
在这篇全面的技术对比中,我们将探讨这两个模型的架构、性能指标、训练方法和理想使用场景,帮助你为下一个人工智能应用做出明智的选择。
RTDETRv2:基于 Transformer 的挑战者#
RTDETRv2 作为原始实时检测 Transformer 的演进版本推出,利用注意力机制处理视觉数据。通过将图像块视为序列,它能够全局理解图像上下文,这对于检测复杂场景中大量重叠的目标非常有利。
模型详情:
- 作者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
- 组织: Baidu
- 日期: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETR 代码库
- 文档: RTDETRv2 文档
架构优势与不足#
RTDETRv2 的主要创新是其端到端、无需 NMS 的架构。通过移除非极大值抑制 (NMS),它简化了后处理流程。此外,与原始 RT-DETR 模型相比,其多尺度特征提取能力得到改进,因此能够更好地识别不同大小的目标。
然而,由于依赖 Transformer,RTDETRv2 在训练期间通常需要显著更多的内存。与传统 CNN 相比,Transformer 通常收敛速度更慢,并且需要多得多的 CUDA 内存,这使得它们对于使用消费级硬件的研究人员,或部署到受限的 边缘 AI 环境中时,不太容易使用。
Ultralytics YOLO11:CNN 效率的巅峰#
基于多年的基础研究,Ultralytics 发布了 YOLO11,实现了 YOLO 产品线的巨大飞跃。它改进了 CNN 架构,以实现前所未有的速度和准确率,同时保留了社区所期待的灵活性和开发者友好型生态系统。
模型详情:
- 作者: Glenn Jocher 和 Jing Qiu
- 组织: Ultralytics
- 日期: 2024 年 9 月 27 日
- GitHub: Ultralytics 仓库
Ultralytics 的优势#
YOLO11 的 性能平衡 表现出色。它在速度和准确率之间实现了非凡的权衡,因此能够出色地适应各种现实世界的部署场景,从大型 云计算 集群到轻量级移动设备。
此外,Ultralytics YOLO 模型还因训练和推理期间更低的内存使用量而闻名。与容易耗尽显存的 Transformer 模型不同,YOLO11 允许在标准 GPU 上使用更大的批量大小。此外,YOLO11 不仅限于目标检测;它还具备出色的 多功能性,原生支持 实例分割、图像分类、姿态估计 和 定向边界框 (OBB)。
性能与指标对比#
比较原始数据后可以明显看出,虽然 RTDETRv2 能够实现令人印象深刻的准确率,但 YOLO11 提供了更加细分的模型尺寸选择,并具备更高的推理速度,尤其是在 TensorRT 上。
| 模型 | 尺寸 (像素) | mAPval 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (毫秒) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
如表格所示,YOLO11x 模型的 mAPval 达到更高的 54.7%,同时使用更少的 FLOPs(194.9B 对 259B),并且与 RTDETRv2-x 变体相比,在 TensorRT 上提供更快的推理速度(11.3ms 对 15.03ms)。YOLO11 的 nano 和 small 变体为 Raspberry Pi 等受限设备提供了无与伦比的轻量级选项。
生态系统、易用性与训练#
Ultralytics 模型的显著特点是简化流畅的用户体验。ultralytics Python 软件包提供统一且直观的 API,可处理数据增强、分布式训练和模型导出等繁重工作。RTDETRv2 的研究代码库需要大量样板代码和配置,而 Ultralytics 提供了从“零基础到高手”的完整流程。
有趣的是,Ultralytics 生态系统非常强大,原生支持同时运行 RT-DETR 模型和 YOLO 模型!这样你就可以利用 Ultralytics 的 维护完善的生态系统,包括与 Weights & Biases 和 Comet ML 的集成,轻松跟踪实验。
from ultralytics import RTDETR, YOLO
# Load an RTDETR model seamlessly through the Ultralytics API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load a highly optimized YOLO11 model
model_yolo = YOLO("yolo11n.pt")
# Train YOLO11 with highly efficient memory usage
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained YOLO model to ONNX format
model_yolo.export(format="onnx")训练效率在机器学习中至关重要。Ultralytics 模型使用预训练权重,能够快速收敛。要在无需编写代码的情况下管理数据集、训练运行和部署端点,可以探索 Ultralytics Platform,获得集成式 MLOps 体验。
实际应用#
在这些架构之间进行选择,通常取决于项目的具体部署限制。
RTDETRv2 的优势场景: RTDETRv2 的 Transformer 主干网络在目标密集、严重遮挡且需要全局上下文的场景中非常有效。它通常用于学术研究和相关应用的评估,在这些场景中,相比基于注意力的关系映射原始能力,计算预算并不是首要考虑因素。
YOLO11 的主导场景: YOLO11 是实用型现实世界部署中当之无愧的冠军。其极小的内存占用和闪电般的推理速度使其非常适合:
- 智能制造: 使用工业 PC 在生产线上运行实时缺陷检测。
- 农业: 部署在无人机上进行实时作物健康监测,并支持自动化收割机器人。
- 零售分析: 同时处理多个摄像头视频流,用于队列管理和库存跟踪,无需大型服务器集群。
使用场景与建议#
在 RT-DETR 和 YOLO11 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。
何时选择 RT-DETR#
RT-DETR 适合以下场景:
- 基于 Transformer 的检测研究: 探索注意力机制和 Transformer 架构,以实现无需 NMS 的端到端目标检测的项目。
- 高精度且延迟灵活的场景: 将检测精度置于首要位置,并且可以接受略高推理延迟的应用。
- 大型目标检测: 主要包含中大型目标的场景,在这些场景中,Transformer 的全局注意力机制具有天然优势。
何时选择 YOLO11#
推荐在以下场景使用 YOLO11:
- 生产级边缘部署: 在 Raspberry Pi 或 NVIDIA Jetson 等设备上运行的商业应用,其中可靠性和持续维护至关重要。
- 多任务视觉应用: 需要在统一框架中实现检测、分割、姿态估计和 OBB 的项目。
- 快速原型开发与部署: 需要借助简洁高效的 Ultralytics Python API,快速完成从数据采集到生产部署的团队。
何时选择 Ultralytics (YOLO26)#
对于大多数新项目,Ultralytics YOLO26 在性能和开发者体验之间提供了最佳组合:
- 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
- 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
- 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。
展望未来:YOLO26 的到来#
如果你正在启动一个新项目,还应考虑下一代视觉 AI:Ultralytics YOLO26。YOLO26 于 2026 年 1 月发布,融合了两者的优势。它引入了 端到端无 NMS 设计(首次在 YOLOv10 中开创),像 RTDETRv2 一样完全消除了后处理延迟,同时具备 CNN 无与伦比的速度。
YOLO26 采用了 MuSGD 优化器——其灵感来自 LLM 训练创新——能够实现极其稳定且快速的收敛;同时,通过移除分布焦点损失 (DFL),可实现最高 快 43% 的 CPU 推理速度。借助显著提升小目标识别能力的专用 ProgLoss + STAL 损失函数,YOLO26 是任何现代计算机视觉流程的终极推荐方案。
无论你选择 YOLO11 的成熟多功能性、RTDETRv2 的注意力机制,还是追求极致边缘性能的前沿 YOLO26,Ultralytics 文档 都提供了在计算机视觉之旅中取得成功所需的全部资源。