DAMO-YOLO 与 RTDETRv2#
快速发展的计算机视觉领域涌现出大量架构,旨在平衡速度、精度和计算效率。DAMO-YOLO 和 RTDETRv2 是两款各具特色、采用不同方法应对这些挑战的代表性模型。虽然两者都致力于提供先进的实时推理解决方案,但它们在架构理念上存在根本差异。
本指南将深入介绍这两款模型的技术规格、架构创新和实际应用场景,同时探讨 Ultralytics Platform 和先进的 YOLO26 等现代解决方案如何重新定义部署和易用性的行业标准。
模型概述#
了解 DAMO-YOLO#
DAMO-YOLO 由阿里巴巴集团的研究人员开发,是一种快速、精准的目标检测方法,高度依赖神经架构搜索(NAS)。它使用 NAS 生成的低延迟结构取代传统的手工设计骨干网络。此外,它还采用高效的 RepGFPN(重参数化通用特征金字塔网络)和 ZeroHead 设计,以简化特征聚合和边界框预测。
模型主要信息:
- 作者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang 和 Xiuyu Sun
- 组织: 阿里巴巴集团
- 日期: 2022-11-23
- Arxiv:2211.15444v2
- GitHub:tinyvision/DAMO-YOLO
- 文档:DAMO-YOLO 文档
了解 RTDETRv2#
百度的 RTDETRv2 标志着实时检测 Transformer 的重大进步。与依赖锚框和非极大值抑制(NMS)的传统卷积神经网络(CNN)不同,RTDETRv2 使用自注意力机制,从全局上下文角度理解整张图像。它直接输出边界框,完全跳过 NMS 后处理步骤。该模型引入了“免费福利包”训练策略,在不增加推理延迟的情况下提升基线精度。
模型主要信息:
- 作者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang 和 Yi Liu
- 组织: 百度
- 日期: 2024-07-24
- Arxiv: 2407.17140
- GitHub:RT-DETR 仓库
- 文档: RTDETRv2 文档
虽然 Transformer 需要更多计算资源,但它们能够处理全局上下文,因此在复杂场景理解方面非常有效,而这正是 RTDETRv2 的主要优势。
性能对比#
在评估这些模型用于实际部署时,平均精度均值(mAP)、推理速度和内存占用等指标至关重要。与 DAMO-YOLO 这类轻量级 CNN 相比,RTDETRv2 等基于 Transformer 的模型在训练和推理时通常需要更多 CUDA 显存。
下面将详细比较它们的性能指标。
| 模型 | 尺寸 (像素) | mAP验证集 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (ms) | 参数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
理想应用场景#
DAMO-YOLO 的优势场景: 由于采用了 NAS 优化的骨干网络,并且较小版本(如 DAMO-YOLOt)的参数量特别少,因此 DAMO-YOLO 非常适合部署在资源受限的硬件上。如果你使用 ONNX 等运行时,或针对边缘计算使用专用的 TensorRT 引擎来构建嵌入式设备解决方案,DAMO-YOLO 能提供响应迅速的框架。
RTDETRv2 的优势场景: RTDETRv2 在具备服务器级 GPU 且全局图像上下文至关重要的场景中表现出色。它的 Transformer 架构能够自然地处理重叠边界框,而无需 NMS,因此非常适合密集的人群管理或复杂的目标跟踪任务,在这些任务中,远距离目标之间的空间关系至关重要。
Ultralytics 的优势:认识 YOLO26#
DAMO-YOLO 和 RTDETRv2 都是重要的学术成果,但要将它们转化为可扩展、可用于生产的应用并不容易。开发者经常会遇到代码库分散、不支持多任务学习以及部署流程复杂等问题。
这正是 Ultralytics 生态系统脱颖而出的地方。通过优先考虑易用性、维护完善的 Python API 和无可比拟的通用性,Ultralytics 确保开发者减少调试时间,把更多精力投入构建工作。
近期发布的 Ultralytics YOLO26 模型将这些优势提升到了新的高度,其突破性进展超越了 DAMO-YOLO 和 RTDETRv2:
- 端到端无 NMS 设计:最初由 YOLOv10 开创,YOLO26 提供可选的端到端检测头(
nms=False)。这消除了 NMS 后处理,使部署比传统 CNN 更快、更简单,同时具备与 RTDETRv2 相同的直接输出优势。 - CPU 推理速度最高提升 43%:YOLO26n 在 CPU ONNX 上的运行速度最高比 YOLO11n 快 43%,并针对不配备独立 GPU 的边缘 AI 设备进行了深度优化。与占用大量内存的 Transformer 相比,它是 IoT 应用的优越选择。
- MuSGD 优化器:受 Moonshot AI 的 Kimi K2 启发,这种结合 SGD 和 Muon 的混合优化器将大型语言模型(LLM)训练创新引入计算机视觉,带来了出色的训练稳定性和更快的收敛速度。
- ProgLoss + STAL:这些先进的损失函数显著提升了小目标识别能力,这是模型通常难以处理的领域。这对航空影像和无人机应用至关重要。
- 移除 DFL:已移除 Distribution Focal Loss,以简化导出格式并提升对低功耗边缘设备的兼容性。
- 无与伦比的多功能性:与仅限于检测任务的竞品模型不同,YOLO26 在各类任务中都进行了专门优化,例如为定向边界框(OBB)设计的专用角度损失、实现像素级精度的语义分割损失,以及用于姿态估计的残差对数似然估计(RLE)。
训练 RTDETRv2 这类基于 Transformer 的模型需要大量 CUDA 内存,通常还需要成本高昂的多 GPU 配置。Ultralytics YOLO 模型在训练和推理时所需的内存都显著更少,让研究人员和业余爱好者也能轻松开展 AI 开发。
代码示例:统一的 Ultralytics API#
Ultralytics 生态系统的一大优势是统一的 API。你可以无缝加载、训练和验证各种模型,包括 RT-DETR 的 PyTorch 实现和先进的 YOLO 模型,而无需改变工作流程。
from ultralytics import RTDETR, YOLO
# 加载 RT-DETR 模型
model_rtdetr = RTDETR("rtdetr-l.pt")
# 加载前沿的 YOLO26 模型
model_yolo = YOLO("yolo26n.pt")
# 使用简单统一的接口对图像进行推理
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# 显示检测到的目标
results_yolo[0].show()这种简洁性也延伸到了自定义数据集训练和导出环节。开发者可以使用 Ultralytics Python 包,通过一条命令轻松将训练好的权重部署到 CoreML 或 OpenVINO 等平台。
总结与进一步探索#
毫无疑问,DAMO-YOLO 和 RTDETRv2 都拓展了实时目标检测的能力边界。DAMO-YOLO 提供了高度优化、通过自动搜索得到的网络结构,以实现原始效率;RTDETRv2 则通过消除 NMS 等传统瓶颈,证明 Transformer 也能在实时领域展开竞争。
不过,对于追求性能、完善文档和生产就绪能力之间最佳平衡的开发者来说,Ultralytics YOLO 模型仍是黄金标准。YOLO26 的推出让用户能够使用可选的类 Transformer 端到端检测、受 LLM 启发的高效训练以及无与伦比的 CPU 速度,所有这些都集成在直观而稳健的生态系统中。
如果你正在为下一个项目评估模型,还可以阅读我们对 EfficientDet 与 RT-DETR 的比较,了解上一代模型 YOLO11,或查看 YOLOX 等学术基准模型。立即探索 Ultralytics 快速入门指南,开始构建。