Ultralytics YOLO27:
Get Started

DAMO-YOLO 与 RTDETRv2#

快速发展的计算机视觉领域涌现出大量架构,旨在平衡速度、精度和计算效率。DAMO-YOLO 和 RTDETRv2 是两款各具特色、采用不同方法应对这些挑战的代表性模型。虽然两者都致力于提供先进的实时推理解决方案,但它们在架构理念上存在根本差异。

本指南将深入介绍这两款模型的技术规格、架构创新和实际应用场景,同时探讨 Ultralytics Platform 和先进的 YOLO26 等现代解决方案如何重新定义部署和易用性的行业标准。

模型概述#

了解 DAMO-YOLO#

DAMO-YOLO 由阿里巴巴集团的研究人员开发,是一种快速、精准的目标检测方法,高度依赖神经架构搜索(NAS)。它使用 NAS 生成的低延迟结构取代传统的手工设计骨干网络。此外,它还采用高效的 RepGFPN(重参数化通用特征金字塔网络)和 ZeroHead 设计,以简化特征聚合和边界框预测。

模型主要信息:

进一步了解 DAMO-YOLO

了解 RTDETRv2#

百度的 RTDETRv2 标志着实时检测 Transformer 的重大进步。与依赖锚框和非极大值抑制(NMS)的传统卷积神经网络(CNN)不同,RTDETRv2 使用自注意力机制,从全局上下文角度理解整张图像。它直接输出边界框,完全跳过 NMS 后处理步骤。该模型引入了“免费福利包”训练策略,在不增加推理延迟的情况下提升基线精度。

模型主要信息:

进一步了解 RTDETRv2

在视觉 AI 中采用 Transformer

虽然 Transformer 需要更多计算资源,但它们能够处理全局上下文,因此在复杂场景理解方面非常有效,而这正是 RTDETRv2 的主要优势。

性能对比#

在评估这些模型用于实际部署时,平均精度均值(mAP)、推理速度和内存占用等指标至关重要。与 DAMO-YOLO 这类轻量级 CNN 相比,RTDETRv2 等基于 Transformer 的模型在训练和推理时通常需要更多 CUDA 显存。

下面将详细比较它们的性能指标。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

理想应用场景#

DAMO-YOLO 的优势场景: 由于采用了 NAS 优化的骨干网络,并且较小版本(如 DAMO-YOLOt)的参数量特别少,因此 DAMO-YOLO 非常适合部署在资源受限的硬件上。如果你使用 ONNX 等运行时,或针对边缘计算使用专用的 TensorRT 引擎来构建嵌入式设备解决方案,DAMO-YOLO 能提供响应迅速的框架。

RTDETRv2 的优势场景: RTDETRv2 在具备服务器级 GPU 且全局图像上下文至关重要的场景中表现出色。它的 Transformer 架构能够自然地处理重叠边界框,而无需 NMS,因此非常适合密集的人群管理或复杂的目标跟踪任务,在这些任务中,远距离目标之间的空间关系至关重要。

Ultralytics 的优势:认识 YOLO26#

DAMO-YOLO 和 RTDETRv2 都是重要的学术成果,但要将它们转化为可扩展、可用于生产的应用并不容易。开发者经常会遇到代码库分散、不支持多任务学习以及部署流程复杂等问题。

这正是 Ultralytics 生态系统脱颖而出的地方。通过优先考虑易用性、维护完善的 Python API 和无可比拟的通用性,Ultralytics 确保开发者减少调试时间,把更多精力投入构建工作。

近期发布的 Ultralytics YOLO26 模型将这些优势提升到了新的高度,其突破性进展超越了 DAMO-YOLO 和 RTDETRv2:

  • 端到端无 NMS 设计:最初由 YOLOv10 开创,YOLO26 提供可选的端到端检测头(nms=False)。这消除了 NMS 后处理,使部署比传统 CNN 更快、更简单,同时具备与 RTDETRv2 相同的直接输出优势。
  • CPU 推理速度最高提升 43%:YOLO26n 在 CPU ONNX 上的运行速度最高比 YOLO11n 快 43%,并针对不配备独立 GPU 的边缘 AI 设备进行了深度优化。与占用大量内存的 Transformer 相比,它是 IoT 应用的优越选择。
  • MuSGD 优化器:受 Moonshot AI 的 Kimi K2 启发,这种结合 SGD 和 Muon 的混合优化器将大型语言模型(LLM)训练创新引入计算机视觉,带来了出色的训练稳定性和更快的收敛速度。
  • ProgLoss + STAL:这些先进的损失函数显著提升了小目标识别能力,这是模型通常难以处理的领域。这对航空影像和无人机应用至关重要。
  • 移除 DFL:已移除 Distribution Focal Loss,以简化导出格式并提升对低功耗边缘设备的兼容性。
  • 无与伦比的多功能性:与仅限于检测任务的竞品模型不同,YOLO26 在各类任务中都进行了专门优化,例如为定向边界框(OBB)设计的专用角度损失、实现像素级精度的语义分割损失,以及用于姿态估计的残差对数似然估计(RLE)。
内存效率至关重要

训练 RTDETRv2 这类基于 Transformer 的模型需要大量 CUDA 内存,通常还需要成本高昂的多 GPU 配置。Ultralytics YOLO 模型在训练和推理时所需的内存都显著更少,让研究人员和业余爱好者也能轻松开展 AI 开发。

代码示例:统一的 Ultralytics API#

Ultralytics 生态系统的一大优势是统一的 API。你可以无缝加载、训练和验证各种模型,包括 RT-DETR 的 PyTorch 实现和先进的 YOLO 模型,而无需改变工作流程。

from ultralytics import RTDETR, YOLO

# 加载 RT-DETR 模型
model_rtdetr = RTDETR("rtdetr-l.pt")

# 加载前沿的 YOLO26 模型
model_yolo = YOLO("yolo26n.pt")

# 使用简单统一的接口对图像进行推理
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# 显示检测到的目标
results_yolo[0].show()

这种简洁性也延伸到了自定义数据集训练和导出环节。开发者可以使用 Ultralytics Python 包,通过一条命令轻松将训练好的权重部署到 CoreML 或 OpenVINO 等平台。

总结与进一步探索#

毫无疑问,DAMO-YOLO 和 RTDETRv2 都拓展了实时目标检测的能力边界。DAMO-YOLO 提供了高度优化、通过自动搜索得到的网络结构,以实现原始效率;RTDETRv2 则通过消除 NMS 等传统瓶颈,证明 Transformer 也能在实时领域展开竞争。

不过,对于追求性能、完善文档和生产就绪能力之间最佳平衡的开发者来说,Ultralytics YOLO 模型仍是黄金标准。YOLO26 的推出让用户能够使用可选的类 Transformer 端到端检测、受 LLM 启发的高效训练以及无与伦比的 CPU 速度,所有这些都集成在直观而稳健的生态系统中。

如果你正在为下一个项目评估模型,还可以阅读我们对 EfficientDet 与 RT-DETR 的比较,了解上一代模型 YOLO11,或查看 YOLOX 等学术基准模型。立即探索 Ultralytics 快速入门指南,开始构建。

评论