YOLO Vision 2026:

RTDETRv2 与 DAMO-YOLO#

计算机视觉领域在不断发展,研究人员和工程师们一直在努力构建能够完美平衡速度、准确性和效率的模型。在此领域引起广泛关注的两个杰出架构是百度开发的 RTDETRv2 和阿里巴巴集团打造的 DAMO-YOLO。这两个模型都突破了实时对象检测的边界,但它们采用了截然不同的架构哲学来实现其出色的成果。

在这篇技术比较中,我们将深入探讨它们的架构、训练方法和实际部署能力。我们还将探讨这些模型如何与更广泛的生态系统进行对比,特别是高度优化的Ultralytics Platform和最先进的YOLO26 architecture

架构创新#

了解这些模型的核心机制对于负责为生产环境选择合适工具的machine learning engineers至关重要。

RTDETRv2:Transformer 方法#

在继承原版 RT-DETR 成功经验的基础上,RTDETRv2 采用了一个混合编码器和一个transformer decoder。这种设计使模型能够极其有效地处理全局上下文,从而在密集场景中区分重叠对象时表现异常出色。该架构最显著的优势是其原生的无 NMS(非极大值抑制)设计。通过消除 NMS 后处理步骤,RTDETRv2 简化了推理流水线,并确保了不同硬件配置下更稳定的延迟。

了解更多关于 RTDETRv2 的信息

DAMO-YOLO:提升 CNN 效率#

另一方面,DAMO-YOLO 仍然根植于非常成功的基于 CNN 的 YOLO 谱系,但引入了几项突破性的增强功能。它利用神经架构搜索(NAS)来优化其主干网络,从而确保最高特征提取效率。此外,它结合了一个高效的 RepGFPN(重参数化广义特征金字塔网络)和 ZeroHead 设计,以及 AlignedOTA 和蒸馏增强技术。这些创新使 DAMO-YOLO 能够在保持极具竞争力的 mAPval 分数的同时实现极快的推理速度。

了解更多关于 DAMO-YOLO 的信息

架构差异

虽然 RTDETRv2 专注于利用注意力机制进行全局特征理解且无需 NMS,但 DAMO-YOLO 通过 NAS 和高级蒸馏最大化了传统 CNN 的效率,这需要标准的后处理,但在某些硬件上具有明显的速度优势。

性能与指标对比#

在评估用于部署的模型时,平均精度均值(mAP)、推理速度和参数量等performance metrics至关重要。以下是对这两个模型系列的详细对比。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
参数量
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

结果分析#

正如表中所示,RTDETRv2-x 实现了最高的准确率,mAPval 高达 54.3,展示了 Transformer 架构在诸如COCO dataset等复杂验证集上的强大威力。然而,这是以显著增加参数量(76M)和 FLOPs 为代价的。

相反,DAMO-YOLOt(微型版)非常轻量,仅需 8.5M 参数,使其成为 CUDA 内存严重受限的环境中一种极其快速的选择。DAMO-YOLO 通常为旧版边缘设备提供了速度与精度之间的有利权衡。

生态系统、可用性与 Ultralytics 优势#

虽然诸如官方RT-DETR GitHubDAMO-YOLO GitHub等独立仓库提供了训练这些模型的原始代码,但将它们集成到生产流水线中通常需要大量的样板代码和手动优化。

这就是Ultralytics ecosystem极大地简化开发者体验的地方。Ultralytics 将 RTDETRv2 等模型直接集成到其统一的 API 中,允许用户通过单行代码训练、验证和导出模型。此外,与沉重的基于 Transformer 的独立仓库相比,Ultralytics 模型以在训练期间内存需求极低而闻名。

代码示例:无缝集成#

以下展示了你可以如何轻松利用 Ultralytics Python 库来运行推理。无论你使用的是 transformer 模型还是最先进的 CNN,其 API 都保持一致。

from ultralytics import RTDETR, YOLO

# Load an RTDETRv2 model for complex scene understanding
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load the latest Ultralytics YOLO26 model for ultimate edge performance
model_yolo26 = YOLO("yolo26n.pt")

# Run inference on a sample image effortlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Display the results
results_yolo[0].show()
导出模型以用于生产

使用 Ultralytics API,你可以通过一个简单的 model.export(format="engine") 命令,将训练好的模型无缝导出为 TensorRT、ONNX 或 CoreML 等格式,从而大幅减少部署阻力。

理想使用场景#

在这些架构之间进行选择完全取决于你的具体项目需求:

  • RTDETRv2 在 VRAM 充足的服务器端处理中表现出色。其全局上下文感知能力非常适合遮挡频繁的medical imaging和密集人群分析。
  • DAMO-YOLO 非常适合参数量低且 FPS 要求严格的embedded IoT applications和高速移动的工业检测线。

未来:Ultralytics YOLO26#

虽然 RTDETRv2 和 DAMO-YOLO 各有优缺点,但计算机视觉领域发展迅速。对于新项目,最新的 Ultralytics YOLO26 代表了速度、准确性和开发者体验的终极融合。

YOLO26 采用端到端无 NMS 设计,在没有巨大计算开销的情况下捕获了 Transformer 的主要优势。它结合了受Large Language Model训练启发而创新的 MuSGD Optimizer,以实现稳定、快速的收敛。此外,通过 DFL 移除(移除了分布焦点损失以简化导出并更好地兼容边缘/低功耗设备),YOLO26 实现了高达 43% 的更快 CPU 推理,使其成为edge computing无可争议的王者。此外,ProgLoss + STAL 提供了改进的损失函数,在小目标识别方面有显著提升,这对物联网、机器人和航空影像至关重要。

与严格限于边界框的模型不同,YOLO26 系列提供了无与伦比的多功能性,支持从instance segmentationpose estimationoriented bounding boxes (OBB)的任务,所有这些都通过直观的Ultralytics Platform进行无缝管理。

在平台上探索 YOLO26

模型详情与参考资料#

RTDETRv2#

DAMO-YOLO#

对于有兴趣探索其他比较的用户,请查看我们关于RTDETRv2 vs. YOLO11DAMO-YOLO vs. YOLOv8的指南,了解这些模型与 Ultralytics 家族早期版本的性能对比。

评论