Ultralytics YOLO27:
Get Started

DAMO-YOLO 与 PP-YOLOE+#

在竞争激烈的实时计算机视觉领域,为特定部署需求选择最优架构至关重要。本指南对 DAMO-YOLO 和 PP-YOLOE+ 进行全面的技术比较,深入探讨它们的架构设计、训练方法和性能指标。我们还将考察这些模型与新发布的 Ultralytics YOLO26 等先进方案相比表现如何。

模型概述#

这两个框架都于 2022 年问世,作为工业应用的强大替代方案,利用复杂技术不断突破精度和推理速度的极限。

DAMO-YOLO#

DAMO-YOLO 由 阿里巴巴集团开发,引入了多项新技术来优化延迟与精度之间的权衡,主要依靠自动搜索技术和先进的特征融合。

DAMO-YOLO 使用最大熵神经架构搜索(MAE-NAS)自动设计针对硬件效率优化的骨干网络。它还采用高效的 RepGFPN(重参数化广义特征金字塔网络)进行颈部特征融合,并使用轻量级的“ZeroHead”设计。此外,训练过程中还大量采用蒸馏技术,以增强学生模型的表征能力。

进一步了解 DAMO-YOLO

PP-YOLOE+#

PP-YOLOE+ 来自 百度 PaddlePaddle 团队,是 PP-YOLOE 架构的渐进式升级版本。它侧重于大规模预训练和改进的损失函数,以实现较高的 mAP,尤其是在其原生深度学习框架中。

PP-YOLOE+ 使用 CSPRepResNet 骨干网络和 ET-head(高效任务对齐检测头)。“plus”版本在 Objects365 数据集上采用了强大的预训练策略,显著提升了模型在多样化真实环境中的泛化能力。

进一步了解 PP-YOLOE+

架构对比#

这两种模型设计理念上的差异,对各自理想的使用场景和硬件兼容性有很大影响。

特征融合与骨干网络#

DAMO-YOLO 的 MAE-NAS 生成的骨干网络针对边缘设备进行了高度定制,通常能提供良好的速度与参数量比。不过,这些定制架构可能较为僵化,难以适配实例分割等新任务。RepGFPN 颈部结构改进了多尺度特征融合,但增加了重参数化导出阶段的复杂性。

PP-YOLOE+ 采用了更传统但效果显著的 CSPRepResNet。虽然在精度相近时,该骨干网络的参数量比 DAMO-YOLO 更大,但训练稳定性高,也更容易集成到现有流水线中。它的 ET-head 能高效处理分类和回归任务,但仍需执行非极大值抑制(NMS)等后处理步骤。

消除后处理延迟

DAMO-YOLO 和 PP-YOLOE+ 都需要使用 NMS 对边界框进行后处理。如果推理延迟至关重要,可以考虑使用 Ultralytics YOLO26,它通过可选的一对一检测头(nms=False)实现原生的端到端无 NMS 设计。这一突破性方案无需 NMS 后处理,可构建更快、更简单的部署流水线。

性能与指标分析#

在评估这些模型是否适用于生产时,精度(mAP)、推理速度和参数量之间的平衡至关重要。以下是它们主要变体的直接对比。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

如表格所示,DAMO-YOLO 在微型(t)和小型(s)规格下精度更高,并且凭借 NAS 优化的骨干网络,DAMO-YOLOt 在这里所有模型中实现了最低的 T4 TensorRT 延迟。不过,PP-YOLOE+ 在中型(m)和大型(l)规格下扩展性极佳,mAP 得分更高,但 T4 TensorRT 速度略有下降。

内存需求与训练效率#

DAMO-YOLO 依赖蒸馏,因此你通常需要先训练一个大得多的教师模型,再训练较小的学生模型。这会大幅增加 CUDA 内存需求和整体计算预算。PP-YOLOE+ 采用标准的单阶段训练,流程更简单,但仍与 PaddlePaddle 框架紧密绑定,这可能会限制习惯使用 PyTorch 的团队的灵活性。

相比之下,现代的 Ultralytics YOLO26 模型解决了这些瓶颈。YOLO26 使用全新的 MuSGD 优化器——一种受 LLM 训练创新启发、结合 SGD 和 Muon 的混合优化器——无需复杂的蒸馏流水线即可实现更快收敛和高度稳定的训练。此外,与 RT-DETR 等基于 Transformer 的检测器相比,YOLO 模型在训练期间通常需要的 CUDA 内存少得多。

实际应用与理想用例#

DAMO-YOLO 的适用场景#

DAMO-YOLO 适用于高吞吐量的边缘推理场景,尤其适合延迟是主要瓶颈的情况。它的小型变体在交通管理系统或基础无人机监控等环境中表现出色,前提是你的工程团队有足够资源来处理复杂的蒸馏和重参数化流程。

何时使用 PP-YOLOE+#

如果你已经深入使用百度生态系统,或正在运行大规模服务器部署,那么 PP-YOLOE+ 会很适合你。它出色的 mAP 使其适用于复杂的医学图像分析或密集的制造业缺陷检测。

Ultralytics 优势#

尽管 DAMO-YOLO 和 PP-YOLOE+ 各有特定优势,但追求最大多功能性、速度和易用性的开发者始终会选择 Ultralytics Platform。

升级计算机视觉流水线时,Ultralytics YOLO26 能为开发者带来无与伦比的体验:

  • CPU 推理速度最高提升 43%:彻底移除 Distribution Focal Loss(DFL)后,YOLO26 在边缘 CPU 和低功耗 IoT 设备上速度出众。
  • 改进小目标检测:集成 ProgLoss 和 STAL 损失函数后,小目标识别能力大幅提升,这对航空影像至关重要。
  • 广泛的多功能性:与专注于检测的 PP-YOLOE+ 不同,YOLO26 可无缝处理姿态估计、定向边界框(OBB)和语义分割,并针对各项任务进行了专门的架构优化。

结论#

DAMO-YOLO 和 PP-YOLOE+ 是无锚框目标检测发展历程中的重要里程碑。DAMO-YOLO 推动了神经架构搜索在边缘延迟优化方面的极限,而 PP-YOLOE+ 则展现了大规模预训练的强大能力。

不过,对于追求速度、精度和部署简便性之间最佳平衡的开发者来说,Ultralytics YOLO26 是明确之选。它的无 NMS 架构、稳健的 Python API,以及与 Weights & Biases 和 TensorRT 等工具的无缝集成,确保项目从原型开发到投入生产都能顺利推进。

准备开始了吗?查看 Ultralytics 快速入门指南,或在我们的 YOLO11 与 DAMO-YOLO 概览中比较更多模型。

评论