Ultralytics YOLO27:
Get Started

DAMO-YOLO 与 YOLOv5#

计算机视觉的发展以实时目标检测领域的持续创新为标志。如今,开发者和研究人员在设计视觉处理流程时面临着众多架构选择。本篇全面的技术对比将探讨 DAMO-YOLO 和 Ultralytics YOLOv5 之间的差异,重点介绍它们各自的架构、训练方法、性能指标和理想部署场景。

DAMO-YOLO 简介#

DAMO-YOLO 由阿里巴巴集团发布,引入了多项新技术,旨在推动检测速度和精度的极限。

进一步了解 DAMO-YOLO

架构创新#

DAMO-YOLO 基于神经架构搜索(NAS)构建。作者使用 MAE-NAS 自动设计能够平衡延迟和精度的骨干网络。该模型引入了高效的 RepGFPN(重参数化通用特征金字塔网络),以改善不同尺度间的特征融合。此外,DAMO-YOLO 采用了“ZeroHead”设计,去除复杂的多分支预测头,改用更简单高效的结构,并在推理过程中大量依赖重参数化。

为改善训练效果,该模型使用 AlignedOTA 进行标签分配,并采用强力蒸馏增强流程:较大的“教师”模型指导较小的“学生”模型,从而提升精度。

Ultralytics YOLOv5 简介#

Ultralytics YOLOv5 是全球应用最广泛的视觉架构之一,以稳定性、易用性和丰富的部署生态系统而闻名。

生态系统标杆#

YOLOv5 重新定义了行业的易用性标准。它原生基于 PyTorch 构建,采用高度优化的 CSPNet 骨干网络和 PANet 颈部网络,实现稳健的特征聚合。虽然它早于后续模型中的无锚框趋势,但经过充分优化的基于锚框的方法结合自动锚框学习,确保了模型开箱即用时就有出色表现。

YOLOv5 的真正优势在于其维护完善的生态系统。它可与 Comet 和 Weights & Biases 等跟踪工具无缝集成,并支持一键导出为 ONNX、TensorRT 和 CoreML 等格式。

YOLOv5 入门指南

YOLOv5 在自定义数据集上训练非常简单。精简的 API 降低了从原型到生产的门槛,因此深受敏捷工程团队青睐。

性能与指标对比#

比较这些模型时,必须关注平均精度均值(mAP)、推理速度和参数量之间的平衡。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7

权衡分析#

DAMO-YOLO 的参数量不大,却能取得出色的 mAP,这很大程度上得益于蒸馏训练阶段。但这会牺牲训练效率。多阶段蒸馏流程要求先训练一个大型教师模型,显著增加所需的 GPU 计算时间和显存。

相比之下,YOLOv5 的内存需求表现出色。与复杂的蒸馏流程或 RT-DETR 等基于 Transformer 的模型相比,Ultralytics YOLO 模型在训练和推理期间的内存用量都更低。因此,YOLOv5 可以在消费级硬件或 Google Colab 等便捷的云环境中高效训练。

实际应用与多功能性#

选择合适的架构通常取决于部署环境。

DAMO-YOLO 的优势场景#

DAMO-YOLO 是纯粹的目标检测模型。它非常适合学术研究,尤其适用于研究神经架构搜索或尝试复现论文中重参数化技术的团队。如果项目拥有充足的计算资源来执行蒸馏训练阶段,并且只专注于尽可能提升 2D 边界框精度,DAMO-YOLO 是强有力的候选方案。

Ultralytics 优势#

在实际生产中,Ultralytics 模型的易用性和通用性使其成为首选。YOLOv5 仍然是目标检测和图像分类领域的主力,而更广泛的 Ultralytics 生态系统则让开发者能够轻松切换任务。

例如,更新的 Ultralytics 系列版本原生支持实例分割、姿态估计和有向边界框(OBB)检测。借助这种多任务能力,团队可以使用统一的 Python API 构建复杂流程,例如将自动车牌识别与车辆分割结合起来。

用例与建议#

如何在 DAMO-YOLO 和 YOLOv5 之间做选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 DAMO-YOLO#

DAMO-YOLO 适用于:

  • 高吞吐量视频分析:在固定的 NVIDIA GPU 基础设施上处理高帧率视频流,且主要关注批量大小为 1 时的吞吐量。
  • 工业制造生产线:在专用硬件上对 GPU 延迟有严格要求的场景,例如装配线上的实时质量检测。
  • 神经架构搜索研究:研究自动架构搜索 (MAE-NAS) 和高效重参数化骨干网络对检测性能的影响。

何时选择 YOLOv5#

推荐在以下情况下选择 YOLOv5:

  • 经过验证的生产系统: 现有部署重视 YOLOv5 长期积累的稳定记录、详尽文档和庞大社区支持。
  • 资源受限的训练: GPU 资源有限的环境中,YOLOv5 高效的训练流水线和较低的内存需求具有优势。
  • 广泛支持导出格式: 需要跨多种格式部署的项目,包括 ONNX、TensorRT、CoreML和 LiteRT。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26在性能与开发体验之间实现了最佳平衡:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

未来方向:迈向 YOLO26#

YOLOv5 堪称经典,DAMO-YOLO 也带来了有趣的学术见解,但技术前沿已经不断演进。Ultralytics YOLO26 于 2026 年 1 月发布,为视觉领域带来了重大飞跃。

YOLO26 解决了边缘部署和训练不稳定方面的传统瓶颈:

  • 端到端无 NMS 设计:YOLO26 的可选端到端检测头(nms=False)消除了非极大值抑制后处理。这项突破简化了部署逻辑,并大幅降低了延迟波动,非常适合高速机器人技术和自动驾驶系统。
  • MuSGD 优化器:受 LLM 训练创新(如 Moonshot AI 的 Kimi K2)启发,YOLO26 使用 MuSGD 优化器(SGD 和 Muon 的混合)。这能确保训练过程高度稳定,并显著加快收敛速度。
  • CPU 推理速度最高提升 43%:通过有针对性地移除分布焦点损失(DFL),YOLO26n 在 CPU 上运行 ONNX 时比 YOLO11n 快 43%,与 YOLO11 和 YOLOv8 等前代模型相比,在 CPU 和边缘设备上速度更快。
  • ProgLoss + STAL:这些先进的损失函数显著提升了小目标识别能力,这对于分析无人机航拍图像和 IoT 传感器数据流至关重要。

代码示例:简洁直观的实践#

使用 Ultralytics 软件包,只需几行代码即可训练和部署模型。无论你使用 YOLOv5,还是升级到推荐的 YOLO26,接口始终保持一致且直观。

from ultralytics import YOLO

# 加载先进的 YOLO26 small 模型
model = YOLO("yolo26s.pt")

# 轻松使用自定义数据集训练
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# 对图像运行推理并显示结果
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

# 导出模型以便部署到边缘设备
model.export(format="onnx")

结论#

DAMO-YOLO 和 YOLOv5 都为计算机视觉领域作出了重要贡献。DAMO-YOLO 展现了神经架构搜索和蒸馏的强大能力,是研究人员值得研究的模型。不过,凭借出色的性能平衡、低内存需求和无可比拟的易用性,YOLOv5 仍是一款实用的强大模型。

对于现在开始新项目的开发者,我们建议使用 Ultralytics Platform 并采用 YOLO26。它将 YOLOv5 广受欢迎的易用生态系统与突破性的架构进展结合起来,确保在云端和边缘 AI 应用中都能实现顶尖精度和极速推理。根据具体的旧款硬件限制,开发者也可以考虑 YOLOv6 或 YOLOX 等其他高效模型。

评论