Ultralytics YOLO27:

DAMO-YOLO 与 YOLOv5#

计算机视觉的发展以实时目标检测领域的持续创新为标志。如今,开发者和研究人员在设计视觉流水线时,需要面对众多架构选择。这份全面的技术对比将探讨 DAMO-YOLOUltralytics YOLOv5 之间的细微差异,重点介绍它们各自的架构、训练方法、性能指标和理想部署场景。

DAMO-YOLO 简介#

DAMO-YOLO 由阿里巴巴集团发布,引入了多项旨在突破检测速度和精度极限的新技术。

了解有关 DAMO-YOLO 的更多信息

架构创新#

DAMO-YOLO 基于神经网络架构搜索(NAS)构建。作者利用 MAE-NAS 自动设计出平衡延迟与准确率的主干网络。DAMO-YOLO 引入了高效的 RepGFPN(重参数化广义特征金字塔网络),改善了不同尺度间的特征融合。此外,DAMO-YOLO 采用了“零头”(ZeroHead)设计,剥离了复杂的多分支预测头,转而采用在推理过程中高度依赖重参数化的更简单、更高效的结构。

为改进训练,该模型使用 AlignedOTA 进行标签分配,并采用强力的蒸馏增强流程:由更大的“教师”模型指导较小的“学生”模型,以获得更高的精度。

Ultralytics YOLOv5 简介#

Ultralytics YOLOv5 是全球采用最广泛的视觉架构之一,以稳定性、易用性和完善的部署生态而闻名。

生态标准#

YOLOv5 重新定义了行业的易用性标准。它原生基于 PyTorch 构建,采用高度优化的 CSPNet 主干网络和 PANet 颈部网络,实现稳健的特征聚合。虽然它早于后续模型中的无锚框趋势,但其高度完善的基于锚框的方法结合自动锚框学习,确保了开箱即用的出色性能。

YOLOv5 的真正优势在于其维护完善的生态。它可以无缝集成 CometWeights & Biases 等跟踪工具,并支持一键导出为 ONNXTensorRTCoreML 等格式。

开始使用 YOLOv5

YOLOv5 可以非常轻松地在自定义数据集上训练。简化后的 API 降低了从原型到生产的门槛,使其成为敏捷工程团队的热门选择。

性能与指标对比#

比较这些模型时,关键是要关注平均精度均值(mAP)、推理速度和参数量之间的平衡。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

分析取舍#

DAMO-YOLO 以其参数规模实现了令人印象深刻的 mAP 分数,这在很大程度上得益于其蒸馏训练阶段。然而,这也牺牲了训练效率。多阶段蒸馏流程要求先训练一个大型教师模型,从而显著增加所需的 GPU 计算时间和显存。

相比之下,YOLOv5 具有出色的内存需求表现。与复杂的蒸馏流水线或基于 Transformer 的模型(如 RT-DETR)相比,Ultralytics YOLO 模型在训练和推理期间都以较低的内存占用而闻名。这使得 YOLOv5 可以在消费级硬件或 Google Colab 等易于使用的云环境中高效训练。

实际应用与通用性#

选择合适的架构通常取决于部署环境。

DAMO-YOLO 的优势场景#

DAMO-YOLO 严格来说是一个目标检测模型。对于学术研究而言,DAMO-YOLO 是一个极佳的选择,特别是对于研究神经网络架构搜索的团队或旨在复现论文中详细介绍的重参数化技术的团队。如果一个项目拥有充裕的计算资源来执行蒸馏训练阶段,并且纯粹专注于榨取二维边界框的最后一点准确率,那么 DAMO-YOLO 是一个强有力的竞争者。

Ultralytics 的优势#

对于实际生产应用,Ultralytics 模型的易用性多功能性使其成为首选。虽然 YOLOv5 仍然是目标检测和图像分类领域的主力模型,但更广泛的 Ultralytics 生态允许开发者轻松地在不同任务之间切换。

例如,Ultralytics 系列中的较新迭代版本原生支持实例分割姿态估计定向边界框(OBB)检测。这种多任务能力确保团队可以使用统一的 Python API 构建复杂流水线,例如将自动车牌识别与车辆分割相结合。

使用场景与建议#

在 DAMO-YOLO 和 YOLOv5 之间进行选择,取决于你的具体项目需求、部署限制和生态偏好。

何时选择 DAMO-YOLO#

DAMO-YOLO 适合以下场景:

  • 高吞吐量视频分析: 在固定的 NVIDIA GPU 基础设施上处理高 FPS 视频流,其中批量大小为 1 时的吞吐量是首要指标。
  • 工业制造产线: 在专用硬件上具有严格 GPU 延迟约束的场景,例如装配线上的实时质量检测。
  • 神经架构搜索研究: 研究自动化架构搜索(MAE-NAS)和高效重参数化骨干网络对检测性能的影响。

何时选择 YOLOv5#

推荐在以下情况下使用 YOLOv5:

  • 经过生产验证的系统: 重视 YOLOv5 长期稳定记录、完善文档和庞大社区支持的现有部署项目。
  • 资源受限的训练: GPU 资源有限的环境,此时 YOLOv5 高效的训练流水线和较低的内存需求更具优势。
  • 广泛的导出格式支持: 需要跨多种格式部署的项目,包括 ONNXTensorRTCoreMLTFLite

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26 在性能和开发者体验之间提供了最佳组合:

  • 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
  • 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
  • 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。

未来:迁移到 YOLO26#

虽然 YOLOv5 久负盛名,DAMO-YOLO 也提供了有趣的学术洞见,但当前最先进的技术已经发生了演进。Ultralytics YOLO26 于 2026 年 1 月发布,代表了视觉社区的一次重大飞跃。

YOLO26 解决了边缘部署和训练不稳定性方面的传统瓶颈:

  • 端到端无 NMS 设计: YOLO26 原生消除了非极大值抑制后处理。这项突破简化了部署逻辑,并大幅降低了延迟波动,使其非常适合高速机器人和自主系统。
  • MuSGD 优化器: YOLO26 受到 LLM 训练创新(如 Moonshot AI 的 Kimi K2)的启发,采用 MuSGD 优化器(SGD 和 Muon 的混合体)。这确保了训练过程高度稳定,并显著加快收敛速度。
  • CPU 推理速度最高提升 43%: 通过有策略地移除分布焦点损失(DFL),与 YOLO11YOLOv8 等前代模型相比,YOLO26 在 CPU 和边缘设备上实现了大幅提升的速度。
  • ProgLoss + STAL: 这些先进的损失函数显著提升了小目标识别能力,这对于分析空中无人机图像和 IoT 传感器数据流至关重要。

代码示例:简洁实践#

Ultralytics 软件包只需几行代码即可让你训练和部署模型。无论你使用 YOLOv5 还是升级到推荐的 YOLO26,接口都保持一致且直观。

from ultralytics import YOLO

# Load the state-of-the-art YOLO26 small model
model = YOLO("yolo26s.pt")

# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference on an image and display results
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

# Export the model for edge deployment
model.export(format="onnx")

结论#

DAMO-YOLO 和 YOLOv5 都为计算机视觉领域的发展作出了重要贡献。DAMO-YOLO 展示了神经架构搜索和蒸馏的强大能力,是研究人员感兴趣的研究对象。然而,凭借其性能平衡、较低的内存需求和无与伦比的易用性,YOLOv5 仍然是一个实用的强大工具。

对于今天开始新项目的开发者,建议使用 Ultralytics Platform 并采用 YOLO26。它将 YOLOv5 广受欢迎的用户友好生态与突破性的架构改进相结合,为云端和边缘 AI 应用提供顶级精度与极快推理速度。开发者也可以根据具体的旧版硬件限制,探索 YOLOv6YOLOX 等其他高效模型。

评论