Ultralytics YOLO27:
Get Started

YOLOX 与 DAMO-YOLO#

实时目标检测的发展历程中,出现了许多范式转变,从基于锚框到无锚框架构,再到从手工设计骨干网络转向自动化神经架构搜索 (NAS)。在这篇全面的技术对比中,我们将分析这一历程中的两个重要里程碑:YOLOX 和 DAMO-YOLO。我们将探讨它们的架构创新、训练方法和性能取舍,同时介绍面向现代开发者的现代化方案 Ultralytics YOLO26,它提供了无与伦比的替代选择。

YOLOX:开创无锚框范式#

YOLOX 由郑戈、刘松涛、王峰、李泽民和孙剑于 2021 年 7 月 18 日在 旷视科技 发布。它成功将无锚框设计引入 YOLO 系列,成为一个关键转折点。正如他们详尽的 ArXiv 技术报告所述,YOLOX 旨在弥合学术研究与工业部署之间的差距。

关键架构创新#

YOLOX 引入了几项核心结构变革,大幅改进了此前的模型:

  • 无锚框机制: YOLOX 直接预测物体中心及其边界框尺寸,减少了设计启发式规则的数量,并简化了复杂的锚框聚类流程。这使它能够灵活适应各种计算机视觉场景。
  • 解耦头: 传统 YOLO 模型使用单个耦合头同时执行分类和回归。YOLOX 采用解耦头,分别处理分类和定位,从而大幅加快收敛速度并提升准确率。
  • SimOTA 标签分配: YOLOX 使用最优传输分配 (OTA) 的简化版本,动态分配正样本,缩短训练时间并解决中心点分配中的歧义。
YOLOX 的传承

YOLOX 的解耦头设计对后续几代目标检测器产生了深远影响,并成为许多现代模型的标准特性。

了解更多 YOLOX 信息

DAMO-YOLO:大规模自动化架构搜索#

DAMO-YOLO 由许先哲及阿里巴巴集团 Alibaba Group 的研究团队开发,于 2022 年 11 月 23 日推出。正如他们的 ArXiv 论文所述,该模型大量采用神经架构搜索 (NAS),推动速度与准确率的帕累托前沿不断提升。

关键架构创新#

DAMO-YOLO 的策略建立在自动化高效结构设计的基础上:

  • MAE-NAS 骨干网络: DAMO-YOLO 采用最大熵引导搜索,为特定延迟预算定制并发现高效骨干网络,尤其适用于导出到 TensorRT 等框架的情况。
  • 高效 RepGFPN: 这种较重的颈部结构显著增强了不同空间分辨率之间的特征融合,对于航空影像分析和检测不同尺度的物体尤其有益。
  • ZeroHead: 这种简化的预测头在不牺牲模型整体平均精度均值 (mAP) 的前提下,减少了计算冗余。
  • AlignedOTA 和蒸馏: 结合先进的标签分配和教师-学生知识蒸馏,充分挖掘较小学生模型的性能。

进一步了解 DAMO-YOLO

性能与指标对比#

比较这两种模型时,我们需要关注它们的参数量、所需 FLOPs 和延迟表现。以下是 YOLOX 和 DAMO-YOLO 在多个规模下的基准测试数据。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

虽然这两种模型都取得了令人瞩目的成果,但也各有局限。YOLOX 需要仔细调整解耦头,而 DAMO-YOLO 高度依赖蒸馏,因此在自定义数据集上重新训练需要大量资源,并占用大量 GPU 内存。

用例与建议#

选择 YOLOX 还是 DAMO-YOLO,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLOX#

YOLOX 适合以下场景:

  • 无锚框检测研究:学术研究使用 YOLOX 简洁的无锚框架构作为基线,以试验新的检测头或损失函数。
  • 超轻量级边缘设备:部署到微控制器或旧款移动硬件时,YOLOX-Nano 变体极小的体积(0.91M 个参数)至关重要。
  • SimOTA 标签分配研究:研究项目用于探索基于最优传输的标签分配策略及其对训练收敛的影响。

何时选择 DAMO-YOLO#

推荐在以下情况下使用 DAMO-YOLO:

  • 高吞吐量视频分析:在固定的 NVIDIA GPU 基础设施上处理高帧率视频流,且主要关注批量大小为 1 时的吞吐量。
  • 工业制造生产线:在专用硬件上对 GPU 延迟有严格要求的场景,例如装配线上的实时质量检测。
  • 神经架构搜索研究:研究自动架构搜索 (MAE-NAS) 和高效重参数化骨干网络对检测性能的影响。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26在性能与开发体验之间实现了最佳平衡:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

Ultralytics 的优势:认识 YOLO26#

YOLOX 和 DAMO-YOLO 虽然是重要的历史里程碑,但现代开发者需要一种兼具最先进准确率和无与伦比易用性的方案。Ultralytics YOLO26 正是改变这一局面的选择。YOLO26 于 2026 年 1 月发布,在无 NMS 模型的基础上进一步发展,实现了速度、准确率和开发体验之间的理想平衡。

为什么选择 YOLO26?#

集成式 Ultralytics 生态系统通过以下优势,胜过零散的学术代码仓库:

  • 端到端无 NMS 设计: YOLO26 的可选一对一头 (nms=False) 在推理期间无需执行非极大值抑制 (NMS)。这带来了极快且可预测的延迟,对于边缘部署和自动驾驶汽车至关重要。
  • 移除 DFL: 移除分布焦点损失后,YOLO26 简化了向边缘设备的导出流程,大幅降低了轻量级应用的内存需求。
  • MuSGD 优化器: YOLO26 借鉴大语言模型训练创新,采用 SGD 与 Muon 的混合优化器,确保训练稳定可靠并快速收敛。
  • CPU 推理速度最高提升 43%: 得益于深度结构优化,YOLO26 无需昂贵的 GPU 硬件,就能在 CPU 上实现极快推理。
  • 高级损失函数: ProgLoss + STAL 的集成显著提升了小目标识别能力,非常适合无人机巡检和物联网监控等任务。
  • 多功能性: 与纯粹用于检测的 DAMO-YOLO 不同,YOLO26 在统一框架中原生支持实例分割、姿态估计、图像分类和有向边界框 (OBB)任务。
立即开始构建

借助 Ultralytics Python API,你无需手动配置复杂的蒸馏流程,也不必编写数百行 C++ 代码来部署模型。

from ultralytics import YOLO

# 加载先进的 YOLO26 nano 模型
model = YOLO("yolo26n.pt")

# 在自定义数据集上轻松训练模型
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# 运行超高速无 NMS 推理
results = model("https://ultralytics.com/images/bus.jpg", nms=False)

# 只需一条命令即可导出为 ONNX 或 OpenVINO
model.export(format="openvino")

其他值得考虑的模型#

计算机视觉生态系统十分庞大。根据你的具体限制,你也可以了解 Ultralytics 生态系统全面支持的其他架构:

  • YOLO11: YOLO26 能力出众的前代模型,以其在零售分析和制造业质量控制中的稳健表现而闻名。
  • YOLOv8: 这是一款广受赞誉、非常稳定的无锚框模型,推动了边缘部署的广泛普及。
  • RT-DETR: 由百度开发的实时检测 Transformer,为高度受益于全局注意力机制的任务提供了出色的替代方案,但训练时需要更多内存。

结论#

YOLOX 和 DAMO-YOLO 都为深度学习的发展贡献了重要理念——YOLOX 验证了解耦式无锚框方法,DAMO-YOLO 则展示了自动化架构搜索的强大能力。不过,在实际生产中,它们原始研究代码库的复杂性可能会拖慢敏捷团队的进度。

借助全面的 Ultralytics Platform,开发者可以绕过这些障碍。凭借 YOLO26 的端到端设计、出色的 CPU 速度和丰富的文档,开发最先进的视觉 AI 从未如此简单。无论你是在构建智慧城市基础设施、医疗诊断系统还是先进机器人,Ultralytics 都能为你提供从原始数据到可靠的真实世界部署的最高效路径。

评论