Ultralytics YOLO27:
Get Started

YOLOX 与 PP-YOLOE+#

设计稳健的计算机视觉工作流时,选择合适的目标检测模型是一项关键决策。实时目标检测领域竞争激烈,众多架构都力求在推理速度和检测精度之间实现最佳平衡。在这篇技术对比中,我们将评估两款知名模型:YOLOX 和 PP-YOLOE+。通过考察它们的架构设计、训练方法和性能指标,我们希望为开发者和研究人员提供所需见解,帮助他们根据部署环境选择合适的工具。

架构创新与设计#

这两款模型都是为了解决早期 YOLO 版本的特定痛点而设计,但它们采用了截然不同的方法来处理速度与精度之间的权衡。

YOLOX:连接研究与产业#

YOLOX 由 Zheng Ge、Songtao Liu、Feng Wang、Zeming Li 和 Jian Sun 在 Megvii 开发,并于 2021 年 7 月 18 日发布。它全面采用无锚框设计,标志着 YOLO 系列的一次重大转变。你可以阅读其官方 Arxiv 论文,了解奠基性研究;也可以在 YOLOX GitHub 代码库中查看原始源代码。

YOLOX 集成了解耦头,将分类和回归任务分开处理,从而显著加快训练收敛速度。此外,它还引入了 SimOTA 等先进标签分配策略,用于动态分配正样本。这让模型效率很高,尤其适用于计算资源严格受限的边缘 AI环境。

了解更多 YOLOX 信息

PP-YOLOE+:高性能工业检测#

PP-YOLOE+ 由 PaddlePaddle 作者于 2022 年 4 月 2 日在 Baidu 推出,是 PP-YOLO 系列经过高度优化的演进版本。根据其 Arxiv 论文的详细介绍,PP-YOLOE+ 与 Baidu 生态深度集成,并且需要 PaddlePaddle 框架。模型配置可在 PaddleDetection GitHub 代码库中找到。

PP-YOLOE+ 依托强大的 CSPRepResNet 骨干网络,并采用高效任务对齐头(ET-head)和任务对齐学习(TAL)。该架构在 COCO 数据集上取得出色的平均精度均值(mAP),因此非常适合工业缺陷检测和重型服务器端处理等场景,尤其适用于优先考虑精度而非最少依赖项的情况。

进一步了解 PP-YOLOE+

性能基准测试#

了解这些模型在不同规模下的表现对于部署至关重要。下表列出了关键指标,包括 mAP 和导出至 TensorRT 后的推理速度。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
部署注意事项

PP-YOLOE+x 的绝对精度最高,而 YOLOX 提供了极轻量级的变体(Nano 和 Tiny),非常适合低功耗微控制器和旧款移动硬件。

用例与建议#

选择 YOLOX 还是 PP-YOLOE+,取决于你的具体项目需求、部署限制和生态偏好。

何时选择 YOLOX#

YOLOX 适合以下场景:

  • 无锚框检测研究:学术研究使用 YOLOX 简洁的无锚框架构作为基线,以试验新的检测头或损失函数。
  • 超轻量级边缘设备:部署到微控制器或旧款移动硬件时,YOLOX-Nano 变体极小的体积(0.91M 个参数)至关重要。
  • SimOTA 标签分配研究:研究项目用于探索基于最优传输的标签分配策略及其对训练收敛的影响。

何时选择 PP-YOLOE+#

以下情况推荐使用 PP-YOLOE+:

  • 集成 PaddlePaddle 生态系统:已有基于百度 PaddlePaddle框架和工具构建基础设施的组织。
  • Paddle Lite 边缘部署:部署到专门针对 Paddle Lite 或 Paddle 推理引擎进行了高度优化的推理内核的硬件上。
  • 高精度服务端检测:在强大的 GPU 服务器上优先追求最高检测准确率,且不受框架依赖限制的场景。

何时选择 Ultralytics (YOLO26)#

对于大多数新项目,Ultralytics YOLO26在性能与开发体验之间实现了最佳平衡:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

Ultralytics 的优势:认识 YOLO26#

YOLOX 和 PP-YOLOE+ 各有优势,但 AI 的快速发展要求工具兼具先进精度和无与伦比的易用性。这正是 Ultralytics 模型,尤其是近期发布的 Ultralytics YOLO26,胜过传统研究代码库的地方。

YOLO26 于 2026 年 1 月发布,为现代目标检测及更多任务树立了新标准,其开发体验远胜于竞争框架。

开发者为何选择 YOLO26#

  1. 端到端无 NMS 设计:在 YOLOv10开创的理念基础上,YOLO26 支持原生端到端推理。它借助可选的一对一检测头(nms=False),跳过非极大值抑制(NMS)后处理,确保延迟高度稳定,并大幅简化边缘环境下的导出流程。
  2. 新一代优化:通过 MuSGD 优化器彻底革新训练稳定性。该优化器结合了 SGD 和 Muon(灵感来自 Moonshot AI 的 Kimi K2 等大语言模型方法),可确保更快收敛。此外,YOLO26 采用 ProgLoss + STAL 大幅提升小目标识别能力,这对于涉及航拍影像和机器人的应用至关重要。
  3. 卓越的硬件效率:通过去除分布焦点损失(DFL),YOLO26 简化了检测头和导出计算图。它的 CPU 推理速度最高可提升 43%,对于缺少专用 GPU加速的设备而言,是理想之选。
  4. 极强的多功能性:PP-YOLOE+ 严格专注于检测,与之不同,YOLO26 统一支持多种任务。它为实例分割集成专用语义分割损失,通过残差对数似然估计(RLE)实现精准的姿态估计,并采用先进的角度损失机制处理有向边界框(OBB)。

无缝集成生态#

Ultralytics 让你告别复杂框架安装带来的困扰。使用统一的 Python API 或直观易用的 Ultralytics Platform,只需几行代码即可训练、验证和导出模型。

from ultralytics import YOLO

# 加载先进的 YOLO26 small 模型
model = YOLO("yolo26s.pt")

# 在自定义数据集上训练,同时最大限度减少 CUDA 显存开销
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# 轻松运行推理
predictions = model("https://ultralytics.com/images/bus.jpg")

# 原生导出为 ONNX,充分发挥无 NMS 架构的优势
model.export(format="onnx", nms=False)

对于希望在 Ultralytics 生态系统中评估其他强大架构的用户,YOLO11 仍是非常可靠的传统部署选择,而基于 Transformer 的 RT-DETR 则为寻求基于注意力机制解决方案的用户提供了出色的能力。

总结#

在 YOLOX 和 PP-YOLOE+ 之间做选择,通常取决于你的主要框架限制——比如你更偏好基于 PyTorch 的灵活性,还是与百度 PaddlePaddle 深度集成。不过,对于希望让 AI 基础设施面向未来的组织来说,Ultralytics YOLO26 是明显更出色的替代方案。YOLO26 支持可选的无 NMS 推理,内存占用轻量,任务适用范围全面,让团队能够以前所未有的轻松程度,构建更快速、更智能、更高效的计算机视觉应用。

评论