Ultralytics YOLO27:
Get Started

YOLOv9 与 YOLO26#

过去几年,实时目标检测领域发生了显著变化。随着机器学习从业者尝试在各种硬件上部署模型,选择合适的架构至关重要。本技术指南将对比计算机视觉领域的两个重要里程碑:YOLOv9 于 2024 年初推出,重点优化梯度路径;而 Ultralytics YOLO26 是 2026 年初发布的最新先进框架,彻底重新定义了边缘推理和训练稳定性。

摘要:模型沿革与作者#

了解这些深度学习模型的起源,有助于理解其架构设计选择和目标受众。

YOLOv9#

YOLOv9 由台湾 Academia Sinica 信息科学研究所的 Chien-Yao Wang 和 Hong-Yuan Mark Liao 编写,于 2024 年 2 月 21 日发布。该模型重点关注深度学习理论概念,尤其针对深度卷积神经网络 (CNN) 中的信息瓶颈问题。

了解有关 YOLOv9 的更多信息

Ultralytics YOLO26#

YOLO26 由 Ultralytics 的 Glenn Jocher 和 Jing Qiu 编写,于 2026 年 1 月 14 日发布。在 YOLO11 和 YOLOv8 等前代模型大获成功的基础上,YOLO26 从头开始设计,优先考虑生产就绪性、边缘部署和原生端到端效率。

立即试用 YOLO26

准备好升级你的计算机视觉工作流了吗?使用 Ultralytics Platform,你无需编写代码,就能轻松在云端训练和部署 YOLO26 模型。

架构创新#

这两种模型都对神经网络处理视觉数据的方式进行了突破性改进,但解决问题的角度各不相同。

YOLOv9 中的可编程梯度信息#

YOLOv9 对该领域的主要贡献是引入了可编程梯度信息 (PGI) 和广义高效层聚合网络 (GELAN)。随着神经网络不断加深,它们在前馈过程中往往会遭遇信息丢失。PGI 可确保反向传播期间用于更新权重的梯度准确可靠,使 GELAN 架构能够以更少的参数实现高精度。

不过,YOLOv9 的后处理严重依赖传统的非极大值抑制 (NMS),这在实际推理过程中可能成为延迟瓶颈。

YOLO26 的边缘优先架构#

YOLO26 采用截然不同的方法,对从训练到实时部署的整个流程进行优化。它基于 YOLOv10 首创的端到端无 NMS 设计,彻底消除了 NMS 后处理的需求。因此,它的延迟极低,并针对 Raspberry Pi 或 NVIDIA Jetson 等边缘设备进行了高度优化。

此外,YOLO26 完全移除了分布焦点损失 (DFL)。这一结构性改动简化了模型导出为 ONNX的流程,并显著提升了与低功耗边缘设备的兼容性。

在训练阶段,YOLO26 集成了全新的 MuSGD 优化器,它结合了随机梯度下降和 Muon(灵感来自 Moonshot AI 的 Kimi K2 所采用的大语言模型训练方法)。这一设计将大语言模型 (LLM) 训练创新与计算机视觉连接起来,带来显著更稳定的训练过程和更快的收敛速度。

性能与指标对比#

在广泛使用的 COCO 数据集上进行基准测试时,两种模型都展现出卓越的能力,但 Ultralytics 生态系统在实际推理速度和参数效率方面表现突出。

模型尺寸
(像素)
mAP验证集
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(ms)
参数
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

结果分析#

  • 速度与效率:得益于无 NMS 架构和简化的损失函数,与旧版架构相比,YOLO26 的 CPU 推理速度最高可快 43%。YOLO26n 模型在 NVIDIA T4 GPU 上使用 TensorRT 时仅需 1.7 毫秒,是实时视频流应用的理想选择。
  • 精度:YOLO26x 模型达到无与伦比的 57.5 mAP,超越了最大的 YOLOv9e 模型,同时保持更低的延迟。
  • 内存需求:Ultralytics 模型以高效著称。与复杂的基于 Transformer 的视觉模型相比,YOLO26 在模型训练和推理期间所需的 CUDA 内存显著更少,让开发者能够在消费级硬件上使用更大的批次大小。

生态系统、易用性与灵活性#

Ultralytics 生态系统的真正优势在于用户体验。使用 YOLOv9 GitHub 代码库的研究人员需要处理复杂的环境配置和手动编写脚本,而 YOLO26 已全面集成到直观易用的 Ultralytics Python API 中。

精简的 API 示例#

只需几行 Python 代码,即可训练先进的 YOLO26 模型:

from ultralytics import YOLO

# 加载最新的原生端到端 YOLO26 模型
model = YOLO("yolo26s.pt")

# 训练模型;对于较长的训练任务(>10k 次迭代),optimizer="auto" 会选择 MuSGD
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# 使用一条命令直接导出为 ONNX 格式
model.export(format="onnx")

无与伦比的任务灵活性#

YOLOv9 主要针对标准目标检测任务,而 YOLO26 开箱即用,原生支持种类繁多的计算机视觉任务。该架构针对各种应用进行了专门增强:

  • 实例分割:采用专用的语义分割损失和多尺度原型,实现精确无误的像素级掩码。
  • 姿态估计:集成残差对数似然估计 (RLE),以极高精度跟踪骨骼关键点。
  • 有向边界框 (OBB):采用专门设计的角度损失函数,解决航空影像旋转目标检测中的边界问题。
  • 图像分类:依据 ImageNet 标准,对整张图像进行稳健分类。
集成式生态系统

所有 YOLO26 模型都能与 Ultralytics Platform 无缝集成,使用内置的数据集标注、主动学习和即时部署工作流。

实际应用#

选择哪种模型,通常取决于模型的部署环境。

物联网与边缘机器人#

对于机器人、自主无人机和智能家居物联网设备,YOLO26 无疑是最佳选择。ProgLoss + STAL 的集成显著提升了小目标识别能力,这对高空无人机开展农业监测至关重要。再加上 43% 更快的 CPU 推理速度和无 NMS 设计,YOLO26 无需专用 GPU 即可在硬件上流畅运行。

学术研究与梯度分析#

YOLOv9 在学术界仍备受推崇。研究梯度流理论边界,或希望基于 PGI 概念构建自定义 PyTorch 层的研究人员,会发现 YOLOv9 代码库非常适合作为探索深度学习理论的基础。

高速制造工作流#

在工业环境中,例如高速传送带上的自动化缺陷检测,YOLO26 模型惊人的 TensorRT 速度可确保不丢帧,最大限度提高质量保证系统的吞吐量。

用例与建议#

选择 YOLOv9 还是 YOLO26,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLOv9#

YOLOv9 适用于:

  • 信息瓶颈研究:研究可编程梯度信息 (PGI) 和广义高效层聚合网络 (GELAN) 架构的学术项目。
  • 梯度流优化研究:重点研究如何理解并缓解训练期间深层网络层中的信息损失。
  • 高准确率检测基准测试:需要将 YOLOv9 在 COCO 基准测试中的出色表现作为架构对比参照的场景。

何时选择 YOLO26#

以下场景推荐使用 YOLO26:

  • 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
  • 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
  • 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。

结论#

这两种模型都为开源社区带来了巨大的进步。YOLOv9 在梯度流方面引入了重要的理论改进,其影响将在未来多年持续启发新架构。不过,对于希望在速度、精度和部署便捷性之间取得完美平衡的现代开发者、初创公司和企业团队,Ultralytics YOLO26 无疑是首选。

YOLO26 支持无 NMS 推理,引入了强大的 MuSGD 优化器,并提供涵盖检测、分割和姿态任务的全套工具,确保你的计算机视觉项目能够采用当前最可靠、最具前瞻性的框架。

评论