Ultralytics YOLO27:

YOLOv9 与 YOLO26#

过去几年,实时目标检测领域发展迅速。随着机器学习从业者寻求在各种硬件上部署模型,选择合适的架构至关重要。在这份全面的技术指南中,我们将比较计算机视觉领域的两个重要里程碑:YOLOv9 于 2024 年初推出,重点优化梯度路径;Ultralytics YOLO26 则是于 2026 年初发布的最新先进框架,彻底重新定义了边缘推理和训练稳定性。

执行摘要:模型谱系与作者#

了解这些深度学习模型的起源,有助于深入理解其架构设计选择和目标受众。

YOLOv9#

YOLOv9 由台湾中央研究院信息科学研究所的 Chien-Yao Wang 和 Hong-Yuan Mark Liao 负责开发,于 2024 年 2 月 21 日发布。该模型高度关注深度学习理论,尤其针对深度卷积神经网络 (CNNs) 中的信息瓶颈问题。

了解更多关于 YOLOv9 的信息

Ultralytics YOLO26#

YOLO26 由 Ultralytics 的 Glenn Jocher 和 Jing Qiu 负责开发,于 2026 年 1 月 14 日发布。在 YOLO11YOLOv8 等前代模型取得巨大成功的基础上,YOLO26 从头开始设计,优先考虑生产就绪性、边缘部署和原生端到端效率。

立即试用 YOLO26

准备好升级你的计算机视觉流水线了吗?你可以使用 Ultralytics Platform 在云端轻松训练和部署 YOLO26 模型,无需编写任何代码。

架构创新#

两种模型都对神经网络处理视觉数据的方式进行了突破性改进,但解决问题的角度各不相同。

YOLOv9 的可编程梯度信息#

YOLOv9 对该领域的主要贡献是引入了可编程梯度信息 (PGI)广义高效层聚合网络 (GELAN)。随着神经网络不断加深,它们在前馈过程中经常会遭遇信息丢失。PGI 确保反向传播期间用于更新权重的梯度保持准确可靠,使 GELAN 架构能够以更少的参数实现高精度。

不过,YOLOv9 高度依赖传统的非极大值抑制 (NMS) 进行后处理,这在实际推理过程中可能成为延迟瓶颈。

YOLO26 的边缘优先架构#

YOLO26 采取了截然不同的方法,通过优化从训练到实时部署的完整流水线来提升性能。它基于 YOLOv10 首创的端到端无 NMS 设计,彻底消除了对 NMS 后处理的需求。这带来了极低的延迟,使其针对 Raspberry PiNVIDIA Jetson 等边缘设备进行了高度优化。

此外,YOLO26 完全移除了分布焦点损失 (DFL)。这一结构性变化简化了导出到 ONNX的过程,并显著提升了与低功耗微控制器的兼容性。

在训练阶段,YOLO26 集成了全新的 MuSGD 优化器,它结合了随机梯度下降和 Muon(受 Moonshot AI 的 Kimi K2 大语言模型训练方法启发)。这弥合了大语言模型 (LLM) 训练创新与计算机视觉之间的差距,带来显著更稳定的训练过程和更快的收敛速度。

性能与指标对比#

在广泛使用的 COCO 数据集上进行基准测试时,两种模型都展现出卓越的能力,但 Ultralytics 生态系统在实际推理速度和参数效率方面更具优势。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(毫秒)
速度
T4 TensorRT10
(毫秒)
参数量
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

结果分析#

  • **速度与效率:**由于 YOLO26 采用无 NMS 架构和简化的损失函数,其 CPU 推理速度最高提升 43%,相比传统架构更快。YOLO26n 模型使用 TensorRT 在 NVIDIA T4 GPU 上运行仅需 1.7ms,是实时视频流的终极选择。
  • **精度:**YOLO26x 模型达到了无与伦比的 57.5 mAP,在保持更低延迟的同时超过了最大的 YOLOv9e 模型。
  • **内存需求:**Ultralytics 模型以高效著称。与复杂的基于 Transformer 的视觉模型相比,YOLO26 在模型训练和推理期间所需的 CUDA 内存显著更少,让开发者能够在消费级硬件上使用更大的批量大小。

生态系统、易用性与多功能性#

Ultralytics 生态系统的真正优势在于用户体验。使用 YOLOv9 GitHub 代码库的研究人员必须处理复杂的环境配置和手动脚本编写,而 YOLO26 已完整集成到直观易用的 Ultralytics Python API 中。

简洁的 API 示例#

训练先进的 YOLO26 模型只需几行 Python 代码

from ultralytics import YOLO

# Load the latest native end-to-end YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model effortlessly with the default MuSGD optimizer
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export natively to ONNX format in a single command
model.export(format="onnx")

无与伦比的任务多功能性#

与主要针对标准目标检测的 YOLOv9 不同,YOLO26 原生支持各种计算机视觉任务,开箱即用。该架构针对多种应用进行了专门增强:

  • **实例分割:**采用专用的语义分割损失和多尺度原型,实现像素级的精细掩码。
  • **姿态估计:**集成残差对数似然估计 (RLE),以极高精度追踪骨骼关键点。
  • **有向边界框 (OBB):**包含专用的角度损失函数,旨在解决航空影像中旋转目标检测的边界问题。
  • **图像分类:**基于 ImageNet 标准对完整图像进行稳健分类。
集成生态系统

所有 YOLO26 模型都能无缝集成 Ultralytics Platform,提供内置数据集标注、主动学习和即时部署流水线。

实际应用#

在这些模型之间进行选择,通常取决于它们将要部署的环境。

物联网与边缘机器人#

对于机器人、自动驾驶无人机和智能家居物联网设备,YOLO26 是当之无愧的冠军ProgLoss + STAL 的集成显著提升了小目标识别能力,这对于高空无人机开展农业监测至关重要。结合快 43% 的 CPU 推理速度和无 NMS 设计,YOLO26 可以流畅运行在没有专用 GPU 的硬件上。

学术研究与梯度分析#

YOLOv9 在学术界仍然是备受尊重的模型。研究梯度流理论边界,或希望基于 PGI 概念构建自定义 PyTorch 层的研究人员,会发现 YOLOv9 的代码库是探索深度学习理论的优秀基础。

高速制造流水线#

在工业环境中,例如高速传送带上的自动化缺陷检测,YOLO26 模型极快的 TensorRT 速度可确保不丢失任何帧,从而最大限度提高质量保证系统的吞吐量。

使用场景与建议#

在 YOLOv9 和 YOLO26 之间进行选择,取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLOv9#

YOLOv9 适合以下场景:

  • **信息瓶颈研究:**研究可编程梯度信息 (PGI) 和广义高效层聚合网络 (GELAN) 架构的学术项目。
  • **梯度流优化研究:**专注于理解和缓解深度网络层在训练期间信息丢失问题的研究。
  • **高精度检测基准测试:**需要将 YOLOv9 出色的 COCO 基准性能作为架构对比参考的场景。

何时选择 YOLO26#

推荐使用 YOLO26 的场景:

  • 无 NMS 边缘部署: 适用于需要稳定、低延迟推理,同时又不希望引入非极大值抑制后处理复杂性的应用。
  • 仅使用 CPU 的环境: 适用于没有专用 GPU 加速的设备,此时 YOLO26 最高提升 43% 的 CPU 推理速度将带来决定性优势。
  • 小目标检测: 适用于航空无人机影像或 IoT 传感器分析等具有挑战性的场景,在这些场景中,ProgLoss 和 STAL 能显著提升微小目标的准确率。

结论#

两种模型都代表了开源社区的巨大进步。YOLOv9 对梯度流进行了重要的理论改进,这些改进将在未来多年启发新的架构。不过,对于寻求速度、精度和部署便捷性之间完美平衡的现代开发者、初创企业和企业团队而言,Ultralytics YOLO26 是明确的推荐选择。

通过消除 NMS、引入强大的 MuSGD 优化器,并在检测、分割和姿态任务方面提供无与伦比的工具套件,YOLO26 确保你的计算机视觉项目建立在当今最可靠、面向未来的框架之上。

评论