YOLO Vision 2026:

YOLOv9 与 YOLO26#

实时object detection的格局在过去几年中发生了显著变化。随着机器学习从业者希望在各种硬件上部署模型,选择合适的架构至关重要。在这份全面的技术指南中,我们对比了计算机视觉领域的两个重要里程碑:于2024年初推出、专注于梯度路径优化的YOLOv9,以及于2026年初发布、彻底重新定义边缘推理和训练稳定性的最新最先进框架**Ultralytics YOLO26**。

执行摘要:模型血统与作者#

了解这些深度学习模型的起源,能为理解其架构设计选择和目标受众提供有价值的背景信息。

YOLOv9#

YOLOv9由台湾Academia Sinica信息科学研究所的Chien-Yao Wang和Hong-Yuan Mark Liao撰写,于2024年2月21日发布。该模型高度关注理论深度学习概念,具体解决了深度卷积神经网络(CNN)中的信息瓶颈问题。

了解更多关于 YOLOv9 的信息

Ultralytics YOLO26#

YOLO26由Ultralytics的Glenn Jocher和Jing Qiu撰写,于2026年1月14日发布。在继承YOLO11YOLOv8等前辈巨大成功的基础上,YOLO26从零开始设计,优先考虑生产就绪性、边缘部署和原生端到端效率。

了解更多关于 YOLO26 的信息

立即尝试 YOLO26

准备好升级你的计算机视觉流水线了吗?你可以使用Ultralytics Platform在云端轻松训练和部署YOLO26模型,而无需编写任何代码。

架构创新#

两个模型都为神经网络处理视觉数据的方式带来了突破性的变革,但它们从不同的角度解决了这个问题。

YOLOv9 中的可编程梯度信息#

YOLOv9对该领域的主要贡献是引入了可编程梯度信息(PGI)广义高效层聚合网络(GELAN)。随着神经网络越来越深,它们在正向传播过程中经常遭受信息丢失。PGI确保用于在反向传播期间更新权重的梯度保持准确和可靠,从而使GELAN architecture能够以更少的参数实现高准确率。

然而,YOLOv9 在后处理方面严重依赖传统的非极大值抑制 (NMS),这在实际推理过程中可能会成为延迟瓶颈。

YOLO26 的边缘优先架构#

YOLO26采取了截然不同的方法,优化了从训练到实时部署的整个流水线。它建立在YOLOv10首创的端到端无NMS设计之上,完全消除了对NMS后处理的需求。这带来了令人难以置信的低延迟,使其针对Raspberry PiNVIDIA Jetson等边缘设备进行了高度优化。

此外,YOLO26完全移除了分布焦点损失(DFL)。这一结构性改变简化了模型exporting to ONNX,并提供了与低功耗微控制器显著更好的兼容性。

在训练阶段,YOLO26集成了创新的MuSGD Optimizer,它是Stochastic Gradient Descent和Muon的混合体(灵感来自月之暗面Kimi K2的大语言模型训练方法)。这弥合了大语言模型(LLM)训练创新与计算机视觉之间的鸿沟,提供了更稳定的训练和更快的收敛时间。

性能与指标对比#

在广泛使用的COCO dataset上进行基准测试时,这两个模型都表现出了卓越的功能,但Ultralytics生态系统在实际推理速度和参数效率方面表现耀眼。

模型尺寸
(像素)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
参数量
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

结果分析#

  • 速度与效率: 由于YOLO26采用了无NMS架构和简化的损失函数,与传统架构相比,它拥有最高可达43%更快的CPU推理速度。YOLO26n模型在使用TensorRT的NVIDIA T4 GPU上运行速度极快,达到1.7ms,使其成为实时视频流的终极选择。
  • 精度: YOLO26x 模型实现了无与伦比的 57.5 mAP,在保持更低延迟的同时,超越了最大的 YOLOv9e 模型。
  • **内存需求:**Ultralytics 模型以高效著称。与复杂的基于 Transformer 的视觉模型相比,YOLO26 在模型训练和推理过程中所需的 CUDA 内存显著减少,使开发者能够在消费级硬件上使用更大的批次大小。

生态系统、易用性与多功能性#

Ultralytics生态系统的真正优势在于其用户体验。使用YOLOv9 GitHub codebase的研究人员必须应对复杂的环境设置和手动脚本编写,而YOLO26则完全集成到直观的Ultralytics Python API中。

简化 API 示例#

训练最先进的YOLO26模型只需几行Python code

from ultralytics import YOLO

# Load the latest native end-to-end YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model effortlessly with the default MuSGD optimizer
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export natively to ONNX format in a single command
model.export(format="onnx")

无与伦比的任务多功能性#

与主要针对标准目标检测的YOLOv9不同,YOLO26开箱即生地原生支持大量computer vision tasks。该架构针对各种应用包含了特定的增强功能:

集成生态系统

所有YOLO26模型都受益于与Ultralytics Platform的无缝集成,提供内置的数据集标注、主动学习和即时部署流水线。

实际应用场景#

在这些模型之间进行选择,往往取决于它们将被部署的环境。

物联网与边缘机器人#

对于机器人、自动无人机和智能家居物联网设备,YOLO26是无可争议的冠军ProgLoss + STAL的集成显著改善了小目标识别,这对于高空无人机的agricultural monitoring至关重要。结合其快43%的CPU推理和无NMS设计,YOLO26能够在没有专用GPU的硬件上流畅运行。

学术研究与梯度分析#

YOLOv9在学术界仍然是一个备受尊敬的模型。调查梯度流理论边界的研究人员,或寻求基于PGI概念构建自定义PyTorch层的研究人员,会发现YOLOv9的代码库是探索深度学习理论的绝佳基础。

高速制造流水线#

在高速传送带上的自动化defect detection等工业环境中,YOLO26模型极快的TensorRT速度确保不会丢失任何帧,从而最大化质量保证系统的吞吐量。

应用场景与建议#

在 YOLOv9 和 YOLO26 之间进行选择取决于你的具体项目需求、部署限制和生态系统偏好。

何时选择 YOLOv9#

YOLOv9 是以下场景的有力选择:

  • 信息瓶颈研究: 研究可编程梯度信息 (PGI) 和通用高效层聚合网络 (GELAN) 架构的学术项目。
  • 梯度流优化研究: 专注于理解和减轻训练过程中深度网络层信息丢失的研究。
  • 高精度检测基准测试: 需要将 YOLOv9 强大的 COCO 基准表现作为架构对比参考点的场景。

何时选择 YOLO26#

建议在以下情况下选择 YOLO26:

  • 无 NMS 的边缘部署: 需要一致、低延迟推理且无需复杂非极大值抑制后处理的应用。
  • 仅 CPU 环境: 没有专用 GPU 加速的设备,YOLO26 带来的高达 43% 的 CPU 推理提速可提供决定性优势。
  • 小目标检测: 诸如航拍无人机图像或物联网传感器分析等具有挑战性的场景,其中 ProgLoss 和 STAL 显著提高了微小目标的准确率。

结论#

这两个模型都代表了开源社区令人难以置信的飞跃。YOLOv9 在梯度流方面引入了重要的理论改进,这些改进将在未来几年启发各类架构。然而,对于寻求速度、精度和部署简便性完美平衡的现代开发者、初创公司和企业团队来说,Ultralytics YOLO26 是明确的推荐方案。

通过消除 NMS、引入强大的 MuSGD 优化器,并在检测、分割和姿态任务中提供无与伦比的工具套件,YOLO26 确保了你的计算机视觉项目建立在当今最可靠、面向未来的框架之上。

评论