YOLOv9 与 YOLO26#
过去几年,实时目标检测领域发生了显著变化。随着机器学习从业者尝试在各种硬件上部署模型,选择合适的架构至关重要。本技术指南将对比计算机视觉领域的两个重要里程碑:YOLOv9 于 2024 年初推出,重点优化梯度路径;而 Ultralytics YOLO26 是 2026 年初发布的最新先进框架,彻底重新定义了边缘推理和训练稳定性。
摘要:模型沿革与作者#
了解这些深度学习模型的起源,有助于理解其架构设计选择和目标受众。
YOLOv9#
YOLOv9 由台湾 Academia Sinica 信息科学研究所的 Chien-Yao Wang 和 Hong-Yuan Mark Liao 编写,于 2024 年 2 月 21 日发布。该模型重点关注深度学习理论概念,尤其针对深度卷积神经网络 (CNN) 中的信息瓶颈问题。
Ultralytics YOLO26#
YOLO26 由 Ultralytics 的 Glenn Jocher 和 Jing Qiu 编写,于 2026 年 1 月 14 日发布。在 YOLO11 和 YOLOv8 等前代模型大获成功的基础上,YOLO26 从头开始设计,优先考虑生产就绪性、边缘部署和原生端到端效率。
准备好升级你的计算机视觉工作流了吗?使用 Ultralytics Platform,你无需编写代码,就能轻松在云端训练和部署 YOLO26 模型。
架构创新#
这两种模型都对神经网络处理视觉数据的方式进行了突破性改进,但解决问题的角度各不相同。
YOLOv9 中的可编程梯度信息#
YOLOv9 对该领域的主要贡献是引入了可编程梯度信息 (PGI) 和广义高效层聚合网络 (GELAN)。随着神经网络不断加深,它们在前馈过程中往往会遭遇信息丢失。PGI 可确保反向传播期间用于更新权重的梯度准确可靠,使 GELAN 架构能够以更少的参数实现高精度。
不过,YOLOv9 的后处理严重依赖传统的非极大值抑制 (NMS),这在实际推理过程中可能成为延迟瓶颈。
YOLO26 的边缘优先架构#
YOLO26 采用截然不同的方法,对从训练到实时部署的整个流程进行优化。它基于 YOLOv10 首创的端到端无 NMS 设计,彻底消除了 NMS 后处理的需求。因此,它的延迟极低,并针对 Raspberry Pi 或 NVIDIA Jetson 等边缘设备进行了高度优化。
此外,YOLO26 完全移除了分布焦点损失 (DFL)。这一结构性改动简化了模型导出为 ONNX的流程,并显著提升了与低功耗边缘设备的兼容性。
在训练阶段,YOLO26 集成了全新的 MuSGD 优化器,它结合了随机梯度下降和 Muon(灵感来自 Moonshot AI 的 Kimi K2 所采用的大语言模型训练方法)。这一设计将大语言模型 (LLM) 训练创新与计算机视觉连接起来,带来显著更稳定的训练过程和更快的收敛速度。
性能与指标对比#
在广泛使用的 COCO 数据集上进行基准测试时,两种模型都展现出卓越的能力,但 Ultralytics 生态系统在实际推理速度和参数效率方面表现突出。
| 模型 | 尺寸 (像素) | mAP验证集 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (ms) | 参数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
结果分析#
- 速度与效率:得益于无 NMS 架构和简化的损失函数,与旧版架构相比,YOLO26 的 CPU 推理速度最高可快 43%。YOLO26n 模型在 NVIDIA T4 GPU 上使用 TensorRT 时仅需 1.7 毫秒,是实时视频流应用的理想选择。
- 精度:YOLO26x 模型达到无与伦比的 57.5 mAP,超越了最大的 YOLOv9e 模型,同时保持更低的延迟。
- 内存需求:Ultralytics 模型以高效著称。与复杂的基于 Transformer 的视觉模型相比,YOLO26 在模型训练和推理期间所需的 CUDA 内存显著更少,让开发者能够在消费级硬件上使用更大的批次大小。
生态系统、易用性与灵活性#
Ultralytics 生态系统的真正优势在于用户体验。使用 YOLOv9 GitHub 代码库的研究人员需要处理复杂的环境配置和手动编写脚本,而 YOLO26 已全面集成到直观易用的 Ultralytics Python API 中。
精简的 API 示例#
只需几行 Python 代码,即可训练先进的 YOLO26 模型:
from ultralytics import YOLO
# 加载最新的原生端到端 YOLO26 模型
model = YOLO("yolo26s.pt")
# 训练模型;对于较长的训练任务(>10k 次迭代),optimizer="auto" 会选择 MuSGD
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 使用一条命令直接导出为 ONNX 格式
model.export(format="onnx")无与伦比的任务灵活性#
YOLOv9 主要针对标准目标检测任务,而 YOLO26 开箱即用,原生支持种类繁多的计算机视觉任务。该架构针对各种应用进行了专门增强:
- 实例分割:采用专用的语义分割损失和多尺度原型,实现精确无误的像素级掩码。
- 姿态估计:集成残差对数似然估计 (RLE),以极高精度跟踪骨骼关键点。
- 有向边界框 (OBB):采用专门设计的角度损失函数,解决航空影像旋转目标检测中的边界问题。
- 图像分类:依据 ImageNet 标准,对整张图像进行稳健分类。
所有 YOLO26 模型都能与 Ultralytics Platform 无缝集成,使用内置的数据集标注、主动学习和即时部署工作流。
实际应用#
选择哪种模型,通常取决于模型的部署环境。
物联网与边缘机器人#
对于机器人、自主无人机和智能家居物联网设备,YOLO26 无疑是最佳选择。ProgLoss + STAL 的集成显著提升了小目标识别能力,这对高空无人机开展农业监测至关重要。再加上 43% 更快的 CPU 推理速度和无 NMS 设计,YOLO26 无需专用 GPU 即可在硬件上流畅运行。
学术研究与梯度分析#
YOLOv9 在学术界仍备受推崇。研究梯度流理论边界,或希望基于 PGI 概念构建自定义 PyTorch 层的研究人员,会发现 YOLOv9 代码库非常适合作为探索深度学习理论的基础。
高速制造工作流#
在工业环境中,例如高速传送带上的自动化缺陷检测,YOLO26 模型惊人的 TensorRT 速度可确保不丢帧,最大限度提高质量保证系统的吞吐量。
用例与建议#
选择 YOLOv9 还是 YOLO26,取决于你的具体项目需求、部署限制和生态系统偏好。
何时选择 YOLOv9#
YOLOv9 适用于:
- 信息瓶颈研究:研究可编程梯度信息 (PGI) 和广义高效层聚合网络 (GELAN) 架构的学术项目。
- 梯度流优化研究:重点研究如何理解并缓解训练期间深层网络层中的信息损失。
- 高准确率检测基准测试:需要将 YOLOv9 在 COCO 基准测试中的出色表现作为架构对比参照的场景。
何时选择 YOLO26#
以下场景推荐使用 YOLO26:
- 无 NMS 的边缘部署:适用于要求推理延迟稳定且较低,同时不希望增加非极大值抑制后处理复杂度的应用。
- 仅使用 CPU 的环境:适用于没有专用 GPU 加速的设备,此时 YOLO26 的 CPU 推理速度最高提升 43%,可带来显著优势。
- 小目标检测:适用于无人机航拍影像等具有挑战性的场景,或 IoT 传感器分析等需要 ProgLoss 和 STAL 大幅提升微小目标准确率的场景。
结论#
这两种模型都为开源社区带来了巨大的进步。YOLOv9 在梯度流方面引入了重要的理论改进,其影响将在未来多年持续启发新架构。不过,对于希望在速度、精度和部署便捷性之间取得完美平衡的现代开发者、初创公司和企业团队,Ultralytics YOLO26 无疑是首选。
YOLO26 支持无 NMS 推理,引入了强大的 MuSGD 优化器,并提供涵盖检测、分割和姿态任务的全套工具,确保你的计算机视觉项目能够采用当前最可靠、最具前瞻性的框架。