YOLO26 与 YOLOv5 对比#
计算机视觉的发展始终围绕着对速度、准确率和易用性的不懈追求。选择合适的架构对任何 AI 项目的成功都至关重要。在这份全面指南中,我们将比较 Ultralytics 的两款重要产品:开创性的 YOLOv5 和突破性的 YOLO26。两者都对实时目标检测领域产生了深远影响,但底层技术体现了神经网络处理视觉数据方式的巨大转变。
模型概述#
在深入探讨架构细节之前,我们先来了解这两个模型的基础信息。
YOLO26 详情:
- 作者: Glenn Jocher 和 Jing Qiu
- 组织: Ultralytics
- 日期: 2026-01-14
- GitHub: https://github.com/ultralytics/ultralytics
- 文档:YOLO26 文档
YOLOv5 详情:
- 作者: Glenn Jocher
- 组织: Ultralytics
- 日期: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- 文档: YOLOv5 文档
架构创新#
YOLOv5 和 YOLO26 相隔六年,代表着深度学习研究取得了巨大的飞跃。YOLOv5 推动了 PyTorch 在视觉模型中的广泛应用,并提供了高度优化的基于锚框的检测机制,后来成为行业标准。不过,YOLOv5 在后处理中严重依赖 非极大值抑制 (NMS),这可能会在资源受限设备上造成延迟瓶颈。
YOLO26 通过端到端无 NMS 设计彻底重构了推理流程。其可选的一对一检测头(nms=False)无需进行 NMS 后处理,从而让部署逻辑更快、更简单。这一理念最初由 YOLOv10 开创,并在 YOLO26 中得到完善。此外,YOLO26 还采用了移除 DFL(分布焦点损失)设计,大幅简化了输出头。这使模型能够轻松导出为 ONNX 和 TensorRT 等格式,确保与边缘设备和低功耗设备出色兼容。
训练期间,YOLO26 使用先进的 MuSGD 优化器,这是一种受 Moonshot AI 的 Kimi K2 启发、结合 SGD 和 Muon 的混合优化器。它将 LLM 训练创新引入计算机视觉领域,与 YOLOv5 使用的传统 SGD 或 AdamW 优化器相比,可确保训练更加稳定、收敛速度显著更快。
性能与指标#
评估模型时,平均精度均值 (mAP) 与推理速度之间的平衡决定了模型在实际应用中的可行性。YOLO26 针对高端 GPU 和边缘 CPU 都进行了原生优化。
| 模型 | 尺寸 (像素) | mAP验证集 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (ms) | 参数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
基准测试显示,性能提升幅度惊人。例如,YOLO26n 的 mAP 达到 40.9,而 YOLOv5n 为 28.0;此外,YOLO26 的 CPU 推理速度最高比 YOLO11n 快 43%。因此,YOLO26 在 Raspberry Pi 或移动设备等嵌入式部署场景中具有显著优势。虽然在 Nano 级别上,YOLOv5 的 TensorRT GPU 速度略胜一筹,但综合准确率表现,YOLO26 更具优势。
训练生态与易用性#
这两个模型都受益于维护良好的 Ultralytics 生态。它们提供从入门到精通的流畅体验,包含简洁的 Python API、详尽的文档和活跃的社区支持。不过,YOLO26 将训练效率提升到了新的水平。
与以 Transformer 为主的替代方案相比,Ultralytics 模型在训练期间所需的 CUDA 显存始终显著更少。YOLO26 通过 ProgLoss + STAL 损失函数进一步强化了这一优势。这些改进显著提升了小目标识别能力,同时不会增加显存开销。
from ultralytics import YOLO
# 初始化先进的 YOLO26 Nano 模型
model = YOLO("yolo26n.pt")
# 训练模型(optimizer='auto' 会在较长的训练过程中选择 MuSGD)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# 在测试图像上执行快速的无 NMS 推理
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
predictions[0].show()这段简单的脚本让开发者能够快速迭代自定义数据集,从数据导入无缝过渡到可用于生产环境的模型。
使用 Ultralytics Platform,无需编写任何转换代码,即可自动将训练好的 YOLO26 模型导出为 CoreML 或 LiteRT 等格式。
通用性与理想应用场景#
何时使用 YOLOv5#
对于旧系统,YOLOv5 仍然是可靠的主力选择。如果你已有与基于锚框输出紧密耦合的工业流水线,或者正在较旧的 NVIDIA Jetson 设备上使用成熟且固定的 TensorRT 技术栈,YOLOv5 能提供稳定且文档完善的解决方案。
何时使用 YOLO26#
对于现代计算机视觉项目,YOLO26 无疑是首选。它的通用性远胜前代。YOLOv5 主要专注于检测(后续版本才增加了分割功能),而 YOLO26 则原生深度支持实例分割、姿态估计、图像分类和有向边界框 (OBB)。
YOLO26 引入了任务特定改进,例如专用的语义分割损失、用于实现超高精度姿态关键点检测的残差对数似然估计 (RLE),以及用于解决 OBB 棘手边界问题的高级角度损失。
- 边缘 IoT 与机器人:可选的无 NMS 推理和比 YOLO11n 快 43% 的 CPU 推理速度,使 YOLO26 非常适合实时机器人导航和智能家居摄像头。
- 航空影像:ProgLoss + STAL 的改进显著提升了无人机对微小目标的检测可靠性,例如停车场中的车辆或农田中的作物。
- 实时视频分析:无论是跟踪体育转播中的运动员,还是监控交通流量,YOLO26 的性能平衡都能确保高召回率且不丢帧。
总之,Ultralytics 致力于打造易于使用且高性能的生态系统,确保从 YOLOv5 迁移到 YOLO26 的过程顺畅无阻,为研究人员和开发者解锁先进技术能力。