YOLO26 与 YOLOv5#
计算机视觉的发展一直由对速度、准确性和可访问性的不懈追求所推动。选择合适的架构对任何 AI 项目的成功都至关重要。在本综合指南中,我们将比较 Ultralytics 的两个里程碑式版本:开创性的 YOLOv5 和突破性的 YOLO26。虽然两者都对实时目标检测领域产生了深远影响,但其底层技术反映了神经网络处理视觉数据方式的巨大范式转变。
模型概览#
在深入了解架构细节之前,我们先介绍这两个模型的基础信息。
YOLO26 详情:
- 作者: Glenn Jocher 和 Jing Qiu
- 组织: Ultralytics
- 日期: 2026-01-14
- GitHub: https://github.com/ultralytics/ultralytics
- 文档: YOLO26 文档
YOLOv5 详细信息:
- 作者: Glenn Jocher
- 组织: Ultralytics
- 日期: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- 文档: YOLOv5 文档
架构创新#
YOLOv5 与 YOLO26 之间六年的间隔代表了深度学习研究的一次巨大飞跃。YOLOv5 推动了 PyTorch 在视觉模型中的广泛应用,提供了一种高度优化的基于锚框的检测机制,并最终成为行业标准。然而,它在后处理阶段高度依赖非极大值抑制(NMS),这可能会在资源受限的设备上造成延迟瓶颈。
YOLO26 通过端到端无 NMS 设计彻底重新构想了推理流程。通过消除 NMS 后处理的需求,YOLO26 实现了更快、更简单的部署逻辑。这一理念最早由 YOLOv10 开创,并在此处得到完善。此外,YOLO26 还采用了移除 DFL(分布焦点损失),大幅简化了输出头。这使得将模型导出为 ONNX 和 TensorRT 等格式变得十分顺畅,从而确保与边缘设备和低功耗设备的良好兼容性。
在训练过程中,YOLO26 采用先进的 MuSGD 优化器,它是 SGD 和 Muon 的混合优化器,灵感来自 Moonshot AI 的 Kimi K2。这将 LLM 训练创新引入了计算机视觉领域,与 YOLOv5 使用的传统 SGD 或 AdamW 优化器相比,可实现高度稳定的训练和显著更快的收敛。
性能与指标#
评估模型时,平均精度均值(mAP)与推理速度之间的平衡决定了模型在实际应用中的可行性。YOLO26 原生针对高端 GPU 和边缘 CPU 进行了优化。
| 模型 | 尺寸 (像素) | mAPval 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (毫秒) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
基准测试显示性能有惊人的提升。例如,YOLO26n 的 mAP 达到 40.9,而 YOLOv5n 的 mAP 为 28.0,同时还提供最高 43% 的 CPU 推理速度提升。这使 YOLO26 在 Raspberry Pi 或移动设备等嵌入式部署场景中具有明显优势。虽然 YOLOv5 在 Nano 级别的 TensorRT GPU 速度上略占优势,但准确性方面的权衡明显偏向 YOLO26。
训练生态系统与易用性#
两个模型都从维护良好的 Ultralytics 生态系统中获益匪浅。它们通过简洁的 Python API、丰富的文档和活跃的社区支持,提供了从“零基础到高手”的使用体验。不过,YOLO26 将训练效率提升到了新的水平。
与高度依赖 Transformer 的替代方案相比,Ultralytics 模型在训练期间始终需要显著更少的 CUDA 内存。YOLO26 通过其 ProgLoss + STAL 损失函数进一步放大了这一优势。这些改进显著提升了小目标识别能力,同时不会增加过多的内存开销。
from ultralytics import YOLO
# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model with the MuSGD optimizer (default for YOLO26)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# Run fast, NMS-free inference on a test image
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()此简单脚本让开发者能够快速迭代自定义数据集,无缝完成从数据读取到可用于生产环境的模型构建。
使用 Ultralytics Platform,你无需编写任何转换代码,就能自动将训练好的 YOLO26 模型导出为 CoreML 或 TensorFlow Lite 等格式。
多功能性与理想应用场景#
何时使用 YOLOv5#
YOLOv5 仍然是旧版系统中可靠的主力模型。如果你已有一个与基于锚框的输出高度耦合的工业流水线,或者正在配备成熟、固定不变的 TensorRT 软件栈的旧款 NVIDIA Jetson 设备上运行推理,YOLOv5 能提供稳定且文档完善的解决方案。
何时使用 YOLO26#
YOLO26 是现代计算机视觉项目的明确首选。它的多功能性远超前代模型。YOLOv5 主要专注于检测(后续版本增加了分割功能),而 YOLO26 则原生深度支持实例分割、姿态估计、图像分类和定向边界框(OBB)。
YOLO26 引入了任务特定改进,包括专用的语义分割损失、用于实现超高精度姿态关键点的残差对数似然估计(RLE),以及用于 OBB 的高级角度损失,以解决棘手的边界问题。
- **边缘 IoT 与机器人:**无 NMS 架构和快 43% 的 CPU 推理速度使 YOLO26 非常适合实时机器人导航和智能家居摄像头。
- **航空影像:**ProgLoss + STAL 改进显著提升了从无人机影像中检测微小目标的可靠性,例如停车场中的车辆或农田中的作物。
- **实时视频分析:**无论是跟踪体育转播中的运动员,还是监测交通流量,YOLO26 的性能平衡都能确保较高的召回率,同时避免丢帧。
最终,Ultralytics 致力于打造易于使用且高性能的生态系统,确保从 YOLOv5 平稳过渡到 YOLO26,为研究人员和开发者解锁最先进的能力。