YOLO26 与 YOLOv5#
计算机视觉的发展历程一直伴随着对速度、准确性和可访问性的不懈追求。选择正确的架构对于任何AI项目的成功都至关重要。在这篇综合指南中,我们对比了来自Ultralytics的两个划时代版本:开创性的YOLOv5和突破性的YOLO26。虽然这两者都深刻影响了实时object detection的格局,但其底层技术反映了神经网络处理视觉数据方式的巨大范式转变。
模型概览#
在深入探讨架构细节之前,让我们先了解这两个模型的基础信息。
YOLO26 详细信息:
- 作者:Glenn Jocher 和 Jing Qiu
- 组织:Ultralytics
- 日期:2026-01-14
- GitHub: https://github.com/ultralytics/ultralytics
- 文档:YOLO26 Documentation
YOLOv5 详细信息:
- 作者:Glenn Jocher
- 组织:Ultralytics
- 日期:2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- 文档:YOLOv5 Documentation
架构创新#
YOLOv5和YOLO26之间六年的时间差代表了深度学习研究的巨大飞跃。YOLOv5普及了PyTorch在视觉模型中的广泛应用,提供了一个高度优化、基于锚框的检测机制,并成为了行业标准。然而,它在后处理期间严重依赖Non-Maximum Suppression (NMS),这可能会在资源受限的设备上引入延迟瓶颈。
YOLO26通过端到端无NMS设计完全重新构想了推理管道。通过消除NMS后处理的需求,YOLO26带来了更快、更简单的部署逻辑——这一概念最早在YOLOv10中开创并在本版中得到完善。此外,YOLO26具有DFL移除(Distribution Focal Loss)功能,极大地简化了输出头。这使得将模型导出为ONNX和TensorRT等格式变得无比顺畅,确保了与边缘设备和低功耗设备的极佳兼容性。
在训练过程中,YOLO26采用了尖端的MuSGD Optimizer,这是一个受Moonshot AI's Kimi K2启发的SGD与Muon的混合体。这为计算机视觉领域带来了大语言模型训练创新,与YOLOv5中使用的传统SGD或AdamW优化器相比,保证了高度稳定的训练和显著更快的收敛速度。
性能与指标#
在评估模型时,mean Average Precision (mAP)与推理速度之间的平衡决定了实际应用的可行性。YOLO26针对高端GPU和边缘CPU都进行了原生优化。
| 模型 | 尺寸 (像素) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
基准测试显示了惊人的提升。例如,YOLO26n实现了40.9的mAP,而YOLOv5n为28.0,同时还提供了高达43%更快的CPU推理。这使得YOLO26在Raspberry Pi或移动设备等嵌入式部署中具有无可比拟的优势。虽然YOLOv5在Nano规模的TensorRT GPU速度上略占优势,但准确率的权衡使得YOLO26明显更具吸引力。
训练生态系统与易用性#
这两个模型都极大受益于维护完善的 Ultralytics 生态系统。它们通过精简的 Python API、详尽的文档和活跃的社区支持,提供了从零到一的上手体验。不过,YOLO26 将训练效率提升到了新的高度。
与重度依赖Transformer的替代方案相比,Ultralytics模型在训练期间始终需要显著更低的CUDA memory。YOLO26通过其ProgLoss + STAL损失函数进一步强化了这一点。这些进展在不增加内存开销的情况下,显著提升了小物体识别能力。
from ultralytics import YOLO
# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model with the MuSGD optimizer (default for YOLO26)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# Run fast, NMS-free inference on a test image
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()这个简单的脚本允许开发者在custom datasets上快速迭代,无缝地从数据输入过渡到生产就绪的模型。
使用Ultralytics Platform,你可以自动将训练好的YOLO26模型导出为CoreML或TensorFlow Lite等格式,而无需编写任何一行转换代码。
通用性与理想用例#
何时使用 YOLOv5#
对于遗留系统,YOLOv5仍然是一个可靠的主力。如果你有一个与基于锚框的输出深度耦合的现有工业管道,或者你正在运行带有成熟、冻结的TensorRT堆栈的较旧NVIDIA Jetson设备上的推理,YOLOv5提供了一个稳定且文档齐全的解决方案。
何时使用 YOLO26#
YOLO26是现代计算机视觉项目的绝对首选。其多功能性远超其前代产品。虽然YOLOv5主要侧重于检测(后来增加了分割功能),但YOLO26对Instance Segmentation、Pose Estimation、Image Classification和Oriented Bounding Boxes (OBB)提供了深度、原生的支持。
YOLO26 引入了 特定任务改进,例如专门的语义分割损失、用于超高精度姿态关键点的残差对数似然估计 (RLE),以及用于解决复杂边界问题的 OBB 高级角度损失。
- 边缘 IoT 和机器人: 无 NMS 架构和快 43% 的 CPU 推理速度使得 YOLO26 成为实时机器人导航和智能家居摄像头的理想之选。
- 航拍影像: ProgLoss + STAL 的增强功能使得从无人机检测微小物体(如停车场中的车辆或农田中的作物)变得更加可靠。
- 实时视频分析: 无论是追踪体育广播中的运动员还是监控交通流量,YOLO26 的性能平衡确保了高召回率且不会掉帧。
归根结底,Ultralytics 对可访问、高性能生态系统的承诺确保了从 YOLOv5 到 YOLO26 的过渡是无缝的,为研究人员和开发者解锁了顶尖的技术能力。