YOLOv5 与 YOLO11#
为新项目选择合适的计算机视觉架构时,了解先进模型的演进至关重要。从早期架构发展到现代统一框架,展现了算法效率和开发者体验方面的显著飞跃。本指南将对 Ultralytics 开发的两个里程碑式模型进行深入技术比较:开创性的 YOLOv5 和高度完善的 YOLO11。
模型简介#
这两种架构都代表了实时目标检测领域的重要里程碑,并且会根据你的部署环境和遗留系统需求提供不同的优势。
YOLOv5:行业主力模型#
YOLOv5 于 2020 年夏季发布,凭借原生 PyTorch 实现迅速成为行业标准,大幅降低了训练和部署的入门门槛。它不再采用前代模型复杂的 Darknet C 框架,而是提供了更符合 Python 风格的模型构建方式。
- 作者: Glenn Jocher
- 组织: Ultralytics
- 日期: 2020-06-26
- GitHub: ultralytics/yolov5
- 文档: YOLOv5 文档
YOLOv5 为易用性建立了坚实基线,并引入了先进的 Mosaic 数据增强和自动锚定等强大训练方法。对于基于文档完善且经过充分测试的代码库开展研究的研究人员来说,它至今仍极受欢迎。
YOLO11:统一视觉框架#
YOLO11 基于多年的反馈和架构研究开发而成,是统一框架的一部分,能够原生处理多种视觉任务。它不再局限于边界框,而是从零开始设计,以实现最大的通用性和效率。
- 作者: Glenn Jocher 和 Jing Qiu
- 组织: Ultralytics
- 日期: 2024-09-27
- GitHub: ultralytics/ultralytics
- 文档: YOLO11 文档
YOLO11 通过 ultralytics Python 软件包提供简洁流畅的用户体验,并借助简单的 API 统一支持目标检测、实例分割、分类、姿态估计和定向边界框(OBB)。它在速度和精度之间实现了极具优势的平衡,非常适合多样化的实际部署场景。
这两个模型都受益于维护良好的 Ultralytics Platform 生态系统。该集成环境简化了数据集标注、云端训练以及面向各种硬件目标的模型导出。
性能与指标对比#
直接比较这两个模型,可以了解架构改进如何转化为切实的性能提升。下表展示了在 COCO 数据集 上评估的平均精度(mAP),以及 CPU 和 GPU 推理速度与参数量。
| 模型 | 尺寸 (像素) | mAPval 50-95 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (毫秒) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
结果分析#
这些指标清晰地凸显了 YOLO11 在性能平衡方面实现的飞跃。例如,YOLO11n(nano)模型的 mAP 达到 39.5%,而 YOLOv5n 为 28.0%;与此同时,通过 ONNX 导出后,其 CPU 推理时间也有所缩短。此外,与基于大型 Transformer 的模型相比,YOLO11 在训练期间所需的内存显著更少,因此非常适合在消费级硬件和边缘设备上部署。
架构差异#
YOLO11 的性能提升源于多项关键架构演进。YOLOv5 使用了带有 C3 模块的标准 CSPNet 主干网络,而 YOLO11 引入了 C2f 以及后来的 C3k2 等更高效的特征提取模块,从而优化梯度流并降低计算开销。
YOLO11 还采用了经过大幅改进的检测头。新一代 Ultralytics 架构不再采用旧模型的基于锚框的设计,而是转向无锚框方案。这减少了边界框预测数量,简化了后处理流程,并提升了模型在不同尺度和宽高比之间的泛化能力。此外,这些模型还具备更高的训练效率,并提供随时可用的预训练权重,可加速微调数据集的收敛。
实现与代码示例#
Ultralytics 生态系统最突出的特点之一是简洁易用。YOLOv5 普及了使用 torch.hub 进行快速推理的方式,而 YOLO11 则通过统一的 ultralytics Python 软件包更进一步。
使用 YOLO11 进行训练#
加载、训练和验证模型只需极少的样板代码。该 API 可无缝处理超参数调优和模型管理。
from ultralytics import YOLO
# Load a pretrained YOLO11 model
model = YOLO("yolo11s.pt")
# Train on a custom dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run fast inference and display results
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()
# Easily export the model to TensorRT for hardware acceleration
model.export(format="engine")使用 YOLOv5 进行遗留推理#
如果你正在维护较旧的流水线,YOLOv5 可以直接集成 PyTorch 的原生加载机制,因此轻松接入现有推理脚本。
import torch
# Load a custom or pretrained YOLOv5 model from PyTorch Hub
model = torch.hub.load("ultralytics/yolov5", "yolov5s")
# Perform inference on an image URL
results = model("https://ultralytics.com/images/zidane.jpg")
# Print prediction details to the console
results.print()这两个模型都支持丰富的导出格式。无论你的目标是使用 TensorRT 的 NVIDIA Jetson,还是使用 CoreML 的 iOS 应用,部署流程都有完善的文档,并得到社区支持。
理想应用场景#
在这两个模型之间进行选择,主要取决于项目所处的生命周期阶段和具体需求。
何时选择 YOLOv5#
- 维护遗留代码库: 如果你的生产环境高度围绕 YOLOv5 的仓库结构或特定的超参数演化技术进行定制。
- 学术基线: 当你发表的研究需要直接与已建立的 2020—2022 年计算机视觉标准进行基准比较时。
何时选择 YOLO11#
- 多任务项目: 当你的应用需要通过单一统一 API 组合使用姿态估计和实例分割等任务时。
- 边缘部署: 对于边缘计算场景,在给定计算预算(FLOPs)下尽可能提高 mAP 至关重要。
- 商业 AI 解决方案: 适用于零售和安防领域的企业应用,并可利用 Ultralytics Platform 提供的强大支持。
新一代:Ultralytics YOLO26#
虽然 YOLO11 在速度和精度之间实现了出色平衡,但人工智能领域发展迅速。对于如今开始新项目的开发者,我们强烈建议探索视觉 AI 的最新标准:Ultralytics YOLO26。
YOLO26 于 2026 年 1 月发布,引入了专为现代部署需求设计的颠覆性进展:
- 端到端无 NMS 设计: YOLO26 基于 YOLOv10 首创的理念构建,原生支持端到端处理。它无需进行非极大值抑制(NMS)后处理,从而大幅简化部署流水线并降低延迟。
- MuSGD 优化器: 该优化器受到 Moonshot AI 的 Kimi K2 等模型中的 LLM 训练创新启发,是 SGD 与 Muon 的混合方案,可确保极其稳定的训练和显著更快的收敛速度。
- 前所未有的 CPU 速度: 通过移除分布式焦点损失(DFL),YOLO26 实现了最高快 43% 的 CPU 推理速度,使其成为边缘设备和没有专用 GPU 的环境的绝佳选择。
- 先进的损失函数: ProgLoss 和 STAL 的集成显著提升了小目标识别能力,这对于无人机分析、IoT 和机器人技术至关重要。
- 任务专用增强: 它引入了专门的优化方法,例如用于姿态估计的残差对数似然估计(RLE),以及用于定向边界框的专用角度损失,从而确保在所有计算机视觉任务中都具备卓越性能。
如果你对标准目标检测之外的专用架构感兴趣,还可以探索用于基于 Transformer 的检测的 RT-DETR,或用于开放词汇跟踪与检测的 YOLO-World。采用这些维护良好且高度优化的工具,可以确保你的计算机视觉流水线保持高效、可扩展并领先于行业发展。