YOLOv9 vs YOLOv7#
实时object detection的演进一直由不断追求计算效率与高准确度平衡的驱动。这一历程中的两个里程碑式架构是 YOLOv9 和 YOLOv7,两者均由中国台湾“中央研究院”资讯科学研究所的研究人员开发。YOLOv7 引入了革命性的可训练免费赠品包(bag-of-freebies),而更新的 YOLOv9 则直接迎击深度学习的信息瓶颈问题。
本全面的技术比较探讨了两款模型的架构差异、performance metrics以及理想的部署场景,帮助 ML 工程师和研究人员为其计算机视觉流水线选择合适的工具。
性能与指标对比#
在比较这些模型时,原始性能和效率是关键因素。下表详细列出了标准COCO数据集基准测试中的平均精度均值(mAP)和计算需求。
| 模型 | 尺寸 (像素) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
请注意,YOLOv9c 在使用显著更少参数(25.3M 对比 71.3M)和 FLOPs 的同时,实现了与 YOLOv7x(53.1 mAP)大致相同的准确度(53.0 mAP)。这展示了现代架构中Performance Balance的改进。
YOLOv9:解决信息瓶颈#
YOLOv9于2024年初推出,从根本上改变了深度神经网络在各层中保留数据的方式。
- 作者: Chien-Yao Wang 和 Hong-Yuan Mark Liao
- 机构:Institute of Information Science, Academia Sinica
- 日期: 2024 年 2 月 21 日
- 资源: Arxiv Paper | GitHub Repository
架构创新#
YOLOv9引入了广义高效层聚合网络(GELAN)和可编程梯度信息(PGI)。GELAN结合了CSPNet和ELAN的优势,以优化参数效率和计算成本,确保在较低参数量下实现高精度。PGI是一个辅助监督框架,旨在防止深度网络中的数据丢失,为训练过程中更新权重生成可靠的梯度。
优势与局限性#
YOLOv9 的核心优势在于它能够在没有巨大计算开销的情况下提取细微特征,这使其对于需要高特征保真度的任务(如medical image analysis)具备极强的能力。然而,相比于更统一的框架,训练期间复杂的 PGI 结构可能会使初学者在进行自定义架构修改时更具挑战性。
YOLOv7:“免费赠品包”的先驱#
YOLOv7 于 2022 年发布,为消费级硬件上的可能性设定了新的基准,其引入的结构创新显著提升了real-time inference速度。
- 作者: Chien-Yao Wang, Alexey Bochkovskiy 和 Hong-Yuan Mark Liao
- 机构:Institute of Information Science, Academia Sinica
- 日期: 2022年7月6日
- 资源: Arxiv Paper | GitHub Repository
架构创新#
YOLOv7的核心贡献是扩展高效层聚合网络(E-ELAN)。该架构使模型能够持续学习更多样化的特征。此外,YOLOv7采用了“可训练的免费赠品包”——即诸如规划重参数化卷积和动态标签分配等技术。这些方法提高了模型在训练过程中的准确性,而不会增加部署时的推理成本。
优势与局限性#
YOLOv7 针对实时边缘处理进行了高度优化,至今仍是传统系统和旧版CUDA environments中的中坚力量。它如今的主要局限在于,与更新的模型相比,其参数规模较大。正如性能表中所示,要获得顶级准确度,需要使用庞大的 YOLOv7x 模型,这比同等的现代架构需要占用大得多的GPU memory。
Ultralytics的优势:精简部署#
尽管 YOLOv9 和 YOLOv7 的原始研究代码库提供了极佳的学术基础,但在生产环境中部署这些模型可能会很复杂。通过 ultralytics 包将它们集成可以提供无与伦比的易用性。
通过利用集成的Ultralytics Platform,开发者可以受益于维护良好的生态系统,该系统具有直观的 Python API、活跃的社区支持以及强大的experiment tracking。
用YOLO26面向未来#
如果你正在启动一个新的计算机视觉项目,我们强烈建议你选择新发布的**YOLO26**,而不是 YOLOv9 和 YOLOv7。作为新的最先进标准发布,YOLO26 带来了突破性的进展:
- 端到端无需NMS的设计: 消除了非极大值抑制(Non-Maximum Suppression)后处理,极大地降低了部署复杂度和延迟。
- CPU 推理速度提升高达 43%: 针对edge computing环境进行了优化,确保你的应用程序即使在没有专用 GPU 的情况下也能流畅运行。
- MuSGD优化器: 一种受大语言模型训练启发的混合优化器,可提供高度稳定的收敛并减少训练时间。
- 移除DFL: 通过移除分布焦点损失(Distribution Focal Loss)简化了模型导出,增强了与低功耗移动设备的兼容性。
- ProgLoss + STAL: 大幅提升小目标检测的性能,使其成为aerial imagery和监控的首选。
生态系统内的其他热门替代方案包括 Ultralytics YOLOv8 和 YOLO11,两者在instance segmentation和pose estimation等任务中都具备强大的多功能性。
实现示例#
使用统一的API进行训练和导出这些架构都非常简单。以下代码展示了Ultralytics工具特有的精简训练效率。
from ultralytics import YOLO
# Initialize YOLOv9 or the recommended YOLO26 model
model = YOLO("yolov9c.pt") # Swap with "yolo26n.pt" for faster edge performance
# Train on a custom dataset with built-in data augmentation
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# Export the trained model to ONNX format for deployment
model.export(format="onnx")在消费级硬件上进行训练时,内存效率至关重要。Ultralytics对YOLOv9和YOLO26的实现经过深度优化,减少了VRAM峰值,这与通常在训练过程中会出现严重内存膨胀的基于Transformer的模型(如RT-DETR)不同。
现实应用与理想用例#
在这些架构之间进行选择,往往取决于你生产环境的具体约束。
何时使用 YOLOv9: YOLOv9 在需要保留微小细节的环境中表现出色。其强大的特征提取能力使其非常适合用于retail analytics以清点货架上密集的商品,或用于农业应用中识别小叶片上的早期作物病害至关重要的场景。
何时使用 YOLOv7: YOLOv7 仍然是传统部署流水线的强有力候选者。如果你要集成到较旧的硬件系统(例如某些代次的Google Coral Edge TPU),相比于更新模型更复杂的梯度分支,YOLOv7 简单的 CNN 架构可能更容易编译。
何时使用 YOLO26(推荐): 对于任何现代部署——从自主无人机到智慧城市traffic management——YOLO26 都是更优的选择。其无 NMS 架构保证了确定性的推理时间,这对于安全关键型机器人技术至关重要,同时其高精度在各方面都超越了 YOLOv9 和 YOLOv7。