YOLO Vision 2026:

YOLOv5 против YOLOv9#

За последние несколько лет ландшафт компьютерного зрения и обнаружения объектов в реальном времени претерпел значительные изменения. Выбор между проверенными временем моделями и новыми архитектурами — частая задача для инженеров по машинному обучению. Это руководство предлагает комплексное техническое сравнение двух крайне влиятельных моделей семейства YOLO: YOLOv5 и YOLOv9.

Развертываешь ли ты модели на ограниченных периферийных устройствах, исследуешь ли высококачественное извлечение признаков или создаешь сложные конвейеры обнаружения объектов, понимание архитектурных нюансов, показателей производительности и различий в экосистемах этих моделей имеет решающее значение.

Обзор моделей#

Прежде чем погрузиться в архитектурные сравнения, полезно понять происхождение и основные цели каждой модели.

Ultralytics YOLOv5#

Разработанный Гленном Джохером (Glenn Jocher) и выпущенный Ultralytics 26 июня 2020 года, YOLOv5 ознаменовал смену парадигмы в том, как разработчики взаимодействуют с моделями компьютерного зрения. Полностью приняв фреймворк PyTorch, YOLOv5 променял сложные шаги компиляции более ранних моделей на базе Darknet на интуитивно понятный пользовательский интерфейс с акцентом на Python.

YOLOv5 славится своей простотой использования (Ease of Use) и стабильной производительностью в различных аппаратных средах. Она поддерживает не только обнаружение, но и классификацию изображений, а также сегментацию экземпляров.

Узнай больше о YOLOv5

YOLOv9#

Модель YOLOv9, представленная Чien-Yao Wang и Hong-Yuan Mark Liao из Института информатики Academia Sinica (Тайвань), делает упор на архитектурную теорию для устранения проблем «узкого места» (bottleneck) в передаче информации внутри глубоких нейронных сетей.

В основе YOLOv9 лежат две важные теоретические инновации: Programmable Gradient Information (PGI) и Generalized Efficient Layer Aggregation Network (GELAN). Эти концепции помогают модели сохранять критически важные пространственные признаки при прохождении через глубокие слои сети.

Узнай больше о YOLOv9

Подготовь свои развертывания к будущему

Хотя YOLOv5 и YOLOv9 очень мощные, недавно выпущенный YOLO26 представляет собой идеальный баланс скорости и точности. Благодаря сквозному дизайну без NMS (end-to-end NMS-free) и ускорению вывода на CPU до 43%, YOLOv9 настоятельно рекомендуется для современного периферийного вычисления и производственных развертываний.

Архитектурные и технические различия#

Понимание того, что лежит в основе этих моделей компьютерного зрения, жизненно важно для оптимизации стратегий развертывания моделей.

Извлечение признаков и сохранение информации#

YOLOv5 использует магистральную сеть Cross Stage Partial Network (CSPNet), которая эффективно снижает вычислительные накладные расходы, сохраняя при этом точный поток градиентов во время обратного распространения. Этот дизайн сильно оптимизирован для традиционных операций GPU и обеспечивает меньшие требования к памяти во время обучения по сравнению с тяжелыми альтернативами на базе Transformer.

YOLOv9 представляет GELAN, универсальную архитектуру, расширяющую принципы CSPNet. В сочетании с PGI — вспомогательной обратимой ветвью — YOLOv9 гарантирует, что глубокие слои не теряют семантические данные, необходимые для точных целевых функций. Это позволяет YOLOv9 достигать высокой точности, особенно на мелких объектах, хотя сложное вспомогательное ветвление может иногда усложнять конвейеры экспорта на глубоко ограниченное периферийное железо.

Требования к памяти и эффективность обучения#

Когда дело касается эффективности обучения, YOLOv5 остается невероятно надежным. Хорошо поддерживаемая экосистема Ultralytics гарантирует, что модели YOLOv5 потребляют значительно меньше памяти CUDA, позволяя исследователям максимизировать размеры батчей на потребительских GPU. Хотя YOLOv9 достигает отличной эффективности параметров (высокая точность относительно своего размера), процесс его обучения может быть более ресурсоемким при использовании неоптимизированных фреймворков. К счастью, интеграция YOLOv9 в API Ultralytics приближает его к паритету с оптимизированным управлением ресурсами в YOLOv5.

Производительность и метрики#

Чтобы объективно оценить эти архитектуры, мы сравниваем их производительность на стандартных наборах данных, таких как COCO. Ниже представлен подробный разбор метрик, таких как mAP (Mean Average Precision), скорость вывода и количество параметров.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

Как показывает таблица, YOLOv9 достигает более высокой исходной точности в эквивалентных категориях, отражая свою более новую архитектуру. Тем не менее, YOLOv5n поддерживает невероятно низкую задержку TensorRT в 1.12 мс, подчеркивая свою непреходящую силу для высокоскоростных приложений локализованного периферийного вычисления.

Методологии обучения и простота использования#

Истинное преимущество использования компьютерного зрения сегодня заключается в доступности инструментария.

Преимущество Ultralytics#

Хотя оригинальные исследовательские репозитории для таких моделей, как YOLOv9, являются основополагающими, они часто поставляются со сложными матрицами зависимостей и шаблонными скриптами. Python API Ultralytics полностью абстрагирует эту сложность. С экосистемой Ultralytics ты можешь обучать, оценивать и экспортировать как YOLOv5, так и YOLOv9 с помощью идентичного, унифицированного синтаксиса.

from ultralytics import YOLO

# Load a pre-trained YOLOv5 model for fast deployment
model_v5 = YOLO("yolov5s.pt")

# Or leverage a YOLOv9 model for high-fidelity accuracy
model_v9 = YOLO("yolov9c.pt")

# Train seamlessly on custom data with automatic MLflow logging
results = model_v9.train(data="coco8.yaml", epochs=50, imgsz=640)

# Export the trained model to ONNX
model_v9.export(format="onnx")

Этот подход с единым API обеспечивает огромную универсальность, поддерживая не только обнаружение, но и оценку позы и ориентированные ограничивающие рамки (OBB) в зависимости от выбранной модели. Более того, надежные интеграции с такими инструментами, как Comet ML и Weights & Biases, встроены прямо в цикл обучения.

Идеальные сценарии использования и реальные приложения#

Выбор между этими архитектурами во многом зависит от ограничений твоего оборудования и требований к точности в твоей прикладной области.

Когда стоит выбрать YOLOv5#

YOLOv5 — это проверенный в бою ветеран, который отлично подходит для развертываний, где важны стабильность, низкое потребление памяти и широкая совместимость экспорта.

  • Мобильные развертывания: Экспорт YOLOv5 в TFLite или CoreML для вывода на устройстве на старых смартфонах происходит невероятно бесшовно.
  • Устаревшее периферийное железо: Для таких устройств, как Raspberry Pi или ранние поколения NVIDIA Jetson Nano, простые свёртки YOLOv5 обеспечивают стабильную частоту кадров для таких приложений, как интеллектуальное управление парковкой.
  • Быстрое прототипирование: Широкая доступность руководств от сообщества, пользовательских предобученных весов и огромная совместимость с датасетами делают это самым быстрым способом проверки концепции (Proof of Concept).

Когда стоит выбрать YOLOv9#

YOLOv9 идеально подходит для сценариев, где крайне важно уловить мельчайшие детали и минимизировать ложноотрицательные срабатывания, даже если это требует чуть больших вычислительных затрат.

  • Аэрофотоснимки и спутниковые изображения: Фреймворк PGI отлично справляется с сохранением точности мелких объектов, что делает YOLOv9 превосходным выбором для сельскохозяйственного мониторинга с помощью дронов.
  • Медицинская визуализация: При обнаружении микроскопических аномалий или повреждений на сканах высокого разрешения точный градиентный поток GELAN дает необходимое преимущество в показателе полноты (recall).
  • Высокоуровневая розничная аналитика: Отслеживание перекрывающихся товаров на плотно заполненных полках выигрывает от превосходных возможностей удержания признаков в YOLOv9.

Расширение горизонтов#

Хотя сравнение YOLOv5 и YOLOv9 дает четкое представление о том, как архитектуры эволюционировали с 2020 по 2024 год, сфера ИИ развивается быстрее, чем когда-либо. Разработчикам, ищущим абсолютную вершину производительности, настоятельно рекомендуется изучить последние модели YOLO26. Заменив традиционное подавление немаксимумов (NMS) на нативный сквозной дизайн без NMS (End-to-End NMS-Free Design) и используя продвинутый оптимизатор MuSGD, YOLO26 ликвидирует разрыв между точностью исследовательского уровня и скоростью продакшна. Благодаря удалению DFL (DFL Removal) (функция потерь Distribution Focal Loss удалена для упрощенного экспорта и лучшей совместимости с периферийными/маломощными устройствами), YOLO26 достигает ускорения вывода на CPU до 43%, что делает его идеальным для периферийных вычислений. Кроме того, ProgLoss + STAL обеспечивает улучшенные функции потерь с заметными улучшениями в распознавании мелких объектов, что критически важно для интернета вещей (IoT), робототехники и аэрофотоснимков.

Тебе также может быть интересно сравнить эти архитектуры с другими передовыми моделями, такими как RT-DETR или высокопроизводительная YOLO11. Использование унифицированного фреймворка Ultralytics гарантирует, что какую бы модель ты ни выбрал, твой конвейер разработки останется чистым, эффективным и готовым к масштабированию.

Комментарии