YOLO Vision 2026:

YOLOv5 против RTDETRv2#

Сфера computer vision значительно расширилась за последние несколько лет, предложив разработчикам широкий спектр архитектур для решения сложных задач компьютерного зрения. Среди самых популярных парадигм — свёрточные нейросети (CNN) и детекционные трансформеры (DETR).

Это руководство представляет собой подробное техническое сравнение двух ключевых моделей в этих категориях: Ultralytics YOLOv5, высокоэффективной и широко распространенной модели на базе CNN, и RTDETRv2, современного детектора объектов реального времени на базе трансформеров.

Ultralytics YOLOv5: отраслевой стандарт эффективности#

С момента своего выпуска Ultralytics YOLOv5 стала краеугольным камнем ИИ-сообщества, обеспечивая работу тысяч коммерческих приложений и исследовательских проектов по всему миру. Созданная полностью на базе фреймворка PyTorch, она ставит во главу угла интуитивно понятный опыт разработчика без ущерба для производительности в реальном времени.

Основные характеристики:

Архитектура и преимущества#

YOLOv5 использует оптимизированную архитектуру CNN, разработанную для максимизации эффективности feature extraction при сохранении чрезвычайно малого объема потребляемой памяти. В ней используются бэкбон CSPDarknet и нэк PANet, создающие мощную комбинацию для многомасштабного слияния признаков.

Одно из главных достоинств YOLOv5 — это её баланс производительности. Она обеспечивает исключительный компромисс между скоростью и точностью, что делает её идеальным выбором для model deployment на оборудовании с ограниченными ресурсами, таком как устройства NVIDIA Jetson и смартфоны.

Кроме того, YOLOv5 отличается непревзойденной универсальностью. В отличие от моделей, строго ограниченных предсказанием ограничивающих прямоугольников, YOLOv5 нативно поддерживает image classification и instance segmentation, предоставляя единый фреймворк для различных визуальных задач. Её training efficiency также впечатляет: во время обучения требуется значительно меньше памяти CUDA по сравнению с архитектурами на базе трансформеров.

Слабые стороны#

Поскольку YOLOv5 опирается на более старый фреймворк CNN, она неизбежно зависит от Non-Maximum Suppression (NMS) на этапе постобработки для удаления дублирующихся ограничивающих прямоугольников. Несмотря на высокую оптимизацию в экосистеме Ultralytics, NMS может иногда приводить к задержкам на специализированных периферийных NPU.

Узнай больше о YOLOv5

RTDETRv2: трансформеры реального времени от Baidu#

RTDETRv2 (Real-Time Detection Transformer v2) представляет собой существенный скачок в применении архитектур трансформеров к обнаружению объектов в реальном времени, устраняя вычислительные неэффективности, которые исторически были свойственны стандартным DETR.

Основные характеристики:

  • Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
  • Организация: Baidu
  • Дата: 24.07.2024
  • Ссылки: Arxiv Paper, GitHub Repository

Архитектура и преимущества#

RTDETRv2 развивает идеи своего предшественника, используя гибридный энкодер и гибкий дизайн декодера для обработки изображений. Механизм селф-аттеншн (самовнимания) трансформера дает модели глобальное понимание контекста изображения, позволяя ей отлично работать в сложных сценах с сильным перекрытием объектов.

Определяющей особенностью RTDETRv2 является её сквозной дизайн без использования NMS. Предсказывая запросы объектов напрямую без необходимости использования anchor boxes или постобработки NMS, она упрощает конвейер инференса. Эта архитектура достигает впечатляющего mAP (mean Average Precision) на эталонных наборах данных, таких как COCO.

Слабые стороны#

Несмотря на возможности работы в реальном времени, RTDETRv2 имеет значительно более высокие требования к памяти по сравнению с моделями YOLO. Механизмы внимания в трансформерах масштабируются квадратично с длиной последовательности, что может приводить к ошибкам нехватки памяти (OOM) во время обучения с высоким разрешением, если не используются массивные кластеры GPU. Кроме того, ей не хватает универсальности экосистемы Ultralytics из коробки: она в основном сосредоточена только на 2D object detection без нативной поддержки сегментации или оценки позы.

Узнай больше о RTDETR

Таблица сравнения производительности#

Чтобы объективно оценить эти архитектуры, мы собрали их показатели производительности. Значения, выделенные жирным шрифтом, представляют собой наиболее эффективные или самые высокие показатели производительности среди протестированных масштабов.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Контекст производительности

Хотя RTDETRv2-x достигает наивысшего абсолютного значения mAP, он требует почти в 30 раз больше параметров, чем YOLOv5n. Для высокоскоростных приложений, работающих на ограниченном оборудовании, модели Ultralytics неизменно предлагают лучшую вычислительную эффективность.

Преимущества экосистемы Ultralytics#

При переносе модели из исследовательского ноутбука в производственную среду программное обеспечение, окружающее модель, так же важно, как и архитектура нейронной сети. Хорошо поддерживаемая экосистема, предоставляемая Ultralytics, значительно ускоряет жизненный цикл разработки.

Непревзойденная простота использования#

Модели Ultralytics отдают приоритет невероятно удобному пользовательскому опыту. Хочешь ли ты обучить кастомную модель, запустить валидацию или экспортировать ее в специфичные для оборудования форматы, такие как TensorRT или ONNX, Ultralytics Python API позволяет сделать это всего за несколько строк кода.

Вот практический пример кода, демонстрирующий, насколько просто обучать и запускать вывод с моделью Ultralytics:

from ultralytics import YOLO

# Initialize the model (automatically downloads the weights)
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# Perform inference on an online image
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the resulting image with bounding boxes
inference_results[0].show()

Этот простой и унифицированный API нативно поддерживает интеграцию experiment tracking с такими инструментами, как Weights & Biases и Comet, позволяя разработчикам легко логировать метрики без написания сложного шаблонного кода.

Сценарии использования и рекомендации#

Выбор между YOLOv5 и RT-DETR зависит от твоих конкретных требований к проекту, ограничений развертывания и предпочтений в экосистеме.

Когда стоит выбрать YOLOv5#

YOLOv5 — отличный выбор для:

  • Проверенных производственных систем: существующих развертываний, где ценятся долгая история стабильности YOLOv5, обширная документация и огромная поддержка сообщества.
  • Обучения с ограниченными ресурсами: сред с ограниченными ресурсами GPU, где эффективный конвейер обучения YOLOv5 и более низкие требования к памяти являются преимуществом.
  • Широкая поддержка форматов экспорта: Проекты, требующие развертывания во многих форматах, включая ONNX, TensorRT, CoreML и TFLite.

Когда выбирать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
  • Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
  • Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает наилучшее сочетание производительности и удобства для разработчика:

  • Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
  • Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
  • Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.

Взгляд в будущее: YOLO11 и YOLO26#

Если ты начинаешь новый проект в области компьютерного зрения сегодня, настоятельно рекомендуется изучить последние поколения моделей Ultralytics.

Хотя YOLOv5 остается невероятно надежной, YOLO11 предлагает улучшенную точность и расширенный набор задач, включая детектирование Oriented Bounding Box (OBB).

Еще более значимо то, что передовая YOLO26 объединяет лучшее из обоих миров. Она реализует сквозной дизайн без NMS (впервые представленный в YOLOv10), устраняя накладные расходы на постобработку при сохранении эффективности CNN. YOLO26 также представляет оптимизатор MuSGD, вдохновленный инновациями в обучении LLM, для более быстрой сходимости. Благодаря удалению DFL (Distribution Focal Loss удалена для упрощенного экспорта и лучшей совместимости с периферийными устройствами и устройствами малой мощности), YOLO26 обеспечивает ускорение инференса на CPU до 43%, что делает ее абсолютно лучшим выбором для периферийного ИИ. Кроме того, ProgLoss + STAL обеспечивает улучшенные функции потерь с заметными улучшениями в распознавании мелких объектов, что критически важно для интернета вещей, робототехники и аэрофотоснимков.

Заключение#

Выбор между YOLOv5 и RTDETRv2 сильно зависит от твоих ограничений при развертывании. RTDETRv2 расширяет границы mAP, используя мощные механизмы внимания трансформеров, но требует больших затрат памяти и вычислительных мощностей.

С другой стороны, Ultralytics YOLOv5 предлагает проверенное, высокооптимизированное и универсальное решение, которое плавно работает везде — от облачных серверов до микроконтроллеров. Для команд, ищущих максимально возможную точность наряду с бесшовными инструментами деплоя, обновление внутри экосистемы Ultralytics до YOLO26 предоставляет окончательное передовое решение для современных приложений vision AI.

Комментарии