Ultralytics YOLO27:

Сравнение RTDETRv2 и PP-YOLOE+#

Стремительно развивающаяся область компьютерного зрения породила множество архитектурных подходов к решению сложных задач детекции объектов в реальном времени. Среди наиболее заметных последних достижений — RTDETRv2 и PP-YOLOE+, две мощные модели, использующие принципиально разные подходы к визуальному распознаванию. Хотя обе модели нацелены на высокую производительность детекции, их внутренние механизмы, парадигмы обучения и оптимальные сценарии развертывания значительно различаются.

В этом подробном руководстве рассматриваются технические особенности обеих моделей, сравниваются их архитектуры, показатели производительности и поддержка экосистем, чтобы помочь разработчикам и исследователям выбрать оптимальное решение для конкретных задач развертывания.

Обзор моделей#

Прежде чем анализировать данные о производительности, важно понять происхождение и архитектурные цели каждой модели. Обе они разработаны исследовательскими командами Baidu, однако представляют разные ветви семейства моделей детекции объектов.

RTDETRv2#

RTDETRv2 представляет собой значительный шаг вперед в архитектурах компьютерного зрения на основе Transformer. Развивая исходный Real-Time Detection Transformer, модель использует гибкую основу vision transformer в сочетании с эффективным гибридным энкодером. Ее ключевая особенность — изначально сквозная возможность предсказаний, полностью устраняющая необходимость в Non-Maximum Suppression (NMS) на этапе постобработки.

  • Автор: Вэньюй Лю (Wenyu Lv), Иянь Чжао (Yian Zhao), Циньяо Чжан (Qinyao Chang), Куй Хуан (Kui Huang), Гуаньчжун Ван (Guanzhong Wang) и И Лю (Yi Liu)
  • Организация: Baidu
  • Дата: 2024-07-24
  • Arxiv: 2407.17140
  • GitHub: Репозиторий RT-DETR

Узнай больше о RTDETRv2

PP-YOLOE+#

PP-YOLOE+ — это продвинутая версия серии YOLO, значительно оптимизированная для высокопроизводительных промышленных приложений. Она использует масштабируемую архитектуру CNN с безанкорной головой детекции. Модель разработана для обеспечения исключительно выгодного соотношения скорости и точности и применяет такие мощные методы, как ET-head и обобщенная функция фокальных потерь, для улучшения детекции малых объектов.

Узнай больше о PP-YOLOE+

Интеграция с экосистемой

Хотя у обеих моделей есть собственные исследовательские репозитории, ты можешь легко экспериментировать с RTDETRv2 непосредственно в пакете Ultralytics Python, пользуясь унифицированным API и упрощенными возможностями экспорта.

Архитектурные различия#

Принципиальное различие между этими двумя моделями заключается в том, как они обрабатывают визуальный контекст и формируют предсказания.

PP-YOLOE+ использует традиционную, но тщательно оптимизированную основу сверточной нейронной сети (CNN). Для извлечения признаков модель опирается на локальные рецептивные поля, что делает ее чрезвычайно быстрой и эффективной при стандартном развертывании. Однако ей по-прежнему требуется стандартная постобработка NMS для фильтрации перекрывающихся ограничивающих рамок, что в сложных сценах с высокой плотностью объектов может создавать узкие места по задержке.

В свою очередь, RTDETRv2 использует гибридный энкодер и декодер Transformer. Это позволяет модели одновременно захватывать глобальный контекст всего изображения. Механизмы внимания естественным образом учитывают взаимосвязи между объектами, благодаря чему модель может напрямую выдавать итоговые ограничивающие рамки без NMS. Такой сквозной подход обеспечивает стабильную задержку инференса независимо от количества обнаруженных объектов.

Показатели и сравнение производительности#

При оценке показателей производительности YOLO важно сопоставлять точность (mAP) с вычислительными затратами (FLOPs) и скоростью инференса. В таблице ниже представлена производительность обеих моделей в различных конфигурациях.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Хотя PP-YOLOE+x показывает немного более высокий показатель mAPval — 54,7% на наборе данных COCO, модели RTDETRv2 в целом обеспечивают сопоставимую точность с дополнительным преимуществом в виде стабильной задержки благодаря отсутствию NMS. Однако PP-YOLOE+ сохраняет явное преимущество по количеству параметров и FLOPs в небольших моделях, что делает ее весьма эффективной для развертывания на периферийных устройствах.

Преимущество Ultralytics: встречай YOLO26#

Хотя RTDETRv2 и PP-YOLOE+ сами по себе являются мощными решениями, развитие передовых технологий продолжается. Для разработчиков, которым нужен оптимальный баланс скорости, точности и поддержки экосистемы, Ultralytics YOLO26 представляет собой новый отраслевой стандарт.

YOLO26 объединяет лучшие стороны CNN и Transformer. В модели используется дизайн End-to-End NMS-Free, впервые предложенный современными архитектурами, который эффективно устраняет узкие места постобработки. Кроме того, в ней представлен революционный оптимизатор MuSGD — гибридный подход, вдохновленный инновациями в обучении LLM и обеспечивающий стабильное обучение и быструю сходимость.

Оптимизация для периферийных устройств

В отличие от тяжелых моделей Transformer, требующих значительного объема памяти CUDA, YOLO26 использует удаление DFL (распределительной фокальной функции потерь) и специально оптимизирована для периферийных вычислений, обеспечивая до 43% более быстрый инференс на CPU по сравнению с предыдущими поколениями.

Кроме того, YOLO26 не ограничивается простой детекцией объектов. Модель изначально универсальна и поддерживает сегментацию экземпляров, оценку позы и ориентированные ограничивающие рамки (OBB) без дополнительной настройки, тогда как PP-YOLOE+ в основном ориентирована на детекцию ограничивающих рамок.

Методики обучения и экосистема#

Эффективность обучения и простота использования — именно здесь экосистема Ultralytics действительно превосходит отдельные исследовательские репозитории. PP-YOLOE+ использует фреймворк PaddlePaddle, а для RTDETRv2 часто требуется сложная настройка окружения, тогда как интеграция моделей через Ultralytics обеспечивает плавный и удобный процесс.

Используя API Ultralytics, ты получаешь более низкие требования к памяти во время обучения, автоматизированную работу с наборами данных и упрощенную настройку гиперпараметров. Кроме того, развертывание моделей в промышленных форматах, таких как ONNX или TensorRT, выполняется одной командой.

Пример кода: упрощенный инференс#

Ниже показано, насколько просто использовать RTDETRv2 вместе с рекомендованной моделью YOLO26 с помощью пакета Ultralytics Python:

from ultralytics import RTDETR, YOLO

# Initialize the RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")

# Perform NMS-free inference on a test image
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()

# For superior speed and versatility, initialize the latest YOLO26 model
model_yolo26 = YOLO("yolo26n.pt")

# Train the YOLO26 model effortlessly with optimized memory usage
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)

# Export to TensorRT for edge deployment
model_yolo26.export(format="engine")

Применение и сценарии использования в реальном мире#

Выбор между этими архитектурами часто зависит от конкретных требований к оборудованию и приложению.

  • RTDETRv2 отлично подходит для серверных сред и сложного понимания сцен. Механизм глобального внимания делает модель особенно эффективной для управления массовыми скоплениями людей и анализа медицинских изображений с высокой плотностью объектов, где стандартные алгоритмы NMS обычно не справляются из-за перекрытий.
  • PP-YOLOE+ отлично подходит для высокоскоростного промышленного контроля и сред, активно использующих экосистему PaddlePaddle. Небольшое количество параметров в малых конфигурациях делает модель пригодной для некоторых робототехнических приложений.
  • Ultralytics YOLO26 — универсально рекомендуемое решение для комплексного коммерческого развертывания. Благодаря улучшенным функциям ProgLoss + STAL модель значительно повышает качество распознавания малых объектов, что особенно важно для работы с беспилотными летательными аппаратами и мониторинга дорожного движения в умных городах.

Варианты применения и рекомендации#

Выбор между RT-DETR и PP-YOLOE+ зависит от конкретных требований проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда стоит выбрать RT-DETR#

RT-DETR — подходящий выбор для:

  • Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
  • Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.

Когда выбирать PP-YOLOE+#

PP-YOLOE+ рекомендуется для следующих случаев:

  • Интеграция с экосистемой PaddlePaddle: Организации с существующей инфраструктурой, построенной на фреймворке и инструментах PaddlePaddle от Baidu.
  • Развертывание на периферийных устройствах с Paddle Lite: Развертывание на оборудовании с высокооптимизированными ядрами инференса, специально предназначенными для Paddle Lite или механизма инференса Paddle.
  • Высокоточное обнаружение на сервере: Сценарии, в которых приоритетом является максимальная точность обнаружения на мощных GPU-серверах, а зависимость от фреймворка не имеет значения.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Заключение#

RTDETRv2 и PP-YOLOE+ значительно расширили возможности компьютерного зрения, продемонстрировав жизнеспособность как архитектур Transformer, так и высокооптимизированных CNN. Однако сложность развертывания разрозненных исследовательских кодовых баз может замедлить выход проекта в производство.

Для современных инженеров в области ИИ использование платформы Ultralytics дает непревзойденное преимущество. Перейдя на бесшовно интегрированные модели, такие как YOLO11 или передовой YOLO26, команды могут добиться максимально высокого соотношения точности и скорости, одновременно существенно сократив требования к памяти и затраты на разработку.

Комментарии