RTDETRv2 против PP-YOLOE+#
Быстро развивающаяся область компьютерного зрения породила различные архитектурные подходы для решения сложных задач обнаружения объектов в реальном времени. Среди наиболее заметных недавних достижений выделяются RTDETRv2 и PP-YOLOE+ — две мощные модели, которые подходят к визуальному распознаванию с принципиально разных точек зрения проектирования. Хотя обе модели нацелены на обеспечение высокопроизводительного детектирования, их базовые механизмы, парадигмы обучения и идеальные сценарии развертывания существенно различаются.
Это подробное руководство погружает в технические нюансы обеих моделей, сравнивая их архитектуры, показатели производительности и поддержку экосистемы, чтобы помочь разработчикам и исследователям выбрать оптимальное решение для их специфических нужд развертывания.
Обзор моделей#
Прежде чем анализировать данные о производительности, важно понять происхождение и архитектурные цели каждой модели. Обе они созданы исследовательскими группами в Baidu, однако представляют разные ветви семейного древа обнаружения объектов.
RTDETRv2#
RTDETRv2 представляет собой значительный скачок в архитектурах зрения на основе Transformer. Основываясь на оригинальном Real-Time Detection Transformer, она использует гибкий бэкбон vision transformer в сочетании с эффективным гибридным энкодером. Ее самой определяющей характеристикой является возможность предсказания, полностью готовая к работе по принципу «end-to-end», что полностью устраняет необходимость в Non-Maximum Suppression (NMS) при постобработке.
Автор: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
Организация: Baidu
Дата: 2024-07-24
Arxiv: 2407.17140
GitHub: Репозиторий RT-DETR
PP-YOLOE+#
PP-YOLOE+ представляет собой усовершенствованную итерацию серии YOLO, глубоко оптимизированную для высокопроизводительных промышленных применений. Она отличается масштабируемой CNN-архитектурой с детектирующей головой без якорей (anchor-free). Разработанная для обеспечения исключительного соотношения скорости и точности, она внедряет мощные методы, такие как ET-head и обобщенная функция фокальных потерь, для улучшения обнаружения мелких объектов.
Автор: Авторы PaddlePaddle
Организация: Baidu
Дата: 2022-04-02
Arxiv: 2203.16250
GitHub: Репозиторий PaddleDetection
Хотя обе модели имеют собственные автономные исследовательские репозитории, ты можешь легко экспериментировать с RTDETRv2 прямо в пакете Ultralytics Python, получая выгоду от унифицированного API и оптимизированных вариантов экспорта.
Архитектурные различия#
Фундаментальное различие между этими двумя моделями заключается в том, как они обрабатывают визуальный контекст и генерируют предсказания.
PP-YOLOE+ использует традиционный, но высоко оптимизированный бэкбон Convolutional Neural Network (CNN). Он опирается на локальные рецептивные поля для извлечения признаков, что делает его невероятно быстрым и эффективным для стандартного развертывания. Однако он по-прежнему требует стандартной постобработки NMS для фильтрации перекрывающихся bbox, что может привести к задержкам в плотных сценах.
Напротив, RTDETRv2 использует Hybrid Encoder и Transformer Decoder. Это позволяет модели захватывать глобальный контекст по всему изображению одновременно. Механизмы внимания по своей природе понимают взаимосвязи между объектами, позволяя модели выводить финальные bbox напрямую без NMS. Этот подход end-to-end гарантирует стабильную задержку вывода независимо от количества обнаруженных объектов.
Показатели производительности и сравнение#
При оценке метрик производительности YOLO крайне важно сбалансировать точность (mAP) с вычислительными затратами (FLOPs) и скоростью инференса. В таблице ниже представлена производительность обеих моделей для различных размеров.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Хотя PP-YOLOE+x достигает немного более высокого mAPval на уровне 54.7% на наборе данных COCO, модели RTDETRv2 обычно предлагают конкурентоспособную точность с дополнительным преимуществом стабильной задержки благодаря дизайну без NMS. Тем не менее, PP-YOLOE+ сохраняет явное преимущество по количеству параметров и FLOPs для меньших моделей, что делает ее высокоэффективной для граничных (edge) развертываний.
Преимущество Ultralytics: знакомься с YOLO26#
Хотя RTDETRv2 и PP-YOLOE+ впечатляют сами по себе, передовые технологии продолжают развиваться. Для разработчиков, ищущих идеальный баланс скорости, точности и поддержки экосистемы, Ultralytics YOLO26 представляет собой новый отраслевой стандарт.
YOLO26 синтезирует лучшие аспекты как CNN, так и Transformer. Он принимает дизайн End-to-End NMS-Free, заложенный современными архитектурами, эффективно устраняя узкие места постобработки. Более того, он представляет революционный MuSGD Optimizer, гибридный подход, вдохновленный инновациями в обучении LLM, который обеспечивает высокую стабильность обучения и быструю сходимость.
В отличие от тяжелых моделей Transformer, требующих значительной памяти CUDA, YOLO26 отличается функцией DFL Removal (Distribution Focal Loss) и специально оптимизирован для граничных вычислений (edge computing), обеспечивая до 43% более быстрый CPU вывод по сравнению с предыдущими поколениями.
Кроме того, YOLO26 не ограничивается простым обнаружением объектов. Она обладает универсальностью из коробки, поддерживая сегментацию экземпляров, оценку позы и ориентированные ограничивающие рамки (OBB), тогда как PP-YOLOE+ в первую очередь сосредоточена на обнаружении с помощью ограничивающих рамок.
Методологии обучения и экосистема#
Эффективность обучения и простота использования — это то, в чем экосистема Ultralytics по-настоящему превосходит автономные исследовательские репозитории. В то время как PP-YOLOE+ опирается на фреймворк PaddlePaddle, а RTDETRv2 часто требует сложной настройки окружения, интеграция моделей через Ultralytics обеспечивает бесшовный опыт.
Используя API Ultralytics, ты получаешь выгоду от снижения требований к памяти во время обучения, автоматизированной работы с наборами данных и упрощенной настройки гиперпараметров. Более того, развертывание моделей в производственных форматах, таких как ONNX или TensorRT, может быть выполнено с помощью одной команды.
Пример кода: Упрощенный вывод (Inference)#
Ниже представлена демонстрация того, как легко ты можешь использовать RTDETRv2 наряду с рекомендуемой моделью YOLO26, используя пакет Ultralytics для Python:
from ultralytics import RTDETR, YOLO
# Initialize the RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")
# Perform NMS-free inference on a test image
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()
# For superior speed and versatility, initialize the latest YOLO26 model
model_yolo26 = YOLO("yolo26n.pt")
# Train the YOLO26 model effortlessly with optimized memory usage
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)
# Export to TensorRT for edge deployment
model_yolo26.export(format="engine")Приложения в реальном мире и сценарии использования#
Выбор между этими архитектурами часто зависит от конкретного оборудования и требований приложения.
- RTDETRv2 превосходно работает в серверных средах и задачах понимания сложных сцен. Ее механизм глобального внимания делает ее высокоэффективной для управления толпой и плотного медицинского анализа изображений, где перекрывающиеся объекты обычно приводят к сбоям стандартных алгоритмов NMS.
- PP-YOLOE+ отлично подходит для высокоскоростной промышленной инспекции и сред, активно использующих экосистему PaddlePaddle. Низкое количество параметров на малых масштабах делает его пригодным для определенных робототехнических приложений.
- Ultralytics YOLO26 — это универсально рекомендуемое решение для масштабного коммерческого развертывания. Благодаря улучшенным функциям ProgLoss + STAL она значительно улучшает распознавание мелких объектов, что критически важно для операций с воздушными дронами и мониторинга трафика в умном городе.
Сценарии использования и рекомендации#
Выбор между RT-DETR и PP-YOLOE+ зависит от твоих специфических требований проекта, ограничений развертывания и предпочтений в экосистеме.
Когда выбирать RT-DETR#
RT-DETR — отличный выбор для:
- Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
- Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
- Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.
Когда выбирать PP-YOLOE+#
PP-YOLOE+ рекомендуется для:
- Интеграция с экосистемой PaddlePaddle: Организации с существующей инфраструктурой, созданной на базе фреймворка и инструментов Baidu's PaddlePaddle.
- Развертывание на периферии с Paddle Lite: Развертывание на оборудовании с высокооптимизированными ядрами вывода, специально предназначенными для движка Paddle Lite или Paddle.
- Серверное обнаружение с высокой точностью: Сценарии, где приоритетом является максимальная точность обнаружения на мощных GPU-серверах, где зависимость от фреймворка не является проблемой.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает наилучшее сочетание производительности и удобства для разработчика:
- Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
- Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
- Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.
Заключение#
И RTDETRv2, и PP-YOLOE+ расширили границы возможного в компьютерном зрении, доказав жизнеспособность как Transformer-архитектур, так и высоко оптимизированных CNN. Однако сложность развертывания фрагментированных исследовательских кодовых баз может замедлить сроки выпуска продукта.
Для современных ИИ-инженеров использование платформы Ultralytics дает непревзойденное преимущество. Переходя на легко интегрируемые модели, такие как YOLO11 или передовая YOLO26, команды могут достичь наивысших возможных соотношений точности и скорости, одновременно кардинально снижая требования к памяти и издержки на разработку.