PP-YOLOE+ и RTDETRv2#
В последние годы область компьютерного зрения претерпела стремительные изменения, особенно в сфере обнаружения объектов в реальном времени. Выбор правильной архитектуры для развёртывания может стать решающим фактором между медленным приложением с высоким потреблением памяти и высокооптимизированной отзывчивой системой. В этом техническом сравнении мы рассмотрим две заметные модели от Baidu: PP-YOLOE+ на основе CNN и RTDETRv2 на основе Transformer. Мы проанализируем их архитектуры, показатели производительности и оптимальные сценарии использования, а также сравним их с передовой платформой Ultralytics YOLO26.
PP-YOLOE+: развитие парадигмы CNN#
Разработанная как итерация предыдущих версий, PP-YOLOE+ расширяет возможности традиционных свёрточных нейронных сетей (CNN) в обнаружении объектов. Это высокопроизводительный детектор без якорей, основанный на фундаментальных принципах серии YOLO и дополненный специальными оптимизациями для экосистемы PaddlePaddle.
Сведения о модели:
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: 2203.16250
- GitHub: Репозиторий PaddleDetection
- Документация: документация PP-YOLOE+
Архитектура и методики#
PP-YOLOE+ использует тщательно оптимизированный backbone и специализированную пирамиду признаков для эффективного объединения признаков разных масштабов. В ней применяется архитектура без якорей, упрощающая эвристическую настройку, обычно необходимую для генерации anchor box. Кроме того, методика обучения включает продвинутые стратегии назначения меток, которые помогают лучше сопоставлять предсказания с эталонными рамками на этапе обучения.
Преимущества и сценарии использования#
Главное преимущество PP-YOLOE+ — стабильная производительность на стандартном серверном оборудовании и глубокая интеграция с инструментами Baidu. Модель хорошо подходит для традиционных промышленных процессов, таких как статическое обнаружение дефектов на производстве, где ограничения оборудования не слишком существенны.
Хотя PP-YOLOE+ обеспечивает высокую точность, его развёртывание за пределами родной экосистемы иногда требует дополнительных этапов конвертации, в отличие от встроенных форматов экспорта, доступных в современных конвейерах Ultralytics.
RTDETRv2: Transformer-модели обнаружения в реальном времени#
Отходя от чистых CNN, RTDETRv2 (Transformer для обнаружения объектов в реальном времени, версия 2) представляет переход к механизмам на основе внимания для задач компьютерного зрения. Модель стремится объединить способность Transformer учитывать глобальный контекст с низкой задержкой, необходимой для реальных приложений.
Сведения о модели:
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Репозиторий RTDETRv2
- Документация: README RTDETRv2
Архитектура и методики#
RTDETRv2 использует гибридную архитектуру, объединяющую backbone на основе CNN для извлечения признаков с оптимизированным encoder-decoder на основе Transformer. Отличительная особенность RTDETRv2 — встроенная сквозная архитектура, исключающая традиционную постобработку с подавлением немаксимумов (NMS). В модели также реализованы такие возможности, как обнаружение объектов разных масштабов и обработка сложных сцен, с применением self-attention для анализа пространственных связей между удалёнными объектами.
Преимущества и сценарии использования#
Архитектура Transformer делает RTDETRv2 особенно эффективной в сценариях, где важно понимание глобального контекста. Однако модели Transformer обычно требуют значительно больше памяти CUDA как при обучении, так и при инференсе по сравнению с лёгкими CNN. Модель лучше всего подходит для сред без существенных ограничений по оборудованию, например для облачной аналитики видео на мощных GPU-серверах.
Сравнение производительности и метрик#
При оценке этих моделей первостепенное значение имеет компромисс между средней точностью (mAP) и вычислительными затратами, измеряемыми во FLOPs и задержке инференса. В таблице ниже представлены основные метрики для различных масштабов PP-YOLOE+ и RTDETRv2.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Хотя RTDETRv2 демонстрирует высокий mAP за счёт большего числа параметров и FLOPs, разработчики, стремящиеся развернуть модель на устройствах периферийных вычислений с ограниченными ресурсами, часто сталкиваются с узкими местами из-за значительных требований к памяти, типичных для слоёв Transformer.
Варианты применения и рекомендации#
Выбор между PP-YOLOE+ и RT-DETR зависит от конкретных требований проекта, ограничений развёртывания и предпочтений в отношении экосистемы.
Когда выбирать PP-YOLOE+#
PP-YOLOE+ — хороший выбор для:
- Интеграция с экосистемой PaddlePaddle: Организации с существующей инфраструктурой, построенной на фреймворке и инструментах PaddlePaddle от Baidu.
- Развертывание на периферийных устройствах с Paddle Lite: Развертывание на оборудовании с высокооптимизированными ядрами инференса, специально предназначенными для Paddle Lite или механизма инференса Paddle.
- Высокоточное обнаружение на сервере: Сценарии, в которых приоритетом является максимальная точность обнаружения на мощных GPU-серверах, а зависимость от фреймворка не имеет значения.
Когда стоит выбрать RT-DETR#
RT-DETR рекомендуется для:
- Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
- Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Преимущество Ultralytics: знакомство с YOLO26#
Хотя PP-YOLOE+ и RTDETRv2 стали важными этапами развития, современному разработчику нужна экосистема, идеально сочетающая максимальную производительность и удобство использования. Платформа Ultralytics и революционная модель YOLO26 предлагают именно это.
Выпущенная в январе 2026 года, YOLO26 устанавливает новый стандарт для vision AI с приоритетом периферийных устройств. Она элегантно решает проблемы развёртывания, связанные с устаревшими архитектурами, превосходя их как по скорости, так и по точности.
Архитектурные инновации#
YOLO26 представляет несколько инновационных улучшений, превосходящих традиционные CNN и тяжёлые Transformer:
- Сквозная архитектура без NMS: Как и RTDETRv2, YOLO26 изначально построена как сквозная модель. Устраняя постобработку с подавлением немаксимумов (NMS), она обеспечивает более быстрое и простое развёртывание с меньшим разбросом задержки, что идеально подходит для робототехники в реальном времени и автономных систем.
- До 43% более быстрый инференс на CPU: Благодаря глубокой оптимизации архитектуры YOLO26 значительно превосходит конкурирующие модели на периферийных устройствах без дискретных GPU, что делает её оптимальным выбором для приложений IoT и умных городов.
- Оптимизатор MuSGD: Вдохновлённая инновациями в обучении LLM, YOLO26 использует комбинацию SGD и Muon. Это обеспечивает более стабильную динамику обучения и значительно более быструю сходимость, существенно сокращая время обучения на GPU.
- ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание небольших объектов — области, в которой такие модели, как PP-YOLOE+, традиционно испытывают трудности, — что особенно важно для аэрофотоснимков и приложений с дронами.
- Удаление DFL: Удаление Distribution Focal Loss упрощает процесс экспорта и обеспечивает бесшовную совместимость с различными периферийными устройствами и устройствами с низким энергопотреблением.
В отличие от специализированных детекторов объектов, YOLO26 отличается высокой универсальностью и поддерживает сегментацию экземпляров, оценку позы, классификацию и ориентированные ограничивающие рамки (OBB). В неё входят специализированные улучшения, такие как RLE для Pose и специальная функция потерь угла для OBB.
Непревзойдённая простота использования#
Один из главных недостатков использования сложных архитектур, таких как RTDETRv2, — крутая кривая обучения и разрозненные процессы интеграции. Экосистема Ultralytics полностью абстрагирует эти сложности благодаря интуитивно понятному API Python и комплексной веб-платформе.
Будь то обучение на пользовательских датасетах или быстрый инференс, процесс проходит без лишних сложностей:
from ultralytics import RTDETR, YOLO
# Initialize the state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Alternatively, initialize an RT-DETR model via the same simple API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Run real-time inference effortlessly
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()
# Export for edge deployment in one line
model_yolo.export(format="engine", quantize=16)Типичные для моделей Ultralytics YOLO более низкие требования к памяти позволяют быстрее обучать модели и развёртывать их на более доступном оборудовании по сравнению с аналогами на основе Transformer. Кроме того, активная разработка и документация мирового уровня помогают поддерживать стабильность производственных конвейеров.
Для команд, ищущих альтернативы, YOLO11 остается отличной поддерживаемой и исключительно мощной предшественницей в экосистеме, обеспечивающей прекрасную основу для интеграции со старым оборудованием. Тебе также может пригодиться наше сравнение YOLO11 vs RT-DETR.
Итоги#
PP-YOLOE+ и RTDETRv2 внесли значительный вклад в развитие компьютерного зрения, продемонстрировав жизнеспособность передовых конвейеров на основе CNN и Transformer реального времени соответственно. Однако для организаций, стремящихся в 2026 году развёртывать надёжные, универсальные и высокооптимизированные приложения компьютерного зрения, Ultralytics YOLO26 предлагает непревзойдённое решение. Её нативная архитектура без NMS, значительно более быстрый инференс на CPU и оптимизированная экосистема позволяют разработчикам быстрее, чем когда-либо, переходить от идеи к масштабируемому производству.