PP-YOLOE+ против RTDETRv2#
В последние годы компьютерное зрение стремительно развивается, особенно в области обнаружения объектов в реальном времени. Выбор подходящей архитектуры для развертывания может стать решающим фактором: приложение будет либо медленным и требовательным к памяти, либо высокооптимизированным и отзывчивым. В этом техническом сравнении мы рассмотрим две известные модели Baidu: PP-YOLOE+ на базе CNN и RTDETRv2 на базе Transformer. Мы проанализируем их архитектуру, показатели производительности и оптимальные сценарии применения, а также сравним их с передовой платформой Ultralytics YOLO26.
PP-YOLOE+: развитие парадигмы CNN#
PP-YOLOE+, созданная как усовершенствованная версия предшественников, расширяет возможности традиционных сверточных нейронных сетей (CNNs) в обнаружении объектов. Это мощный детектор без якорей, основанный на базовых принципах серии YOLO и дополненный специальными оптимизациями для экосистемы PaddlePaddle.
Сведения о модели:
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: 2203.16250
- GitHub: Репозиторий PaddleDetection
- Документация: Документация PP-YOLOE+
Архитектура и методики#
PP-YOLOE+ использует тщательно оптимизированный backbone и специализированную пирамидальную сеть признаков для эффективного объединения признаков разных масштабов. В ней применяется архитектура без якорей, упрощающая эвристическую настройку, обычно необходимую для генерации якорных рамок. Кроме того, методика обучения включает продвинутые стратегии сопоставления меток, которые помогают лучше соотносить предсказания с эталонными рамками в процессе обучения.
Преимущества и сценарии применения#
Главное преимущество PP-YOLOE+ — надежная работа на стандартном серверном оборудовании и глубокая интеграция с инструментами Baidu. Модель хорошо подходит для традиционных промышленных процессов, например для статического обнаружения дефектов на производстве, где ограничения оборудования не слишком жесткие.
Несмотря на высокую точность PP-YOLOE+, ее развертывание за пределами родной экосистемы иногда требует дополнительных этапов преобразования — в отличие от современных конвейеров Ultralytics, в которых сразу доступны форматы экспорта.
RTDETRv2: Transformer для обнаружения объектов в реальном времени#
RTDETRv2 (версия 2 Transformer для обнаружения объектов в реальном времени) отходит от чистых CNN и использует механизмы внимания в задачах компьютерного зрения. Эта модель стремится объединить способность Transformer учитывать глобальный контекст с низкой задержкой, необходимой для реальных приложений.
Сведения о модели:
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Репозиторий RTDETRv2
- Документация: README RTDETRv2
Архитектура и методики#
RTDETRv2 использует гибридную архитектуру: backbone на базе CNN извлекает признаки, а упрощенный Transformer работает как кодировщик-декодировщик. Отличительная особенность RTDETRv2 — встроенная сквозная архитектура, обходящая традиционную постобработку с подавлением немаксимумов (NMS). Модель также поддерживает обнаружение объектов разных масштабов и обработку сложных сцен, используя self-attention для анализа пространственных взаимосвязей между удаленными объектами.
Преимущества и сценарии применения#
Архитектура Transformer делает RTDETRv2 особенно эффективной в сценариях, где важно учитывать глобальный контекст. Однако модели Transformer обычно требуют значительно больше памяти CUDA при обучении и инференсе, чем легковесные CNN. Модель лучше всего подходит для сред без жестких ограничений по оборудованию, например для облачной видеоаналитики на мощных GPU-серверах.
Сравнение производительности и метрик#
При оценке этих моделей важно учитывать компромисс между средней точностью по всем классам (mAP) и вычислительной стоимостью, измеряемой во FLOPs и задержке инференса. В таблице ниже приведены основные показатели моделей PP-YOLOE+ и RTDETRv2 разных размеров.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2 обеспечивает высокую mAP, но требует больше параметров и FLOPs. Разработчики, которые хотят развернуть модель на компактных edge-устройствах, часто сталкиваются с узкими местами из-за высокого потребления памяти, характерного для слоев Transformer.
Сценарии использования и рекомендации#
Выбирай между PP-YOLOE+ и RT-DETR с учетом требований конкретного проекта, ограничений развертывания и предпочтительной экосистемы.
Когда выбирать PP-YOLOE+#
PP-YOLOE+ — хороший выбор для:
- Интеграция с экосистемой PaddlePaddle: Организации с готовой инфраструктурой на базе фреймворка и инструментов PaddlePaddle от Baidu.
- Развертывание на периферийных устройствах с Paddle Lite: Развертывание на оборудовании со специально оптимизированными ядрами инференса для Paddle Lite или движка инференса Paddle.
- Обнаружение объектов на сервере с высокой точностью: Сценарии, где приоритетом является максимальная точность обнаружения на мощных серверах с GPU, а зависимость от конкретного фреймворка не имеет значения.
Когда выбрать RT-DETR#
RT-DETR рекомендуется для:
- Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
- Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Преимущества Ultralytics: знакомство с YOLO26#
PP-YOLOE+ и RTDETRv2 стали важными вехами, однако современным разработчикам нужна экосистема, которая идеально сочетает высокую производительность с удобством использования. Именно это предлагают платформа Ultralytics и прорывная модель YOLO26.
Выпущенная в январе 2026 года YOLO26 устанавливает новый стандарт в области компьютерного зрения с приоритетом edge-устройств. Модель элегантно решает проблемы развертывания, связанные со старыми архитектурами, и при этом превосходит их по скорости и точности.
Архитектурные инновации#
YOLO26 предлагает ряд передовых улучшений, благодаря которым превосходит традиционные CNN и ресурсоемкие Transformer-модели:
- Сквозная архитектура без NMS: Как и RTDETRv2, YOLO26 поддерживает встроенный сквозной инференс. Пропуская постобработку с подавлением немаксимумов (NMS) благодаря необязательной голове «один к одному» (
nms=False), модель упрощает развертывание, снижает задержку и ее колебания — это идеальный вариант для робототехники и автономных систем, работающих в реальном времени. - Инференс на CPU быстрее до 43%: Благодаря глубокой оптимизации архитектуры YOLO26 значительно превосходит конкурирующие модели на edge-устройствах без дискретных GPU, что делает ее оптимальным выбором для IoT и приложений умного города.
- Оптимизатор MuSGD: Вдохновленная новыми подходами к обучению LLM, YOLO26 использует гибрид SGD и Muon. Это обеспечивает более стабильную динамику обучения и заметно ускоряет сходимость, значительно сокращая время обучения на GPU.
- ProgLoss + STAL: Эти продвинутые функции потерь значительно улучшают распознавание мелких объектов — задачу, с которой модели вроде PP-YOLOE+ традиционно справляются хуже. Это особенно важно для аэрофотоснимков и приложений с дронами.
- Удаление DFL: Удаление Distribution Focal Loss упрощает процесс экспорта и обеспечивает совместимость с различными edge-устройствами и устройствами с низким энергопотреблением.
В отличие от специализированных детекторов объектов, YOLO26 отличается универсальностью и поддерживает сегментацию экземпляров, оценку позы, классификацию и повернутые ограничивающие рамки (OBB). Модель включает специальные улучшения, такие как RLE для оценки позы и специализированная функция потерь для углов OBB.
Непревзойдённое удобство использования#
Один из главных недостатков сложных архитектур, таких как RTDETRv2, — высокий порог освоения и разрозненные процессы интеграции. Экосистема Ultralytics полностью скрывает эти сложности за интуитивно понятным API Python и полнофункциональной веб-платформой.
Будь то обучение на собственных наборах данных или быстрый инференс, процесс проходит без лишних сложностей:
from ultralytics import RTDETR, YOLO
# Инициализируй современную модель YOLO26
model_yolo = YOLO("yolo26n.pt")
# Или инициализируй модель RT-DETR через тот же простой API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Легко запускай инференс в реальном времени
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()
# Экспортируй модель для развертывания на edge-устройстве одной строкой
model_yolo.export(format="engine", quantize=16)Модели Ultralytics YOLO обычно требуют меньше памяти, поэтому по сравнению с аналогами на базе Transformer ты можешь быстрее обучать их и развертывать на более дешевом оборудовании. Кроме того, активная разработка и документация мирового уровня помогают поддерживать стабильность рабочих конвейеров.
Если ты рассматриваешь альтернативы, YOLO11 остается хорошо поддерживаемой и очень мощной предшественницей в экосистеме — она отлично подходит в качестве базовой модели для интеграции с устаревшим оборудованием. Также тебе может пригодиться наше сравнение YOLO11 и RT-DETR.
Итоги#
PP-YOLOE+ и RTDETRv2 внесли значительный вклад в развитие компьютерного зрения, продемонстрировав перспективность продвинутых конвейеров CNN и Transformer-моделей для работы в реальном времени соответственно. Однако организациям, которые в 2026 году хотят развертывать надежные, универсальные и высокооптимизированные приложения компьютерного зрения, Ultralytics YOLO26 предлагает непревзойденное решение. Необязательный инференс без NMS, значительно более быстрый инференс на CPU и простая экосистема позволяют разработчикам быстрее, чем когда-либо, перейти от идеи к масштабируемому промышленному внедрению.