Ultralytics YOLO27:
Get Started

PP-YOLOE+ против RTDETRv2#

В последние годы компьютерное зрение стремительно развивается, особенно в области обнаружения объектов в реальном времени. Выбор подходящей архитектуры для развертывания может стать решающим фактором: приложение будет либо медленным и требовательным к памяти, либо высокооптимизированным и отзывчивым. В этом техническом сравнении мы рассмотрим две известные модели Baidu: PP-YOLOE+ на базе CNN и RTDETRv2 на базе Transformer. Мы проанализируем их архитектуру, показатели производительности и оптимальные сценарии применения, а также сравним их с передовой платформой Ultralytics YOLO26.

PP-YOLOE+: развитие парадигмы CNN#

PP-YOLOE+, созданная как усовершенствованная версия предшественников, расширяет возможности традиционных сверточных нейронных сетей (CNNs) в обнаружении объектов. Это мощный детектор без якорей, основанный на базовых принципах серии YOLO и дополненный специальными оптимизациями для экосистемы PaddlePaddle.

Сведения о модели:

Архитектура и методики#

PP-YOLOE+ использует тщательно оптимизированный backbone и специализированную пирамидальную сеть признаков для эффективного объединения признаков разных масштабов. В ней применяется архитектура без якорей, упрощающая эвристическую настройку, обычно необходимую для генерации якорных рамок. Кроме того, методика обучения включает продвинутые стратегии сопоставления меток, которые помогают лучше соотносить предсказания с эталонными рамками в процессе обучения.

Преимущества и сценарии применения#

Главное преимущество PP-YOLOE+ — надежная работа на стандартном серверном оборудовании и глубокая интеграция с инструментами Baidu. Модель хорошо подходит для традиционных промышленных процессов, например для статического обнаружения дефектов на производстве, где ограничения оборудования не слишком жесткие.

Узнай больше о PP-YOLOE+

Особенности экосистемы

Несмотря на высокую точность PP-YOLOE+, ее развертывание за пределами родной экосистемы иногда требует дополнительных этапов преобразования — в отличие от современных конвейеров Ultralytics, в которых сразу доступны форматы экспорта.

RTDETRv2: Transformer для обнаружения объектов в реальном времени#

RTDETRv2 (версия 2 Transformer для обнаружения объектов в реальном времени) отходит от чистых CNN и использует механизмы внимания в задачах компьютерного зрения. Эта модель стремится объединить способность Transformer учитывать глобальный контекст с низкой задержкой, необходимой для реальных приложений.

Сведения о модели:

Архитектура и методики#

RTDETRv2 использует гибридную архитектуру: backbone на базе CNN извлекает признаки, а упрощенный Transformer работает как кодировщик-декодировщик. Отличительная особенность RTDETRv2 — встроенная сквозная архитектура, обходящая традиционную постобработку с подавлением немаксимумов (NMS). Модель также поддерживает обнаружение объектов разных масштабов и обработку сложных сцен, используя self-attention для анализа пространственных взаимосвязей между удаленными объектами.

Преимущества и сценарии применения#

Архитектура Transformer делает RTDETRv2 особенно эффективной в сценариях, где важно учитывать глобальный контекст. Однако модели Transformer обычно требуют значительно больше памяти CUDA при обучении и инференсе, чем легковесные CNN. Модель лучше всего подходит для сред без жестких ограничений по оборудованию, например для облачной видеоаналитики на мощных GPU-серверах.

Узнай больше о RTDETRv2

Сравнение производительности и метрик#

При оценке этих моделей важно учитывать компромисс между средней точностью по всем классам (mAP) и вычислительной стоимостью, измеряемой во FLOPs и задержке инференса. В таблице ниже приведены основные показатели моделей PP-YOLOE+ и RTDETRv2 разных размеров.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

RTDETRv2 обеспечивает высокую mAP, но требует больше параметров и FLOPs. Разработчики, которые хотят развернуть модель на компактных edge-устройствах, часто сталкиваются с узкими местами из-за высокого потребления памяти, характерного для слоев Transformer.

Сценарии использования и рекомендации#

Выбирай между PP-YOLOE+ и RT-DETR с учетом требований конкретного проекта, ограничений развертывания и предпочтительной экосистемы.

Когда выбирать PP-YOLOE+#

PP-YOLOE+ — хороший выбор для:

  • Интеграция с экосистемой PaddlePaddle: Организации с готовой инфраструктурой на базе фреймворка и инструментов PaddlePaddle от Baidu.
  • Развертывание на периферийных устройствах с Paddle Lite: Развертывание на оборудовании со специально оптимизированными ядрами инференса для Paddle Lite или движка инференса Paddle.
  • Обнаружение объектов на сервере с высокой точностью: Сценарии, где приоритетом является максимальная точность обнаружения на мощных серверах с GPU, а зависимость от конкретного фреймворка не имеет значения.

Когда выбрать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
  • Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:

  • Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
  • Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
  • Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.

Преимущества Ultralytics: знакомство с YOLO26#

PP-YOLOE+ и RTDETRv2 стали важными вехами, однако современным разработчикам нужна экосистема, которая идеально сочетает высокую производительность с удобством использования. Именно это предлагают платформа Ultralytics и прорывная модель YOLO26.

Выпущенная в январе 2026 года YOLO26 устанавливает новый стандарт в области компьютерного зрения с приоритетом edge-устройств. Модель элегантно решает проблемы развертывания, связанные со старыми архитектурами, и при этом превосходит их по скорости и точности.

Архитектурные инновации#

YOLO26 предлагает ряд передовых улучшений, благодаря которым превосходит традиционные CNN и ресурсоемкие Transformer-модели:

  • Сквозная архитектура без NMS: Как и RTDETRv2, YOLO26 поддерживает встроенный сквозной инференс. Пропуская постобработку с подавлением немаксимумов (NMS) благодаря необязательной голове «один к одному» (nms=False), модель упрощает развертывание, снижает задержку и ее колебания — это идеальный вариант для робототехники и автономных систем, работающих в реальном времени.
  • Инференс на CPU быстрее до 43%: Благодаря глубокой оптимизации архитектуры YOLO26 значительно превосходит конкурирующие модели на edge-устройствах без дискретных GPU, что делает ее оптимальным выбором для IoT и приложений умного города.
  • Оптимизатор MuSGD: Вдохновленная новыми подходами к обучению LLM, YOLO26 использует гибрид SGD и Muon. Это обеспечивает более стабильную динамику обучения и заметно ускоряет сходимость, значительно сокращая время обучения на GPU.
  • ProgLoss + STAL: Эти продвинутые функции потерь значительно улучшают распознавание мелких объектов — задачу, с которой модели вроде PP-YOLOE+ традиционно справляются хуже. Это особенно важно для аэрофотоснимков и приложений с дронами.
  • Удаление DFL: Удаление Distribution Focal Loss упрощает процесс экспорта и обеспечивает совместимость с различными edge-устройствами и устройствами с низким энергопотреблением.
Универсальность для разных задач

В отличие от специализированных детекторов объектов, YOLO26 отличается универсальностью и поддерживает сегментацию экземпляров, оценку позы, классификацию и повернутые ограничивающие рамки (OBB). Модель включает специальные улучшения, такие как RLE для оценки позы и специализированная функция потерь для углов OBB.

Непревзойдённое удобство использования#

Один из главных недостатков сложных архитектур, таких как RTDETRv2, — высокий порог освоения и разрозненные процессы интеграции. Экосистема Ultralytics полностью скрывает эти сложности за интуитивно понятным API Python и полнофункциональной веб-платформой.

Будь то обучение на собственных наборах данных или быстрый инференс, процесс проходит без лишних сложностей:

from ultralytics import RTDETR, YOLO

# Инициализируй современную модель YOLO26
model_yolo = YOLO("yolo26n.pt")

# Или инициализируй модель RT-DETR через тот же простой API
model_rtdetr = RTDETR("rtdetr-l.pt")

# Легко запускай инференс в реальном времени
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()

# Экспортируй модель для развертывания на edge-устройстве одной строкой
model_yolo.export(format="engine", quantize=16)

Модели Ultralytics YOLO обычно требуют меньше памяти, поэтому по сравнению с аналогами на базе Transformer ты можешь быстрее обучать их и развертывать на более дешевом оборудовании. Кроме того, активная разработка и документация мирового уровня помогают поддерживать стабильность рабочих конвейеров.

Если ты рассматриваешь альтернативы, YOLO11 остается хорошо поддерживаемой и очень мощной предшественницей в экосистеме — она отлично подходит в качестве базовой модели для интеграции с устаревшим оборудованием. Также тебе может пригодиться наше сравнение YOLO11 и RT-DETR.

Итоги#

PP-YOLOE+ и RTDETRv2 внесли значительный вклад в развитие компьютерного зрения, продемонстрировав перспективность продвинутых конвейеров CNN и Transformer-моделей для работы в реальном времени соответственно. Однако организациям, которые в 2026 году хотят развертывать надежные, универсальные и высокооптимизированные приложения компьютерного зрения, Ultralytics YOLO26 предлагает непревзойденное решение. Необязательный инференс без NMS, значительно более быстрый инференс на CPU и простая экосистема позволяют разработчикам быстрее, чем когда-либо, перейти от идеи к масштабируемому промышленному внедрению.

Комментарии