Ultralytics YOLO27:
Get Started

RTDETRv2 и PP-YOLOE+#

Стремительное развитие компьютерного зрения привело к появлению разных архитектурных подходов к решению сложных задач обнаружения объектов в реальном времени. Среди наиболее значимых недавних достижений — RTDETRv2 и PP-YOLOE+: две мощные модели, основанные на принципиально разных подходах к распознаванию изображений. Обе модели нацелены на высокую производительность обнаружения объектов, однако их внутренняя механика, методы обучения и оптимальные сценарии развёртывания значительно различаются.

В этом подробном руководстве рассматриваются технические особенности обеих моделей, сравниваются их архитектуры, показатели производительности и поддержка экосистемы, чтобы помочь разработчикам и исследователям выбрать оптимальное решение для конкретных задач развёртывания.

Обзор моделей#

Перед анализом показателей производительности важно понять происхождение и архитектурные цели каждой модели. Обе созданы исследовательскими группами Baidu, но представляют разные направления развития семейства моделей обнаружения объектов.

RTDETRv2#

RTDETRv2 — значительный шаг вперёд в архитектурах компьютерного зрения на базе Transformer. Развивая оригинальную модель Transformer для обнаружения объектов в реальном времени, она сочетает магистральную сеть CNN с эффективным гибридным кодировщиком и декодировщиком Transformer. Её главная отличительная особенность — изначально сквозное предсказание, полностью устраняющее необходимость в подавлении немаксимумов (NMS) на этапе постобработки.

Узнай больше о RTDETRv2

PP-YOLOE+#

PP-YOLOE+ — усовершенствованная версия серии YOLO, оптимизированная для высокопроизводительных промышленных задач. Модель отличается масштабируемой архитектурой CNN с безъякорной головой обнаружения. Она обеспечивает исключительный баланс скорости и точности и использует такие мощные методы, как ET-head и обобщённая функция фокальных потерь, для улучшения обнаружения небольших объектов.

Узнай больше о PP-YOLOE+

Интеграция в экосистему

У обеих моделей есть отдельные исследовательские репозитории, но ты можешь легко экспериментировать с оригинальной RT-DETR прямо в пакете Ultralytics Python, используя единый API и упрощённые возможности экспорта.

Архитектурные различия#

Принципиальное различие между этими двумя моделями заключается в способе обработки визуального контекста и генерации предсказаний.

PP-YOLOE+ использует традиционную, но хорошо оптимизированную магистральную сеть — свёрточную нейронную сеть (CNN). Она извлекает признаки, опираясь на локальные рецептивные поля, благодаря чему чрезвычайно быстро и эффективно работает при стандартном развёртывании. Однако для фильтрации перекрывающихся ограничивающих рамок ей всё ещё требуется стандартная постобработка с NMS, которая может создавать узкие места и увеличивать задержку в сценах с высокой плотностью объектов.

В отличие от неё, RTDETRv2 использует гибридный кодировщик и декодировщик Transformer. Это позволяет модели одновременно учитывать глобальный контекст всего изображения. Механизмы внимания по своей природе учитывают взаимосвязи между объектами, поэтому модель может напрямую выдавать итоговые ограничивающие рамки без NMS. Благодаря такому сквозному подходу задержка инференса остаётся стабильной независимо от количества обнаруженных объектов.

Показатели и сравнение производительности#

При оценке показателей производительности YOLO важно сопоставлять точность (mAP) с вычислительными затратами (FLOPs) и скоростью инференса. В таблице ниже сравнивается производительность обеих моделей разных размеров.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Хотя PP-YOLOE+x показывает немного более высокий показатель mAPval — 54,7% на наборе данных COCO, модели RTDETRv2 в целом обеспечивают сопоставимую точность и более стабильную задержку благодаря архитектуре без NMS. Однако у PP-YOLOE+ есть явное преимущество по количеству параметров и FLOPs в моделях меньшего размера, что делает её очень эффективной при развёртывании на периферийных устройствах.

Преимущества Ultralytics: знакомство с YOLO26#

RTDETRv2 и PP-YOLOE+ сами по себе — мощные модели, но передовые разработки продолжаются. Разработчикам, которым нужен оптимальный баланс скорости, точности и поддержки экосистемы, Ultralytics YOLO26 предлагает новый отраслевой стандарт.

YOLO26 объединяет лучшие качества CNN и Transformer. В ней предусмотрен опциональный режим инференса без NMS со сквозной архитектурой (nms=False), впервые применённый в современных архитектурах; при включении он устраняет узкие места на этапе постобработки. Кроме того, модель представляет революционный оптимизатор MuSGD — гибридный подход, вдохновлённый новыми методами обучения LLM, который обеспечивает высокую стабильность обучения и быструю сходимость.

Оптимизация для периферийных устройств

В отличие от ресурсоёмких моделей Transformer, требующих значительного объёма CUDA-памяти, YOLO26 использует удаление DFL (Distribution Focal Loss) и специально оптимизирована для периферийных вычислений, обеспечивая инференс на CPU до 43% быстрее, чем модели предыдущих поколений.

Кроме того, возможности YOLO26 не ограничиваются простым обнаружением объектов. Модель изначально универсальна и поддерживает сегментацию экземпляров, оценку позы и ориентированные ограничивающие рамки (OBB), тогда как PP-YOLOE+ предназначена преимущественно для обнаружения объектов по ограничивающим рамкам.

Методики обучения и экосистема#

По сравнению с отдельными исследовательскими репозиториями, преимущества экосистемы Ultralytics особенно заметны в эффективности обучения и простоте использования. PP-YOLOE+ использует фреймворк PaddlePaddle, а для RTDETRv2 часто нужна сложная настройка среды. Интеграция моделей через Ultralytics обеспечивает удобную работу.

API Ultralytics снижает требования к памяти при обучении, автоматизирует работу с наборами данных и упрощает настройку гиперпараметров. Кроме того, для развёртывания в промышленной среде достаточно одной команды, чтобы экспортировать модели в такие форматы, как ONNX или TensorRT.

Пример кода: упрощённый инференс#

Ниже показано, как легко использовать RT-DETR вместе с рекомендуемой моделью YOLO26 с помощью пакета Ultralytics Python:

from ultralytics import RTDETR, YOLO

# Инициализировать модель RT-DETR (Ultralytics поддерживает оригинальные RT-DETR-L и RT-DETR-X)
model_rtdetr = RTDETR("rtdetr-l.pt")

# Выполнить инференс без NMS на тестовом изображении
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()

# Для высокой скорости и универсальности инициализировать новейшую модель YOLO26
model_yolo26 = YOLO("yolo26n.pt")

# Легко обучить модель YOLO26 с оптимизированным использованием памяти
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)

# Экспорт в TensorRT для развертывания на периферийных устройствах
model_yolo26.export(format="engine")

Применение и примеры использования в реальных условиях#

Выбор между этими архитектурами часто зависит от конкретного оборудования и требований приложения.

  • RTDETRv2 отлично подходит для серверных сред и понимания сложных сцен. Механизм глобального внимания делает его весьма эффективным для управления толпой и плотного анализа медицинских изображений, где перекрывающиеся объекты обычно приводят к сбоям стандартных алгоритмов NMS.
  • PP-YOLOE+ отлично подходит для высокоскоростного промышленного контроля и сред, активно использующих экосистему PaddlePaddle. Небольшое число параметров в компактных версиях позволяет применять модель в некоторых задачах робототехники.
  • Ultralytics YOLO26 — универсальное рекомендуемое решение для комплексного коммерческого развертывания. Благодаря улучшенным функциям ProgLoss + STAL модель значительно лучше распознаёт мелкие объекты, что особенно важно для работы аэродронов и мониторинга дорожного движения в умных городах.

Сценарии использования и рекомендации#

Выбор между RT-DETR и PP-YOLOE+ зависит от конкретных требований проекта, ограничений развертывания и предпочтительной экосистемы.

Когда выбрать RT-DETR#

RT-DETR — отличный выбор для:

  • Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
  • Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.

Когда выбирать PP-YOLOE+#

PP-YOLOE+ рекомендуется в следующих случаях:

  • Интеграция с экосистемой PaddlePaddle: Организации с готовой инфраструктурой на базе фреймворка и инструментов PaddlePaddle от Baidu.
  • Развертывание на периферийных устройствах с Paddle Lite: Развертывание на оборудовании со специально оптимизированными ядрами инференса для Paddle Lite или движка инференса Paddle.
  • Обнаружение объектов на сервере с высокой точностью: Сценарии, где приоритетом является максимальная точность обнаружения на мощных серверах с GPU, а зависимость от конкретного фреймворка не имеет значения.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:

  • Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
  • Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
  • Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.

Заключение#

И RTDETRv2, и PP-YOLOE+ расширили границы возможного в компьютерном зрении, доказав жизнеспособность как архитектур Transformer, так и высокооптимизированных архитектур CNN. Однако сложность развертывания разрозненных исследовательских кодовых баз может замедлить выход продукта в производство.

Для современных инженеров в области ИИ использование платформы Ultralytics даёт непревзойдённое преимущество. Перейдя на модели с бесшовной интеграцией, такие как YOLO11 или передовая YOLO26, команды могут добиться максимально возможного соотношения точности и скорости, значительно сократив требования к памяти и затраты на разработку.

Комментарии