Ultralytics YOLO27:

PP-YOLOE+ и RTDETRv2#

В последние годы область компьютерного зрения претерпела стремительные изменения, особенно в сфере обнаружения объектов в реальном времени. Выбор правильной архитектуры для развёртывания может стать решающим фактором между медленным приложением с высоким потреблением памяти и высокооптимизированной отзывчивой системой. В этом техническом сравнении мы рассмотрим две заметные модели от Baidu: PP-YOLOE+ на основе CNN и RTDETRv2 на основе Transformer. Мы проанализируем их архитектуры, показатели производительности и оптимальные сценарии использования, а также сравним их с передовой платформой Ultralytics YOLO26.

PP-YOLOE+: развитие парадигмы CNN#

Разработанная как итерация предыдущих версий, PP-YOLOE+ расширяет возможности традиционных свёрточных нейронных сетей (CNN) в обнаружении объектов. Это высокопроизводительный детектор без якорей, основанный на фундаментальных принципах серии YOLO и дополненный специальными оптимизациями для экосистемы PaddlePaddle.

Сведения о модели:

Архитектура и методики#

PP-YOLOE+ использует тщательно оптимизированный backbone и специализированную пирамиду признаков для эффективного объединения признаков разных масштабов. В ней применяется архитектура без якорей, упрощающая эвристическую настройку, обычно необходимую для генерации anchor box. Кроме того, методика обучения включает продвинутые стратегии назначения меток, которые помогают лучше сопоставлять предсказания с эталонными рамками на этапе обучения.

Преимущества и сценарии использования#

Главное преимущество PP-YOLOE+ — стабильная производительность на стандартном серверном оборудовании и глубокая интеграция с инструментами Baidu. Модель хорошо подходит для традиционных промышленных процессов, таких как статическое обнаружение дефектов на производстве, где ограничения оборудования не слишком существенны.

Узнай больше о PP-YOLOE+

Особенности экосистемы

Хотя PP-YOLOE+ обеспечивает высокую точность, его развёртывание за пределами родной экосистемы иногда требует дополнительных этапов конвертации, в отличие от встроенных форматов экспорта, доступных в современных конвейерах Ultralytics.

RTDETRv2: Transformer-модели обнаружения в реальном времени#

Отходя от чистых CNN, RTDETRv2 (Transformer для обнаружения объектов в реальном времени, версия 2) представляет переход к механизмам на основе внимания для задач компьютерного зрения. Модель стремится объединить способность Transformer учитывать глобальный контекст с низкой задержкой, необходимой для реальных приложений.

Сведения о модели:

Архитектура и методики#

RTDETRv2 использует гибридную архитектуру, объединяющую backbone на основе CNN для извлечения признаков с оптимизированным encoder-decoder на основе Transformer. Отличительная особенность RTDETRv2 — встроенная сквозная архитектура, исключающая традиционную постобработку с подавлением немаксимумов (NMS). В модели также реализованы такие возможности, как обнаружение объектов разных масштабов и обработка сложных сцен, с применением self-attention для анализа пространственных связей между удалёнными объектами.

Преимущества и сценарии использования#

Архитектура Transformer делает RTDETRv2 особенно эффективной в сценариях, где важно понимание глобального контекста. Однако модели Transformer обычно требуют значительно больше памяти CUDA как при обучении, так и при инференсе по сравнению с лёгкими CNN. Модель лучше всего подходит для сред без существенных ограничений по оборудованию, например для облачной аналитики видео на мощных GPU-серверах.

Сравнение производительности и метрик#

При оценке этих моделей первостепенное значение имеет компромисс между средней точностью (mAP) и вычислительными затратами, измеряемыми во FLOPs и задержке инференса. В таблице ниже представлены основные метрики для различных масштабов PP-YOLOE+ и RTDETRv2.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Хотя RTDETRv2 демонстрирует высокий mAP за счёт большего числа параметров и FLOPs, разработчики, стремящиеся развернуть модель на устройствах периферийных вычислений с ограниченными ресурсами, часто сталкиваются с узкими местами из-за значительных требований к памяти, типичных для слоёв Transformer.

Варианты применения и рекомендации#

Выбор между PP-YOLOE+ и RT-DETR зависит от конкретных требований проекта, ограничений развёртывания и предпочтений в отношении экосистемы.

Когда выбирать PP-YOLOE+#

PP-YOLOE+ — хороший выбор для:

  • Интеграция с экосистемой PaddlePaddle: Организации с существующей инфраструктурой, построенной на фреймворке и инструментах PaddlePaddle от Baidu.
  • Развертывание на периферийных устройствах с Paddle Lite: Развертывание на оборудовании с высокооптимизированными ядрами инференса, специально предназначенными для Paddle Lite или механизма инференса Paddle.
  • Высокоточное обнаружение на сервере: Сценарии, в которых приоритетом является максимальная точность обнаружения на мощных GPU-серверах, а зависимость от фреймворка не имеет значения.

Когда стоит выбрать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
  • Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Преимущество Ultralytics: знакомство с YOLO26#

Хотя PP-YOLOE+ и RTDETRv2 стали важными этапами развития, современному разработчику нужна экосистема, идеально сочетающая максимальную производительность и удобство использования. Платформа Ultralytics и революционная модель YOLO26 предлагают именно это.

Выпущенная в январе 2026 года, YOLO26 устанавливает новый стандарт для vision AI с приоритетом периферийных устройств. Она элегантно решает проблемы развёртывания, связанные с устаревшими архитектурами, превосходя их как по скорости, так и по точности.

Архитектурные инновации#

YOLO26 представляет несколько инновационных улучшений, превосходящих традиционные CNN и тяжёлые Transformer:

  • Сквозная архитектура без NMS: Как и RTDETRv2, YOLO26 изначально построена как сквозная модель. Устраняя постобработку с подавлением немаксимумов (NMS), она обеспечивает более быстрое и простое развёртывание с меньшим разбросом задержки, что идеально подходит для робототехники в реальном времени и автономных систем.
  • До 43% более быстрый инференс на CPU: Благодаря глубокой оптимизации архитектуры YOLO26 значительно превосходит конкурирующие модели на периферийных устройствах без дискретных GPU, что делает её оптимальным выбором для приложений IoT и умных городов.
  • Оптимизатор MuSGD: Вдохновлённая инновациями в обучении LLM, YOLO26 использует комбинацию SGD и Muon. Это обеспечивает более стабильную динамику обучения и значительно более быструю сходимость, существенно сокращая время обучения на GPU.
  • ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание небольших объектов — области, в которой такие модели, как PP-YOLOE+, традиционно испытывают трудности, — что особенно важно для аэрофотоснимков и приложений с дронами.
  • Удаление DFL: Удаление Distribution Focal Loss упрощает процесс экспорта и обеспечивает бесшовную совместимость с различными периферийными устройствами и устройствами с низким энергопотреблением.
Универсальность для конкретных задач

В отличие от специализированных детекторов объектов, YOLO26 отличается высокой универсальностью и поддерживает сегментацию экземпляров, оценку позы, классификацию и ориентированные ограничивающие рамки (OBB). В неё входят специализированные улучшения, такие как RLE для Pose и специальная функция потерь угла для OBB.

Непревзойдённая простота использования#

Один из главных недостатков использования сложных архитектур, таких как RTDETRv2, — крутая кривая обучения и разрозненные процессы интеграции. Экосистема Ultralytics полностью абстрагирует эти сложности благодаря интуитивно понятному API Python и комплексной веб-платформе.

Будь то обучение на пользовательских датасетах или быстрый инференс, процесс проходит без лишних сложностей:

from ultralytics import RTDETR, YOLO

# Initialize the state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Alternatively, initialize an RT-DETR model via the same simple API
model_rtdetr = RTDETR("rtdetr-l.pt")

# Run real-time inference effortlessly
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()

# Export for edge deployment in one line
model_yolo.export(format="engine", quantize=16)

Типичные для моделей Ultralytics YOLO более низкие требования к памяти позволяют быстрее обучать модели и развёртывать их на более доступном оборудовании по сравнению с аналогами на основе Transformer. Кроме того, активная разработка и документация мирового уровня помогают поддерживать стабильность производственных конвейеров.

Для команд, ищущих альтернативы, YOLO11 остается отличной поддерживаемой и исключительно мощной предшественницей в экосистеме, обеспечивающей прекрасную основу для интеграции со старым оборудованием. Тебе также может пригодиться наше сравнение YOLO11 vs RT-DETR.

Итоги#

PP-YOLOE+ и RTDETRv2 внесли значительный вклад в развитие компьютерного зрения, продемонстрировав жизнеспособность передовых конвейеров на основе CNN и Transformer реального времени соответственно. Однако для организаций, стремящихся в 2026 году развёртывать надёжные, универсальные и высокооптимизированные приложения компьютерного зрения, Ultralytics YOLO26 предлагает непревзойдённое решение. Её нативная архитектура без NMS, значительно более быстрый инференс на CPU и оптимизированная экосистема позволяют разработчикам быстрее, чем когда-либо, переходить от идеи к масштабируемому производству.

Комментарии