Ultralytics YOLO27:

Сравнение RTDETRv2 и YOLOv5#

Развитие компьютерного зрения в значительной степени определялось непрерывным стремлением сбалансировать точность и скорость инференса в реальном времени. При сравнении RTDETRv2 и Ultralytics YOLOv5 разработчики фактически сопоставляют сложные возможности архитектур Transformer по работе с глобальным контекстом с высокооптимизированной, проверенной в реальных задачах эффективностью свёрточных нейронных сетей (CNNs).

В этом руководстве представлен подробный технический анализ двух заметных архитектур с описанием их показателей производительности, методик обучения, требований к памяти и оптимальных сценариев развёртывания, чтобы помочь тебе выбрать лучшую модель детектирования объектов для конкретного варианта использования.

RTDETRv2: трансформерный подход к обнаружению объектов в реальном времени#

Развивая исходный Real-Time Detection Transformer (RT-DETR), RTDETRv2 внедряет ряд «бесплатных улучшений» для совершенствования базовой архитектуры без увеличения задержки инференса.

Архитектура и возможности#

RTDETRv2 использует гибридную архитектуру CNN-Transformer. CNN выступает в роли магистральной сети для извлечения детализированных визуальных признаков, а слои кодировщика и декодировщика Transformer обрабатывают всю карту признаков, чтобы понять глобальный контекст. Важной особенностью RTDETRv2 является сквозная обработка, полностью устраняющая необходимость в постобработке подавления немаксимумов (NMS).

Несмотря на впечатляющую точность RTDETRv2, особенно в сложных плотных сценах с перекрывающимися объектами, у него есть заметные компромиссы. Механизм внимания, характерный для архитектур Transformer, требует значительно больше памяти CUDA во время обучения по сравнению со стандартными CNN. Кроме того, хотя модель хорошо работает на производительных GPU, таких как NVIDIA A100 или T4, на стандартных CPU её архитектура заметно медленнее, а на ограниченных edge-устройствах её возможности существенно снижены.

Узнай больше о RTDETRv2

Ultralytics YOLOv5: отраслевой стандарт эффективности#

После выпуска Ultralytics YOLOv5 кардинально изменила ландшафт прикладного машинного обучения, сделав высокопроизводительное компьютерное зрение доступным разработчикам по всему миру благодаря исключительно интуитивно понятному фреймворку.

Экосистема и баланс производительности#

YOLOv5 полностью построена на фреймворке PyTorch и использует исключительно эффективную архитектуру CNN. Она была разработана с нуля с акцентом на простоту использования, имеет оптимизированный API и одну из наиболее обширных коллекций документации в индустрии AI.

Главное преимущество YOLOv5 — непревзойдённая универсальность и низкие требования к памяти. Для обучения модели YOLOv5 требуется значительно меньше VRAM, чем для моделей на базе Transformer, поэтому она доступна исследователям и инженерам с ограниченным бюджетом на оборудование. Кроме того, если RTDETRv2 ориентирована исключительно на детектирование ограничивающих рамок, YOLOv5 превратилась в универсальный инструмент с поддержкой сегментации экземпляров и классификации изображений.

Управление моделями для предприятий

Чтобы воспользоваться максимально оптимизированным рабочим процессом, ты можешь обучать, валидировать и развёртывать YOLOv5 напрямую через Ultralytics Platform. Платформа предоставляет возможности облачного обучения и конвейеры развёртывания без написания кода.

Сравнение производительности и метрик#

При анализе производительности на стандартном датасете COCO мы видим чёткие различия в приоритетах этих моделей при распределении ресурсов.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Анализ компромиссов#

Данные показывают, что RTDETRv2-x достигает максимальной средней точности (mAP) 54,3%, немного превосходя показатель YOLOv5x в 50,7%. Однако этот небольшой прирост точности достигается ценой огромных вычислительных затрат. YOLOv5x работает с меньшей задержкой (11,89 мс против 15,03 мс в TensorRT) и требует лишь малой доли объёма памяти. Для развёртывания на edge-устройствах со сверхнизким энергопотреблением YOLOv5n (Nano) остаётся вне конкуренции: инференс занимает всего 1,12 мс при ничтожном количестве параметров — 2,6 млн, — на уровень, с которым RTDETRv2 даже не пытается конкурировать.

Эффективность обучения и простота кода#

Одна из ключевых сильных сторон экосистемы Ultralytics — унифицированный API. Даже если для конкретной ресурсоёмкой задачи ты решишь использовать архитектуру Transformer RT-DETR, сделать это можно полностью в пакете Ultralytics Python, бесшовно заменяя модели всего одной строкой кода.

from ultralytics import RTDETR, YOLO

# Load the Ultralytics YOLOv5 small model
model_yolo = YOLO("yolov5s.pt")

# Load the RT-DETR large model via Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")

# Train YOLOv5 effortlessly on your custom data
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference with both models seamlessly
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")

results_yolo[0].show()

Используя библиотеку Ultralytics, разработчики автоматически получают доступ к хорошо поддерживаемой экосистеме с интеграциями для отслеживания экспериментов (например, Weights & Biases и Comet ML) и экспортом одним нажатием в форматы развёртывания, такие как ONNX и OpenVINO.

Применение в реальных условиях и оптимальные сценарии использования#

Где RTDETRv2 особенно сильна#

RTDETRv2 лучше всего подходит для сред, где ограничения оборудования отсутствуют, а единственной целью является максимально возможная точность.

  • Медицинская визуализация на сервере: обнаружение микроскопических аномалий на рентгеновских снимках высокого разрешения.
  • Спутниковые изображения: отслеживание плотных перекрывающихся объектов в задачах воздушного наблюдения на мощных облачных кластерах.

Где YOLOv5 превосходит конкурентов#

YOLOv5 — безусловный чемпион практического развёртывания в реальных условиях на разнообразном оборудовании.

  • Периферийные AI-устройства: развёртывание систем охранной сигнализации на Raspberry Pi или устройствах NVIDIA Jetson с жёсткими ограничениями по памяти.
  • Мобильные приложения: выполнение быстрого инференса ограничивающих рамок и сегментации в реальном времени непосредственно на смартфонах через CoreML или TFLite.
  • Высокоскоростное промышленное производство: проверка деталей на быстрых производственных линиях, где задержка в миллисекундах критична для успешной работы.
Изучение других моделей Ultralytics

Хотя YOLOv5 — легендарная модель, экосистема Ultralytics постоянно расширяет границы AI. Если в 2026 году ты сравниваешь модели для нового проекта, стоит обратить внимание на передовую Ultralytics YOLO26. YOLO26 использует встроенный дизайн без NMS со сквозной обработкой (подобно Transformer, но со скоростью CNN), оснащена революционным оптимизатором MuSGD для исключительно стабильного обучения и обеспечивает инференс на CPU до 43% быстрее. В качестве альтернативы YOLO11 остаётся отличным вариантом с широкой поддержкой для универсальных сценариев развёртывания, требующих оценки позы и детектирования OBB.

В конечном счёте, хотя RTDETRv2 повышает предел точности благодаря слоям Transformer, фреймворк Ultralytics YOLO обеспечивает непревзойдённый баланс скорости, низких требований к памяти и превосходно спроектированного опыта разработчика, значительно сокращая путь от прототипа до промышленной эксплуатации.

Комментарии