YOLO Vision 2026:

RTDETRv2 против YOLOv5#

Эволюция компьютерного зрения во многом определялась непрекращающимся стремлением сбалансировать точность со скоростью инференса в реальном времени. Сравнивая RTDETRv2 и Ultralytics YOLOv5, разработчики по сути сопоставляют возможности сложных глобальных контекстов архитектур трансформеров с высоко оптимизированной, проверенной в боях эффективностью сверточных нейронных сетей (CNN).

Это руководство представляет собой глубокий технический анализ этих двух выдающихся архитектур, подробно описывая их показатели производительности, методологии обучения, требования к памяти и идеальные сценарии развертывания, чтобы помочь тебе выбрать лучшую модель обнаружения объектов для твоей конкретной задачи.

RTDETRv2: Трансформерный подход к детекции в реальном времени#

Основываясь на оригинальном Real-Time Detection Transformer (RT-DETR), RTDETRv2 внедряет ряд «бесплатных улучшений» (bag-of-freebies) для совершенствования базовой архитектуры без ущерба для задержки вывода.

  • Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
  • Организация: Baidu
  • Дата: 24.07.2024
  • Ссылки: Arxiv Paper, GitHub Repository

Архитектура и возможности#

RTDETRv2 использует гибридную архитектуру CNN-Transformer. CNN служит основой для извлечения мелкозернистых визуальных признаков, в то время как слои энкодера-декодера трансформера обрабатывают всю карту признаков для понимания глобального контекста. Главной отличительной чертой RTDETRv2 является ее сквозной (end-to-end) характер, который полностью устраняет необходимость в постобработке Non-Maximum Suppression (NMS).

Хотя RTDETRv2 достигает впечатляющей точности — особенно в сложных, плотных сценах с перекрывающимися объектами — она сопряжена с заметными компромиссами. Механизм внимания, присущий трансформерам, требует значительно больше памяти CUDA во время обучения по сравнению со стандартными CNN. Кроме того, хотя она хорошо работает на высокопроизводительных графических процессорах, таких как NVIDIA A100 или T4, ее архитектура заметно медленнее на стандартных CPU и сильно ограничена на периферийных устройствах (edge devices).

Узнай больше о RTDETRv2

Ultralytics YOLOv5: отраслевой стандарт эффективности#

Ultralytics YOLOv5 фундаментально изменил ландшафт прикладного машинного обучения после своего выхода, сделав высокопроизводительное компьютерное зрение доступным для разработчиков по всему миру благодаря исключительно интуитивно понятному фреймворку.

Баланс экосистемы и производительности#

YOLOv5 построена полностью на фреймворке PyTorch и опирается на чрезвычайно эффективную архитектуру CNN. Она была разработана с нуля для простоты использования, обладая оптимизированным API и одной из самых обширных документаций в индустрии искусственного интеллекта.

Самое большое преимущество YOLOv5 заключается в ее непревзойденной универсальности и низких требованиях к памяти. Обучение модели YOLOv5 требует значительно меньше видеопамяти (VRAM), чем модели на базе трансформеров, что делает ее доступной для исследователей и инженеров с ограниченным аппаратным бюджетом. Более того, в то время как RTDETRv2 фокусируется исключительно на обнаружении ограничивающих рамок (bboxes), YOLOv5 превратилась в универсальный инструмент, поддерживающий сегментацию экземпляров и классификацию изображений.

Управление корпоративными моделями

Чтобы ощутить максимальное удобство оптимизированного рабочего процесса, ты можешь обучать, валидировать и развертывать YOLOv5 напрямую с помощью Ultralytics Platform. Платформа предоставляет возможности облачного обучения и конвейеры развертывания без написания кода.

Узнай больше о YOLOv5

Сравнение производительности и метрик#

Анализируя сырую производительность на стандартном наборе данных COCO, мы можем увидеть четкие различия в том, как эти модели расставляют приоритеты ресурсов.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Анализ компромиссов#

Данные показывают, что RTDETRv2-x достигает пиковой средней точности (mAP) на уровне 54.3%, слегка превосходя показатели YOLOv5x (50.7%). Однако этот незначительный прирост точности дается огромной вычислительной ценой. YOLOv5x работает с меньшей задержкой (11.89 мс против 15.03 мс на TensorRT) и требует лишь малую долю памяти. Для сверхмощных периферийных развертываний с низким энергопотреблением YOLOv5n (Nano) остается вне конкуренции, выполняя инференс всего за 1.12 мс с крошечным объемом параметров в 2.6M — уровень, на котором RTDETRv2 даже не пытается конкурировать.

Эффективность обучения и простота кода#

Одна из ключевых сильных сторон экосистемы Ultralytics — это унифицированный API. Даже если ты решишь использовать архитектуру трансформера RT-DETR для конкретной задачи с интенсивными вычислениями, ты можешь сделать это полностью в рамках пакета Ultralytics Python, легко заменяя модели всего одной строкой кода.

from ultralytics import RTDETR, YOLO

# Load the Ultralytics YOLOv5 small model
model_yolo = YOLO("yolov5s.pt")

# Load the RT-DETR large model via Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")

# Train YOLOv5 effortlessly on your custom data
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference with both models seamlessly
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")

results_yolo[0].show()

Используя библиотеку Ultralytics, разработчики автоматически получают доступ к поддерживаемой экосистеме, включающей интеграции отслеживания экспериментов (такие как Weights & Biases и Comet ML) и экспорт в один клик в такие форматы развертывания, как ONNX и OpenVINO.

Реальные применения и идеальные сценарии использования#

Где RTDETRv2 блистает#

RTDETRv2 лучше всего подходит для сред, где нет аппаратных ограничений, а максимальная точность является единственной целью.

  • Медицинская визуализация на стороне сервера: обнаружение микроскопических аномалий на рентгеновских снимках высокого разрешения.
  • Спутниковые снимки: Отслеживание плотных, перекрывающихся объектов в задачах авиационного наблюдения на мощных облачных кластерах.

Где доминирует YOLOv5#

YOLOv5 — неоспоримый чемпион для практического развертывания в реальных условиях на самом разнообразном оборудовании.

  • Периферийные устройства Edge AI: Развертывание систем охранной сигнализации на устройствах Raspberry Pi или NVIDIA Jetson, где память строго ограничена.
  • Мобильные приложения: выполнение быстрого вывода для обнаружения объектов и сегментации в реальном времени прямо на смартфонах через CoreML или TFLite.
  • Высокоскоростное промышленное производство: инспекция деталей на быстрых производственных линиях, где миллисекундная задержка критически важна для успеха операций.
Изучение других моделей Ultralytics

Хотя YOLOv5 является легендарной моделью, экосистема Ultralytics постоянно раздвигает границы ИИ. Если ты сравниваешь модели для нового проекта в 2026 году, тебе стоит рассмотреть передовую Ultralytics YOLO26. YOLO26 включает нативный дизайн End-to-End NMS-Free Design (похожий на трансформеры, но со скоростью CNN), оснащен революционным оптимизатором MuSGD Optimizer для невероятно стабильного обучения и обеспечивает до 43% более быстрый инференс на CPU. В качестве альтернативы YOLO11 остается прекрасным, отлично поддерживаемым выбором для универсальных развертываний, требующих оценки позы и обнаружения OBB.

В конечном итоге, хотя RTDETRv2 поднимает планку точности с помощью слоев трансформера, фреймворк Ultralytics YOLO обеспечивает непревзойденный баланс скорости, низких требований к памяти и блестяще спроектированного опыта разработчика, что значительно сокращает время от прототипа до производства.

Комментарии