Ultralytics YOLO27:
Get Started

RTDETRv2 и DAMO-YOLO#

Компьютерное зрение постоянно развивается: исследователи и инженеры стремятся создавать модели, в которых оптимально сочетаются скорость, точность и эффективность. Среди заметных архитектур в этой области — RTDETRv2, разработанная Baidu, и DAMO-YOLO, созданная Alibaba Group. Обе модели расширяют границы возможностей обнаружения объектов в реальном времени, но достигают впечатляющих результатов, опираясь на принципиально разные архитектурные подходы.

В этом техническом сравнении мы подробно рассмотрим архитектуры моделей, методы обучения и возможности развертывания в реальных условиях. Также мы сравним модели с более широкой экосистемой, в частности с высокооптимизированной платформой Ultralytics и современной архитектурой YOLO26.

Архитектурные инновации#

Инженерам по машинному обучению, которым нужно выбрать подходящий инструмент для производственной среды, важно понимать основные принципы работы этих моделей.

RTDETRv2: подход на основе Transformer#

Опираясь на успех оригинальной RT-DETR, RTDETRv2 использует гибридный энкодер и декодер Transformer. Благодаря такой конструкции модель эффективно обрабатывает глобальный контекст и особенно хорошо различает перекрывающиеся объекты в плотных сценах. Главное преимущество этой архитектуры — встроенная конструкция без NMS (подавления немаксимумов). Устранение этапа постобработки NMS упрощает конвейер инференса и обеспечивает более стабильную задержку на разных конфигурациях оборудования.

Узнай больше о RTDETRv2

DAMO-YOLO: повышение эффективности CNN#

DAMO-YOLO, напротив, продолжает успешную линию моделей YOLO на основе CNN, но предлагает несколько новаторских улучшений. Для оптимизации бэкбона и повышения эффективности извлечения признаков модель использует поиск архитектуры нейронной сети (NAS). Кроме того, в ней применяются эффективные RepGFPN (обобщённая пирамидальная сеть признаков с перепараметризацией) и архитектура ZeroHead, а также AlignedOTA и методы улучшения дистилляции. Благодаря этим нововведениям DAMO-YOLO обеспечивает быстрый инференс и сохраняет высококонкурентный показатель mAPval.

Узнай больше о DAMO-YOLO

Различия в архитектуре

RTDETRv2 использует механизмы внимания для глобального понимания признаков без NMS, тогда как DAMO-YOLO повышает эффективность традиционной CNN с помощью NAS и усовершенствованной дистилляции. Для DAMO-YOLO требуется стандартная постобработка, но на некоторых устройствах модель обеспечивает заметное преимущество в скорости.

Сравнение производительности и метрик#

При оценке моделей для развертывания ключевое значение имеют такие метрики производительности, как средняя точность (mAP), скорость инференса и количество параметров. Ниже приведено подробное сравнение двух семейств моделей.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Анализ результатов#

Как видно из таблицы, RTDETRv2-x обеспечивает наивысшую точность: mAPval составляет 54.3. Это демонстрирует преимущества архитектуры Transformer при проверке на сложных наборах данных, таких как COCO. Однако за это приходится платить значительно большим количеством параметров (76M) и операций с плавающей точкой.

В свою очередь, DAMO-YOLOt (Tiny) отличается исключительно компактными размерами: модели требуется всего 8.5M параметров. Это очень быстрый вариант для сред с жёсткими ограничениями на объём памяти CUDA. DAMO-YOLO обычно обеспечивает выгодный компромисс между скоростью и точностью для устаревших периферийных устройств.

Экосистема, удобство использования и преимущества Ultralytics#

Хотя независимые репозитории, такие как официальный RT-DETR на GitHub и DAMO-YOLO на GitHub, предоставляют исходный код для обучения этих моделей, их интеграция в производственные конвейеры часто требует большого объёма шаблонного кода и ручной оптимизации.

Именно здесь экосистема Ultralytics значительно упрощает работу разработчиков. Ultralytics интегрирует детекторы на основе Transformer, в том числе оригинальную модель RT-DETR, непосредственно в единый API. Благодаря этому пользователи могут обучать, проверять и экспортировать модели одной строкой кода. Кроме того, по сравнению с отдельными тяжёлыми репозиториями моделей на основе Transformer модели Ultralytics известны низким потреблением памяти при обучении.

Пример кода: простая интеграция#

Вот как легко запустить инференс с помощью библиотеки Ultralytics для Python. API остаётся одинаковым и для модели Transformer, и для современной CNN.

from ultralytics import RTDETR, YOLO

# Загрузка модели RT-DETR для понимания сложных сцен
model_rtdetr = RTDETR("rtdetr-l.pt")

# Загрузка новейшей модели Ultralytics YOLO26 для максимальной производительности на периферийных устройствах
model_yolo26 = YOLO("yolo26n.pt")

# Простой запуск инференса на тестовом изображении
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Отобрази результаты
results_yolo[0].show()
Экспорт моделей для производственной среды

С помощью API Ultralytics ты можешь без проблем экспортировать обученные модели в такие форматы, как TensorRT, ONNX или CoreML, выполнив простую команду model.export(format="engine"). Это значительно упрощает развертывание.

Оптимальные сценарии применения#

Выбор между этими архитектурами полностью зависит от конкретных требований проекта:

  • RTDETRv2 отлично подходит для обработки на сервере с большим объёмом видеопамяти. Глобальное понимание контекста идеально подходит для анализа медицинских изображений и плотных скоплений людей, где часто возникают перекрытия объектов.
  • DAMO-YOLO отлично подходит для встроенных IoT-приложений и высокоскоростных промышленных линий контроля, где необходимы небольшое число параметров и высокая частота кадров.

Будущее: Ultralytics YOLO26#

У RTDETRv2 и DAMO-YOLO есть свои преимущества, но компьютерное зрение развивается стремительно. Для новых проектов новейшая Ultralytics YOLO26 — оптимальное сочетание скорости, точности и удобства для разработчиков.

YOLO26 использует сквозную архитектуру без NMS, обеспечивая главное преимущество Transformer без огромных вычислительных затрат. В модели применяется инновационный оптимизатор MuSGD, созданный под влиянием методов обучения больших языковых моделей, что обеспечивает стабильную и быструю сходимость. Кроме того, благодаря отказу от DFL (удалению Distribution Focal Loss для упрощения экспорта и повышения совместимости с периферийными устройствами и устройствами с низким энергопотреблением) инференс YOLO26 на CPU выполняется до 43% быстрее. Это делает модель бесспорным лидером в области периферийных вычислений. Также ProgLoss + STAL улучшает функции потерь и распознавание мелких объектов, что особенно важно для IoT, робототехники и аэрофотосъёмки.

В отличие от моделей, ограниченных исключительно ограничивающими рамками, семейство YOLO26 отличается непревзойдённой универсальностью и поддерживает задачи от сегментации экземпляров и оценки позы до ориентированных ограничивающих рамок (OBB). Все задачи можно легко выполнять с помощью интуитивно понятной платформы Ultralytics.

Сведения о моделях и источники#

RTDETRv2#

DAMO-YOLO#

Если хочешь изучить другие сравнения, ознакомься с нашими руководствами RTDETRv2 и YOLO11 или DAMO-YOLO и YOLOv8, чтобы узнать, как эти модели показывают себя на фоне предыдущих поколений семейства Ultralytics.

Комментарии