RTDETRv2 и DAMO-YOLO#
Компьютерное зрение постоянно развивается: исследователи и инженеры стремятся создавать модели, в которых оптимально сочетаются скорость, точность и эффективность. Среди заметных архитектур в этой области — RTDETRv2, разработанная Baidu, и DAMO-YOLO, созданная Alibaba Group. Обе модели расширяют границы возможностей обнаружения объектов в реальном времени, но достигают впечатляющих результатов, опираясь на принципиально разные архитектурные подходы.
В этом техническом сравнении мы подробно рассмотрим архитектуры моделей, методы обучения и возможности развертывания в реальных условиях. Также мы сравним модели с более широкой экосистемой, в частности с высокооптимизированной платформой Ultralytics и современной архитектурой YOLO26.
Архитектурные инновации#
Инженерам по машинному обучению, которым нужно выбрать подходящий инструмент для производственной среды, важно понимать основные принципы работы этих моделей.
RTDETRv2: подход на основе Transformer#
Опираясь на успех оригинальной RT-DETR, RTDETRv2 использует гибридный энкодер и декодер Transformer. Благодаря такой конструкции модель эффективно обрабатывает глобальный контекст и особенно хорошо различает перекрывающиеся объекты в плотных сценах. Главное преимущество этой архитектуры — встроенная конструкция без NMS (подавления немаксимумов). Устранение этапа постобработки NMS упрощает конвейер инференса и обеспечивает более стабильную задержку на разных конфигурациях оборудования.
DAMO-YOLO: повышение эффективности CNN#
DAMO-YOLO, напротив, продолжает успешную линию моделей YOLO на основе CNN, но предлагает несколько новаторских улучшений. Для оптимизации бэкбона и повышения эффективности извлечения признаков модель использует поиск архитектуры нейронной сети (NAS). Кроме того, в ней применяются эффективные RepGFPN (обобщённая пирамидальная сеть признаков с перепараметризацией) и архитектура ZeroHead, а также AlignedOTA и методы улучшения дистилляции. Благодаря этим нововведениям DAMO-YOLO обеспечивает быстрый инференс и сохраняет высококонкурентный показатель mAPval.
RTDETRv2 использует механизмы внимания для глобального понимания признаков без NMS, тогда как DAMO-YOLO повышает эффективность традиционной CNN с помощью NAS и усовершенствованной дистилляции. Для DAMO-YOLO требуется стандартная постобработка, но на некоторых устройствах модель обеспечивает заметное преимущество в скорости.
Сравнение производительности и метрик#
При оценке моделей для развертывания ключевое значение имеют такие метрики производительности, как средняя точность (mAP), скорость инференса и количество параметров. Ниже приведено подробное сравнение двух семейств моделей.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Анализ результатов#
Как видно из таблицы, RTDETRv2-x обеспечивает наивысшую точность: mAPval составляет 54.3. Это демонстрирует преимущества архитектуры Transformer при проверке на сложных наборах данных, таких как COCO. Однако за это приходится платить значительно большим количеством параметров (76M) и операций с плавающей точкой.
В свою очередь, DAMO-YOLOt (Tiny) отличается исключительно компактными размерами: модели требуется всего 8.5M параметров. Это очень быстрый вариант для сред с жёсткими ограничениями на объём памяти CUDA. DAMO-YOLO обычно обеспечивает выгодный компромисс между скоростью и точностью для устаревших периферийных устройств.
Экосистема, удобство использования и преимущества Ultralytics#
Хотя независимые репозитории, такие как официальный RT-DETR на GitHub и DAMO-YOLO на GitHub, предоставляют исходный код для обучения этих моделей, их интеграция в производственные конвейеры часто требует большого объёма шаблонного кода и ручной оптимизации.
Именно здесь экосистема Ultralytics значительно упрощает работу разработчиков. Ultralytics интегрирует детекторы на основе Transformer, в том числе оригинальную модель RT-DETR, непосредственно в единый API. Благодаря этому пользователи могут обучать, проверять и экспортировать модели одной строкой кода. Кроме того, по сравнению с отдельными тяжёлыми репозиториями моделей на основе Transformer модели Ultralytics известны низким потреблением памяти при обучении.
Пример кода: простая интеграция#
Вот как легко запустить инференс с помощью библиотеки Ultralytics для Python. API остаётся одинаковым и для модели Transformer, и для современной CNN.
from ultralytics import RTDETR, YOLO
# Загрузка модели RT-DETR для понимания сложных сцен
model_rtdetr = RTDETR("rtdetr-l.pt")
# Загрузка новейшей модели Ultralytics YOLO26 для максимальной производительности на периферийных устройствах
model_yolo26 = YOLO("yolo26n.pt")
# Простой запуск инференса на тестовом изображении
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")
# Отобрази результаты
results_yolo[0].show()С помощью API Ultralytics ты можешь без проблем экспортировать обученные модели в такие форматы, как TensorRT, ONNX или CoreML, выполнив простую команду model.export(format="engine"). Это значительно упрощает развертывание.
Оптимальные сценарии применения#
Выбор между этими архитектурами полностью зависит от конкретных требований проекта:
- RTDETRv2 отлично подходит для обработки на сервере с большим объёмом видеопамяти. Глобальное понимание контекста идеально подходит для анализа медицинских изображений и плотных скоплений людей, где часто возникают перекрытия объектов.
- DAMO-YOLO отлично подходит для встроенных IoT-приложений и высокоскоростных промышленных линий контроля, где необходимы небольшое число параметров и высокая частота кадров.
Будущее: Ultralytics YOLO26#
У RTDETRv2 и DAMO-YOLO есть свои преимущества, но компьютерное зрение развивается стремительно. Для новых проектов новейшая Ultralytics YOLO26 — оптимальное сочетание скорости, точности и удобства для разработчиков.
YOLO26 использует сквозную архитектуру без NMS, обеспечивая главное преимущество Transformer без огромных вычислительных затрат. В модели применяется инновационный оптимизатор MuSGD, созданный под влиянием методов обучения больших языковых моделей, что обеспечивает стабильную и быструю сходимость. Кроме того, благодаря отказу от DFL (удалению Distribution Focal Loss для упрощения экспорта и повышения совместимости с периферийными устройствами и устройствами с низким энергопотреблением) инференс YOLO26 на CPU выполняется до 43% быстрее. Это делает модель бесспорным лидером в области периферийных вычислений. Также ProgLoss + STAL улучшает функции потерь и распознавание мелких объектов, что особенно важно для IoT, робототехники и аэрофотосъёмки.
В отличие от моделей, ограниченных исключительно ограничивающими рамками, семейство YOLO26 отличается непревзойдённой универсальностью и поддерживает задачи от сегментации экземпляров и оценки позы до ориентированных ограничивающих рамок (OBB). Все задачи можно легко выполнять с помощью интуитивно понятной платформы Ultralytics.
Сведения о моделях и источники#
RTDETRv2#
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Репозиторий RT-DETR
DAMO-YOLO#
- Авторы: Сяньчжэ Сюй, Ици Цзян, Вэйхуа Чэнь, Илуне Хуан, Юань Чжан и Сюйюй Сунь
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: репозиторий DAMO-YOLO
Если хочешь изучить другие сравнения, ознакомься с нашими руководствами RTDETRv2 и YOLO11 или DAMO-YOLO и YOLOv8, чтобы узнать, как эти модели показывают себя на фоне предыдущих поколений семейства Ultralytics.