Ultralytics YOLO27:

RTDETRv2 и DAMO-YOLO#

Область компьютерного зрения постоянно развивается: исследователи и инженеры стремятся создавать модели, которые идеально сочетают скорость, точность и эффективность. Две заметные архитектуры, оказавшие значительное влияние на эту область, — RTDETRv2, разработанная Baidu, и DAMO-YOLO, созданная Alibaba Group. Обе модели расширяют границы обнаружения объектов в реальном времени, однако для достижения впечатляющих результатов они используют принципиально разные архитектурные подходы.

В этом техническом сравнении мы подробно рассмотрим их архитектуры, методики обучения и возможности развертывания в реальных условиях. Мы также изучим, как эти модели сопоставляются с более широкой экосистемой, особенно с высокооптимизированной Ultralytics Platform и современной архитектурой YOLO26.

Архитектурные инновации#

Понимание основных принципов работы этих моделей крайне важно для инженеров по машинному обучению, перед которыми стоит задача выбора подходящего инструмента для производственных сред.

RTDETRv2: подход на основе Transformer#

Развивая успех оригинальной модели RT-DETR, RTDETRv2 использует гибридный энкодер и декодер Transformer. Такая конструкция позволяет модели эффективно обрабатывать глобальный контекст, благодаря чему она особенно хорошо различает перекрывающиеся объекты в плотных сценах. Наиболее значимое преимущество этой архитектуры — исходный дизайн без NMS (подавления немаксимумов). Благодаря исключению этапа постобработки NMS RTDETRv2 упрощает конвейер инференса и обеспечивает более стабильную задержку на различных аппаратных конфигурациях.

Узнай больше о RTDETRv2

DAMO-YOLO: повышение эффективности CNN#

DAMO-YOLO, с другой стороны, сохраняет основу в виде успешной линейки YOLO на базе CNN, но внедряет несколько новаторских улучшений. Для оптимизации backbone используется поиск нейронной архитектуры (NAS), обеспечивающий максимальную эффективность извлечения признаков. Кроме того, модель включает эффективные RepGFPN (обобщённую пирамидальную сеть признаков с репараметризацией) и дизайн ZeroHead, а также методы улучшения AlignedOTA и дистилляции. Эти инновации позволяют DAMO-YOLO достигать высокой скорости инференса, сохраняя при этом весьма конкурентный показатель mAPval.

Узнай больше о DAMO-YOLO

Архитектурные различия

RTDETRv2 сосредоточена на использовании механизмов внимания для понимания глобальных признаков без NMS, тогда как DAMO-YOLO повышает эффективность традиционной CNN с помощью NAS и усовершенствованной дистилляции. Для неё требуется стандартная постобработка, но на определённом оборудовании она обеспечивает заметные преимущества в скорости.

Сравнение производительности и метрик#

При оценке моделей для развертывания первостепенное значение имеют такие метрики производительности, как средняя точность (mAP), скорость инференса и количество параметров. Ниже приведено подробное сравнение двух семейств моделей.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Анализ результатов#

Как видно из таблицы, RTDETRv2-x достигает наивысшей точности с показателем mAPval 54,3, демонстрируя возможности архитектуры Transformer на сложных валидационных наборах, таких как набор данных COCO. Однако это достигается ценой значительно большего количества параметров (76M) и FLOPs.

Напротив, DAMO-YOLOt (Tiny) отличается исключительно малым размером: ей требуется всего 8,5M параметров, что делает её невероятно быстрой для сред, где объём памяти CUDA сильно ограничен. DAMO-YOLO обычно обеспечивает выгодный баланс скорости и точности для устаревших периферийных устройств.

Экосистема, удобство использования и преимущества Ultralytics#

Хотя независимые репозитории, такие как официальный GitHub RT-DETR и GitHub DAMO-YOLO, предоставляют исходный код для обучения этих моделей, их интеграция в производственные конвейеры часто требует большого объёма шаблонного кода и ручной оптимизации.

Именно здесь экосистема Ultralytics значительно упрощает работу разработчика. Ultralytics напрямую интегрирует такие модели, как RTDETRv2, в единый API, позволяя обучать, валидировать и экспортировать модели одной строкой кода. Кроме того, модели Ultralytics известны минимальными требованиями к памяти во время обучения по сравнению с автономными репозиториями на базе тяжёлых Transformer.

Пример кода: бесшовная интеграция#

Вот как просто использовать библиотеку Ultralytics Python для запуска инференса. API остаётся единообразным независимо от того, используешь ли ты модель Transformer или современную CNN.

from ultralytics import RTDETR, YOLO

# Load an RTDETRv2 model for complex scene understanding
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load the latest Ultralytics YOLO26 model for ultimate edge performance
model_yolo26 = YOLO("yolo26n.pt")

# Run inference on a sample image effortlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Display the results
results_yolo[0].show()
Экспорт моделей для продакшена

С помощью API Ultralytics ты можешь без проблем экспортировать обученные модели в такие форматы, как TensorRT, ONNX или CoreML, используя простую команду model.export(format="engine"), что значительно упрощает развертывание.

Идеальные сценарии использования#

Выбор между этими архитектурами полностью зависит от требований твоего проекта:

  • RTDETRv2 особенно эффективна для серверной обработки, где доступен большой объём VRAM. Её способность учитывать глобальный контекст идеально подходит для медицинской визуализации и анализа плотных скоплений людей, где часто возникают перекрытия.
  • DAMO-YOLO отлично подходит для встраиваемых IoT-приложений и быстро работающих линий промышленного контроля, где малое количество параметров и высокий FPS являются обязательными требованиями.

Будущее: Ultralytics YOLO26#

Хотя и RTDETRv2, и DAMO-YOLO имеют свои преимущества, компьютерное зрение быстро развивается. Для новых проектов последняя Ultralytics YOLO26 представляет собой оптимальное сочетание скорости, точности и удобства для разработчиков.

YOLO26 использует сквозной дизайн без NMS, обеспечивая главное преимущество Transformer без огромных вычислительных затрат. В ней применяется инновационный оптимизатор MuSGD, вдохновлённый обучением больших языковых моделей, для стабильной и быстрой сходимости. Кроме того, благодаря удалению DFL (Distribution Focal Loss удалена для упрощения экспорта и повышения совместимости с периферийными устройствами и устройствами с низким энергопотреблением) YOLO26 обеспечивает до 43% более быстрый инференс на CPU, что делает её бесспорным лидером для периферийных вычислений. Дополнительно, ProgLoss + STAL обеспечивает улучшенные функции потерь и заметно повышает качество распознавания небольших объектов, что важно для IoT, робототехники и аэрофотосъёмки.

В отличие от моделей, строго ограниченных ограниченными рамками, семейство YOLO26 отличается непревзойдённой универсальностью и поддерживает задачи от сегментации экземпляров и оценки позы до ориентированных ограничивающих рамок (OBB), причём всё это легко управляется через интуитивно понятную Ultralytics Platform.

Сведения о модели и ссылки#

RTDETRv2#

DAMO-YOLO#

Если тебя интересуют другие сравнения, ознакомься с нашими руководствами RTDETRv2 и YOLO11 или DAMO-YOLO и YOLOv8, чтобы узнать, как эти модели показывают себя по сравнению с предыдущими поколениями семейства Ultralytics.

Комментарии