DAMO-YOLO и RTDETRv2#
Стремительное развитие компьютерного зрения привело к появлению множества архитектур, призванных сбалансировать скорость, точность и вычислительную эффективность. Среди моделей, предлагающих уникальные решения этих задач, выделяются DAMO-YOLO и RTDETRv2. Обе модели предназначены для передового инференса в реальном времени, но их архитектурные подходы принципиально различаются.
В этом подробном руководстве рассматриваются технические характеристики, архитектурные нововведения и практические сценарии использования обеих моделей. Также в нём показано, как современные решения, такие как платформа Ultralytics и передовая YOLO26, задали новые отраслевые стандарты развёртывания и простоты использования.
Обзор моделей#
Знакомство с DAMO-YOLO#
DAMO-YOLO разработали исследователи Alibaba Group. Эта модель обеспечивает быстрое и точное обнаружение объектов и во многом опирается на поиск архитектуры нейронных сетей (NAS). Вместо традиционных базовых сетей, спроектированных вручную, в ней используются структуры, созданные с помощью NAS и оптимизированные для низкой задержки. Кроме того, в модели применяются эффективная RepGFPN (обобщённая пирамидальная сеть признаков с перепараметризацией) и архитектура ZeroHead, упрощающие объединение признаков и предсказание ограничивающих рамок.
Основные сведения о модели:
- Авторы: Сяньчжэ Сюй, Ици Цзян, Вэйхуа Чэнь, Илуне Хуан, Юань Чжан и Сюйюй Сунь
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- Документация: Документация DAMO-YOLO
Знакомство с RTDETRv2#
RTDETRv2 от Baidu — значительный шаг вперёд в области трансформеров для обнаружения объектов в реальном времени. В отличие от традиционных свёрточных нейронных сетей (CNNs), использующих якорные рамки и подавление немаксимумов (NMS), RTDETRv2 использует механизмы self-attention, чтобы учитывать контекст всего изображения. Модель сразу выдаёт ограничивающие рамки, полностью исключая этап постобработки с NMS. В ней также применяется стратегия обучения «набор бесплатных преимуществ», повышающая базовую точность без увеличения задержки инференса.
Основные сведения о модели:
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Репозиторий RT-DETR
- Документация: документация RTDETRv2
Трансформерам требуются более значительные вычислительные ресурсы, но способность обрабатывать глобальный контекст делает их очень эффективными для понимания сложных сцен — это одно из главных преимуществ RTDETRv2.
Сравнение производительности#
При оценке этих моделей для развёртывания в реальных условиях важно учитывать такие параметры, как средняя точность (mAP), скорость инференса и объём занимаемой памяти. Моделям на основе Transformer, таким как RTDETRv2, обычно требуется больше памяти CUDA при обучении и инференсе, чем компактным CNN, например DAMO-YOLO.
Ниже приведено подробное сравнение их метрик производительности.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Оптимальные сценарии применения#
Преимущества DAMO-YOLO: Благодаря оптимизированной с помощью NAS базовой сети и особенно малому количеству параметров в компактных вариантах, таких как DAMO-YOLOt, модель хорошо подходит для развёртывания на устройствах с ограниченными ресурсами. Если ты создаёшь решения для встраиваемых устройств и используешь среды выполнения, такие как ONNX, или специализированные движки TensorRT для периферийных вычислений, DAMO-YOLO обеспечит высокую скорость отклика.
Преимущества RTDETRv2: RTDETRv2 отлично подходит для сценариев, где доступны серверные GPU и особенно важно учитывать глобальный контекст изображения. Архитектура Transformer позволяет модели естественным образом разрешать перекрывающиеся ограничивающие рамки без NMS, что делает её надёжным решением для управления большими скоплениями людей и сложного отслеживания объектов, когда важны пространственные отношения между удалёнными объектами.
Преимущества Ultralytics: знакомство с YOLO26#
DAMO-YOLO и RTDETRv2 — важные достижения академической науки, но превратить эти модели в масштабируемые готовые к эксплуатации приложения может быть непросто. Разработчики часто сталкиваются с фрагментированными кодовыми базами, отсутствием поддержки многозадачного обучения и сложными процессами развёртывания.
Именно здесь экосистема Ultralytics особенно выделяется. Уделяя особое внимание простоте использования, хорошо поддерживаемому API Python и непревзойдённой универсальности, Ultralytics помогает разработчикам тратить меньше времени на отладку и больше — на создание продуктов.
Недавно выпущенная модель Ultralytics YOLO26 выводит эти преимущества на новый уровень и предлагает решения, превосходящие DAMO-YOLO и RTDETRv2:
- Сквозная архитектура без NMS: Впервые реализованная в YOLOv10, YOLO26 предлагает опциональную сквозную голову (
nms=False). Это устраняет постобработку NMS, ускоряя и значительно упрощая развертывание по сравнению с традиционными CNN и сохраняя преимущества прямого вывода, характерные для RTDETRv2. - До 43% быстрее инференс на CPU: YOLO26n работает на CPU с ONNX до 43% быстрее, чем YOLO11n, и тщательно оптимизирован для периферийных ИИ-устройств без дискретных GPU. Благодаря этому модель значительно лучше подходит для приложений IoT, чем требовательные к памяти трансформеры.
- Оптимизатор MuSGD: Этот гибрид SGD и Muon, вдохновлённый Kimi K2 от Moonshot AI, переносит инновации в обучении больших языковых моделей (LLM) в компьютерное зрение, обеспечивая исключительно стабильное обучение и более быструю сходимость.
- ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание мелких объектов — область, в которой моделям традиционно сложно добиться успеха. Это особенно важно для аэрофотосъёмки и применения дронов.
- Удаление DFL: Distribution Focal Loss удалена, чтобы упростить форматы экспорта и улучшить совместимость с маломощными периферийными устройствами.
- Непревзойдённая универсальность: В отличие от конкурирующих моделей, предназначенных только для детекции, YOLO26 включает специализированные улучшения для разных задач: например, специальную функцию потерь угла для ориентированных ограничивающих рамок (OBB), функцию потерь семантической сегментации для попиксельной точности и оценку остаточного логарифмического правдоподобия (RLE) для оценки позы.
Обучение моделей на основе трансформеров, таких как RTDETRv2, требует огромных объёмов памяти CUDA и часто вынуждает использовать дорогостоящие конфигурации с несколькими GPU. Модели Ultralytics YOLO требуют значительно меньше памяти как во время обучения, так и при инференсе, делая разработку ИИ доступнее для исследователей и энтузиастов.
Пример кода: унифицированный API Ultralytics#
Одно из главных преимуществ экосистемы Ultralytics — унифицированный API. Ты можешь без проблем загружать, обучать и проверять различные модели — в том числе реализацию RT-DETR на PyTorch и самые современные модели YOLO — не меняя свой рабочий процесс.
from ultralytics import RTDETR, YOLO
# Загрузить модель RT-DETR
model_rtdetr = RTDETR("rtdetr-l.pt")
# Загрузи передовую модель YOLO26
model_yolo = YOLO("yolo26n.pt")
# Выполни инференс изображения с помощью простого унифицированного интерфейса
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# Отображение обнаруженных объектов
results_yolo[0].show()Эта простота распространяется и на обучение на пользовательском наборе данных, и на экспорт. С помощью пакета Ultralytics для Python разработчики могут одной командой отправлять обученные веса на платформы для развёртывания, например CoreML или OpenVINO.
Заключение и дальнейшее изучение#
И DAMO-YOLO, и RTDETRv2, несомненно, расширили границы возможностей детекции объектов в реальном времени. DAMO-YOLO использует тщательно оптимизированные автоматически найденные структуры сети для повышения эффективности, а RTDETRv2 демонстрирует, что трансформеры могут конкурировать в задачах реального времени, устраняя традиционные узкие места, например NMS.
Однако разработчикам, которым нужен оптимальный баланс производительности, подробной документации и готовности к промышленному использованию, по-прежнему стоит выбирать модели Ultralytics YOLO. С выходом YOLO26 пользователи получают опциональную сквозную детекцию, подобную трансформерной, эффективность обучения, вдохновлённую LLM, и непревзойдённую скорость на CPU — всё это в интуитивно понятной и надёжной экосистеме.
Если ты выбираешь модели для следующего проекта, тебе также могут быть полезны наши сравнения EfficientDet и RT-DETR, обзор предыдущего поколения YOLO11 или разбор академических базовых моделей, например YOLOX. Начни разработку уже сегодня — изучи краткое руководство Ultralytics.