Ultralytics YOLO27:
Get Started

YOLOX и RTDETRv2#

Чтобы выбрать оптимальную архитектуру для приложений компьютерного зрения, нужно тщательно сбалансировать точность, скорость инференса и возможности развертывания. В этом подробном техническом анализе мы рассмотрим ключевые различия между YOLOX — успешной CNN-архитектурой без якорных рамок — и RTDETRv2 — передовым Transformer для обнаружения объектов в реальном времени.

Обе модели внесли существенный вклад в развитие обнаружения объектов, однако разработчики готовых к производству приложений часто выбирают современные альтернативы, например Ultralytics YOLO26, которые обеспечивают более эффективное обучение, требуют меньше памяти и располагают более надёжной экосистемой развертывания.

YOLOX: мост между исследованиями и промышленностью#

YOLOX стала популярной моделью без якорных рамок в семействе YOLO. Упрощённая архитектура обеспечила впечатляющий рост производительности на момент выпуска.

  • Авторы: Чжэн Гэ, Сунтао Лю, Фэн Ван, Цзэмин Ли и Цзянь Сунь
  • Организация: Megvii
  • Дата: 18 июля 2021 года
  • Ссылки: Arxiv, GitHub, Документация

Архитектурные инновации#

YOLOX перевела семейство YOLO на подход без якорных рамок, объединив разделённую голову и передовую стратегию назначения меток SimOTA. Благодаря отказу от якорных рамок архитектура значительно сократила количество проектных параметров и улучшила способность к обобщению на различных тестовых наборах данных. Лёгкие варианты YOLOX-Nano и YOLOX-Tiny стали популярным выбором для развертывания решений компьютерного зрения на периферийных устройствах.

Особенности устаревших решений

Несмотря на заметные достижения YOLOX, зависимость от ресурсоёмких конвейеров аугментации и старых методов постобработки (например, традиционного NMS) может приводить к большей задержке по сравнению с моделями, изначально построенными как сквозные.

Узнай больше о YOLOX

RTDETRv2: развитие Vision Transformer для работы в реальном времени#

Опираясь на архитектуру предшественника, RTDETRv2 использует возможности Vision Transformer (ViT), чтобы обеспечить высокую конкурентоспособность по точности без ущерба для скорости инференса в реальном времени.

  • Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
  • Организация: Baidu
  • Дата: 2024-07-24
  • Ссылки: Arxiv, GitHub

Архитектурные инновации#

RTDETRv2 принципиально переосмысливает конвейер обнаружения, используя архитектуру на базе Transformer, которая изначально обходится без подавления немаксимумов (NMS). Это достигается благодаря гибридному кодировщику и выбору запросов с учётом IoU, что улучшает инициализацию запросов объектов. Модель эффективно обрабатывает признаки разных масштабов и улавливает сложные детали в непростых условиях, например при обнаружении объектов на ночных дорожных видео.

Однако Transformer по своей природе требует больших ресурсов. Для обучения RTDETRv2 обычно нужно значительно больше памяти GPU и вычислительных циклов, чем для альтернатив на базе CNN. Это может стать препятствием для команд с жёсткими бюджетными ограничениями или частой настройкой моделей.

Узнай больше о RTDETRv2

Таблица сравнения производительности#

Чтобы объективно оценить эти архитектуры, мы сравним их результаты на наборе данных COCO. В таблице ниже показан компромисс между точностью (mAP), количеством параметров и вычислительной сложностью.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

RTDETRv2 обеспечивает впечатляющую точность, но YOLOX выигрывает по компактности моделей, особенно в вариантах Nano и Tiny.

Сценарии использования и рекомендации#

Выбор между YOLOX и RT-DETR зависит от конкретных требований проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда стоит выбрать YOLOX#

YOLOX подойдёт для:

  • Исследования обнаружения без якорей: Академические исследования, в которых чистая архитектура YOLOX без якорей используется как базовая модель для экспериментов с новыми головами обнаружения или функциями потерь.
  • Сверхкомпактные периферийные устройства: Развертывание на микроконтроллерах или устаревшем мобильном оборудовании, где критически важен крайне малый размер варианта YOLOX-Nano (0,91 млн параметров).
  • Исследования назначения меток SimOTA: Исследовательские проекты по изучению стратегий назначения меток на основе оптимального транспорта и их влияния на сходимость обучения.

Когда выбрать RT-DETR#

RT-DETR рекомендуется для:

  • Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
  • Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
  • Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:

  • Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
  • Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
  • Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.

Преимущества Ultralytics: YOLO26#

Хотя YOLOX и RTDETRv2 обладают разными преимуществами, недавно выпущенная Ultralytics YOLO26 задаёт новый уровень передовых решений в области компьютерного зрения на базе ИИ и устраняет традиционный компромисс между скоростью, точностью и простотой развертывания.

1. Сквозная архитектура без NMS#

Вдохновлённая моделями Transformer, но сохраняющая эффективность CNN, YOLO26 предлагает опциональную сквозную архитектуру без NMS (nms=False). Отказ от подавления немаксимумов на этапе постобработки значительно упрощает конвейеры развертывания и обеспечивает стабильную задержку инференса на различных периферийных устройствах без сложной настройки пороговых значений.

2. До 43% более быстрый инференс на CPU#

В отличие от архитектур Transformer, например RTDETRv2, которые сильно зависят от мощных GPU, YOLO26 специально оптимизирована для периферийных вычислений. Благодаря отказу от Distribution Focal Loss (DFL) YOLO26 упрощает экспорт моделей и обеспечивает до 43% более быстрый инференс на CPU, что делает её оптимальным выбором для устройств вроде Raspberry Pi и обычных мобильных устройств.

3. Эффективное обучение с MuSGD#

Обучение моделей Transformer часто приводит к чрезмерному расходу памяти CUDA и затягивается надолго. В YOLO26 представлен новый оптимизатор MuSGD — гибрид стохастического градиентного спуска и оптимизатора Muon, вдохновлённого большими языковыми моделями. Это нововведение обеспечивает исключительно стабильное обучение и более быстрое схождение, значительно снижая требования к оборудованию по сравнению с RTDETRv2.

4. Непревзойдённая экосистема и универсальность#

Экосистема Ultralytics обеспечивает интуитивно понятную и удобную среду разработки. Благодаря подробной документации, активной поддержке сообщества и облачной платформе Ultralytics управлять полным жизненным циклом ИИ стало проще, чем когда-либо. Кроме того, YOLO26 отличается высокой универсальностью. RTDETRv2 предназначена для обнаружения объектов, а YOLO26 изначально поддерживает сегментацию экземпляров, классификацию изображений, оценку позы и задачи обнаружения ориентированных ограничивающих рамок (OBB). Новая комбинация ProgLoss + STAL (прогрессивная функция потерь и назначение меток с учётом малых объектов) также улучшает распознавание небольших объектов — это особенно важно для аэрофотосъёмки и обнаружения промышленных дефектов.

Другие поддерживаемые модели

Фреймворк Ultralytics также поддерживает модели предыдущего поколения YOLO11 и YOLOv8, позволяя легко сравнивать их производительность и переходить с устаревших конвейеров.

Простая интеграция с Ultralytics#

Развертывание моделей не должно требовать работы со сложными и разрозненными кодовыми базами. Python API Ultralytics позволяет загружать, обучать и экспортировать передовые модели всего несколькими строками кода.

from ultralytics import YOLO

# Загрузи новейшую YOLO26 nano для оптимальной производительности на периферийных устройствах
model = YOLO("yolo26n.pt")

# Обучи модель на собственном наборе данных с минимальным расходом памяти
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Проверка производительности модели
metrics = model.val()

# Без проблем экспортируй модель в ONNX или TensorRT для развертывания
model.export(format="onnx")

Используя Ultralytics, ты избежишь сложной настройки окружения, характерной для исследовательских репозиториев, и быстрее выведешь продукт на рынок.

Заключение#

YOLOX и RTDETRv2 стали важными этапами развития обнаружения объектов в реальном времени. YOLOX доказала жизнеспособность высокоэффективных CNN без якорных рамок, а RTDETRv2 успешно адаптировала Transformer для работы в реальном времени.

Однако для современных приложений — от аналитики умной розницы до встроенной робототехники — Ultralytics YOLO26 станет оптимальным решением. Объединив инференс без NMS с непревзойдённой скоростью работы на CPU, сниженным расходом памяти и надёжной поддержкой платформы Ultralytics, YOLO26 помогает разработчикам создавать системы компьютерного зрения нового поколения — надёжные и высокопроизводительные.

Комментарии