YOLO Vision 2026:

RTDETRv2 против EfficientDet#

Выбор оптимальной архитектуры нейронной сети — определяющий шаг для любого проекта по computer vision. В этом подробном техническом сравнении анализируются две влиятельные модели обнаружения объектов: RTDETRv2, передовой детектор на базе Transformer, и EfficientDet, высокомасштабируемая сверточная нейронная сеть. Мы оценим их уникальные архитектуры, performance metrics, методологии обучения и идеальные сценарии развертывания, чтобы помочь тебе принимать решения на основе данных для твоих AI-пайплайнов.

RTDETRv2: Трансформер для детектирования в реальном времени#

Опираясь на успех оригинального RT-DETR, RTDETRv2 усовершенствует парадигму object detection на базе Transformer. Оптимизируя структуры энкодера и декодера, она обеспечивает высокую точность при сохранении скорости инференса в реальном времени, эффективно преодолевая разрыв между традиционными CNN и моделями vision transformers.

Детали модели Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
Организация: Baidu Дата: 2024-07-24 Ссылки: Arxiv, GitHub, Docs

Архитектура и ключевые преимущества#

RTDETRv2 использует гибридную архитектуру, которая объединяет мощный бэкбон CNN (часто ResNet или HGNet) с эффективным декодером Transformer. Самая характерная черта RTDETRv2 — ее встроенная способность обходиться без не максимального подавления (NMS). Традиционные детекторы требуют NMS для фильтрации дублирующихся ограничивающих рамок, добавляя переменную inference latency на этапе постобработки. RTDETRv2 формулирует обнаружение как задачу прямого прогнозирования множества, используя двудольное сопоставление для выдачи уникальных предсказаний.

Эта модель превосходно работает на серверных мощностях, где в изобилии доступна память GPU. Механизм глобального внимания обеспечивает исключительное восприятие контекста, делая модель крайне эффективной при разделении перекрывающихся объектов в плотных, загроможденных средах, таких как автоматизированные security alarm systems или системы мониторинга плотных толп.

Ограничения#

Несмотря на свою мощность, архитектуры Transformer по своей природе требуют больше памяти CUDA во время обучения по сравнению со стандартными CNN. Кроме того, тонкая настройка RTDETRv2 может потребовать больше времени для сходимости training data, что делает быстрое прототипирование чуть более ресурсоемким.

Узнай больше о RTDETRv2

EfficientDet: Масштабируемые и эффективные CNN#

EfficientDet представила семейство моделей обнаружения объектов, оптимизированных как по точности, так и по эффективности в широком спектре ресурсных ограничений. Она остается классическим примером масштабируемого дизайна в области machine vision.

Детали модели Авторы: Mingxing Tan, Ruoming Pang и Quoc V. Le
Организация: Google
Дата: 2019-11-20
Ссылки: Arxiv, GitHub, Docs

Архитектура и ключевые преимущества#

Инновация EfficientDet заключается в двух ключевых аспектах: двунаправленной пирамиде признаков BiFPN и методе составного масштабирования. BiFPN позволяет выполнять простое и быстрое многомасштабное feature extraction за счет внедрения обучаемых весов для оценки важности различных входных признаков при одновременном многократном применении нисходящего и восходящего многомасштабного слияния признаков. Метод составного масштабирования равномерно и одновременно масштабирует разрешение, глубину и ширину сети.

Модели EfficientDet варьируются от ультралегкой D0 до массивной D7. Это делает их универсальными для развертывания в сфере edge AI, где разработчики должны балансировать между жесткими ограничениями по вычислениям и требованиями к точности, например в ранних мобильных приложениях augmented reality.

Ограничения#

EfficientDet — это более старая архитектура, которая сильно зависит от якорных рамок (anchor boxes) и традиционного пайплайна постобработки NMS. Процесс генерации якорей требует тщательного hyperparameter tuning, а шаг NMS может стать узким местом при развертывании на встроенном железе, таком как Raspberry Pi. Ей также не хватает нативной поддержки современных задач, таких как pose estimation или oriented bounding boxes (OBB).

Узнай больше об EfficientDet

Сравнение производительности и метрик#

Понимание точных компромиссов между этими моделями требует анализа их пропускной способности и эффективности параметров. В таблице ниже показано, как современная серия RTDETRv2 сравнивается с масштабируемым семейством EfficientDet.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Как видно выше, RTDETRv2 достигает значительно более высокого значения mean Average Precision (mAP) при сопоставимом количестве параметров со среднеуровневыми моделями EfficientDet, активно используя свою архитектуру Transformer для повышения точности.

Сценарии использования и рекомендации#

Выбор между RT-DETR и EfficientDet зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений в экосистеме.

Когда выбирать RT-DETR#

RT-DETR — отличный выбор для:

  • Исследований детектирования на основе Transformer: проектов, изучающих механизмы внимания и архитектуры трансформеров для end-to-end детектирования объектов без NMS.
  • Сценариев с высокой точностью и гибкой задержкой: приложений, где точность детектирования является главным приоритетом, а немного большая задержка вывода допустима.
  • Детектирования крупных объектов: сцен преимущественно со средними и крупными объектами, где глобальный механизм внимания трансформеров дает естественное преимущество.

Когда стоит выбрать EfficientDet#

EfficientDet рекомендуется для:

  • Конвейеры Google Cloud и TPU: Системы с глубокой интеграцией в Google Cloud Vision API или инфраструктуру TPU, где EfficientDet имеет встроенную оптимизацию.
  • Исследования составного масштабирования: Академическое тестирование, сфокусированное на изучении эффектов сбалансированного масштабирования глубины, ширины и разрешения сети.
  • Мобильное развертывание через TFLite: Проекты, которым специально требуется экспорт TensorFlow Lite для Android или встраиваемых устройств Linux.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает наилучшее сочетание производительности и удобства для разработчика:

  • Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
  • Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
  • Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.

Альтернатива от Ultralytics: Продвижение современных технологий#

Хотя и RTDETRv2, и EfficientDet обладают серьезными достоинствами, современная разработка ИИ требует фреймворков, которые предлагают бесшовный developer experience наряду с передовой производительностью. Экосистема Ultralytics ecosystem обеспечивает значительно более оптимизированный подход к задачам компьютерного зрения.

Если ты изучаешь современные детекторы, недавно выпущенная Ultralytics YOLO26 объединяет лучшие аспекты как CNN, так и трансформеров.

Почему стоит выбрать YOLO26?

YOLO26 реализует дизайн End-to-End без использования NMS, привнося простоту развертывания RTDETRv2 в сверхэффективную архитектуру YOLO. Кроме того, она представляет оптимизатор MuSGD, вдохновленный инновациями в обучении LLM, для обеспечения превосходной стабильности обучения. Благодаря удалению DFL (Distribution Focal Loss удален для упрощения экспорта и лучшей совместимости с периферийными/маломощными устройствами), YOLO26 может похвастаться увеличением скорости инференса на CPU до 43% по сравнению с предыдущими поколениями, что делает ее исключительным выбором для edge computing в сравнении с более тяжелыми моделями. Кроме того, ProgLoss + STAL обеспечивает улучшенные функции потерь с заметными улучшениями в распознавании мелких объектов, что критически важно для IoT, робототехники и аэрофотосъемки.

Простота использования, обеспечиваемая Ultralytics Python package, не имеет себе равных. Разработчики могут обучать, валидировать и export models, используя интуитивно понятный API, который абстрагирует шаблонный код, обычно требуемый в исследовательских репозиториях.

from ultralytics import RTDETR

# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export for optimized inference on TensorRT
model.export(format="engine")

Модели Ultralytics нативно поддерживают множество задач, включая instance segmentation и image classification, предоставляя универсальный набор инструментов для различных потребностей индустрии. Более того, удаление Distribution Focal Loss (DFL) в современных моделях Ultralytics упрощает вычислительный граф, гарантируя более плавный экспорт на встроенные NPUs and TPUs.

Для удобной разметки данных (data annotation) и управления моделями платформа Ultralytics Platform предоставляет комплексную облачную среду для контроля всего жизненного цикла машинного обучения, утверждая себя в качестве первоклассного выбора для развертывания надежных решений компьютерного зрения в продакшене.

Комментарии