RTDETRv2 и EfficientDet#
Выбор оптимальной архитектуры нейронной сети — ключевое решение для любого проекта в области компьютерного зрения. В этом подробном техническом сравнении рассматриваются две влиятельные модели обнаружения объектов: RTDETRv2 — современный детектор на основе Transformer — и EfficientDet — легко масштабируемая сверточная нейронная сеть. Мы сравним их архитектуры, метрики производительности, методы обучения и оптимальные сценарии развертывания, чтобы помочь тебе принимать решения для конвейеров ИИ на основе данных.
RTDETRv2: Transformer для обнаружения объектов в реальном времени#
Развивая успех оригинальной RT-DETR, RTDETRv2 совершенствует подход к обнаружению объектов на основе Transformer. Оптимизация структуры энкодера и декодера обеспечивает высокую точность при сохранении скорости инференса в реальном времени, эффективно сокращая разрыв между традиционными CNN и визуальными Transformer.
Сведения о модели
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Ссылки: Arxiv, GitHub, Документация
Архитектура и основные преимущества#
В RTDETRv2 используется гибридная архитектура, объединяющая мощный бэкбон CNN (обычно ResNet или HGNet) и эффективный декодер Transformer. Главная особенность RTDETRv2 — встроенная возможность обходиться без подавления немаксимумов (NMS). Традиционным детекторам требуется NMS, чтобы отсеивать дублирующиеся ограничивающие рамки, что приводит к переменной задержке инференса на этапе постобработки. RTDETRv2 рассматривает обнаружение объектов как задачу прямого предсказания набора и использует двудольное сопоставление для получения уникальных предсказаний.
Модель отлично подходит для развертывания на сервере, где доступно много памяти GPU. Механизм глобального внимания обеспечивает исключительное понимание контекста, позволяя эффективно разделять перекрывающиеся объекты в плотной загромождённой среде, например в автоматизированных системах охранной сигнализации или при мониторинге больших скоплений людей.
Ограничения#
Несмотря на высокую производительность, архитектуры Transformer по своей природе требуют при обучении больше памяти CUDA, чем стандартные CNN. Кроме того, для тонкой настройки RTDETRv2 может потребоваться длительное время сходимости на обучающих данных, поэтому быстрое прототипирование обходится несколько дороже с точки зрения ресурсов.
EfficientDet: масштабируемые и эффективные CNN#
EfficientDet — это семейство моделей обнаружения объектов, оптимизированных для точности и эффективности при широком спектре ограничений ресурсов. Эта архитектура остаётся классическим примером масштабируемого дизайна машинного зрения.
Сведения о модели
- Авторы: Mingxing Tan, Ruoming Pang и Quoc V. Le
- Организация: Google
- Дата: 2019-11-20
- Ссылки: Arxiv, GitHub, Документация
Архитектура и основные преимущества#
В основе EfficientDet лежат два ключевых нововведения: двунаправленная пирамидальная сеть признаков (BiFPN) и метод составного масштабирования. BiFPN обеспечивает простое и быстрое многоуровневое извлечение признаков: обучаемые веса помогают определять важность разных входных признаков, а многоуровневое слияние признаков повторяется в направлениях сверху вниз и снизу вверх. Метод составного масштабирования одновременно и равномерно масштабирует разрешение, глубину и ширину сети.
Модели EfficientDet представлены в диапазоне от ультракомпактной D0 до огромной D7. Благодаря этому они отличаются универсальностью и подходят для развертывания периферийного ИИ, где разработчикам нужно учитывать строгие ограничения вычислительных ресурсов и требования к точности, например в ранних мобильных приложениях дополненной реальности.
Ограничения#
EfficientDet — более старая архитектура, которая активно использует якорные рамки и традиционный конвейер постобработки NMS. Генерация якорей требует тщательной настройки гиперпараметров, а этап NMS может стать узким местом при развертывании на встроенном оборудовании, например на Raspberry Pi. Кроме того, модель изначально не поддерживает современные задачи, такие как оценка позы и ориентированные ограничивающие рамки (OBB).
Сравнение производительности и метрик#
Чтобы понять точный компромисс между этими моделями, нужно проанализировать пропускную способность и эффективность использования параметров. В таблице ниже сравниваются современная серия RTDETRv2 и масштабируемое семейство EfficientDet.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Как видно выше, RTDETRv2 не уступает моделям EfficientDet сопоставимого размера или превосходит их по средней точности (mAP), при этом на GPU работает намного быстрее (например, RTDETRv2-l достигает 53.4 mAP за 9.76 ms, тогда как EfficientDet-d6 — 52.6 mAP за 89.29 ms). Для повышения точности модель активно использует архитектуру Transformer.
Сценарии использования и рекомендации#
Выбор между RT-DETR и EfficientDet зависит от конкретных требований проекта, ограничений развертывания и предпочтительной экосистемы.
Когда выбрать RT-DETR#
RT-DETR — отличный выбор для:
- Исследований обнаружения на основе Transformer: Проектов, в которых изучаются механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, где точность обнаружения важнее всего, а немного большая задержка инференса допустима.
- Обнаружения крупных объектов: Сцен, в которых преобладают объекты среднего и крупного размера, а механизм глобального внимания Transformer даёт естественное преимущество.
Когда стоит выбрать EfficientDet#
EfficientDet подойдёт для следующих задач:
- Google Cloud и конвейеры TPU: Системы, тесно интегрированные с API Google Cloud Vision или инфраструктурой TPU, где EfficientDet оптимизирована изначально.
- Исследования составного масштабирования: Академические исследования и сравнительное тестирование, посвящённые влиянию сбалансированного масштабирования глубины, ширины и разрешения сети.
- Развертывание на мобильных устройствах через LiteRT: Проекты, для которых требуется экспорт в LiteRT (ранее TensorFlow Lite) для Android или встраиваемых устройств с Linux.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Альтернатива от Ultralytics: развитие передовых технологий#
Хотя и RTDETRv2, и EfficientDet имеют существенные достоинства, современная разработка ИИ требует фреймворков, которые обеспечивают удобство для разработчиков и при этом предлагают передовые характеристики. Экосистема Ultralytics предлагает значительно более упорядоченный подход к задачам компьютерного зрения.
Если ты изучаешь передовые методы детекции, недавно выпущенная Ultralytics YOLO26 объединяет лучшие особенности CNN и трансформеров.
YOLO26 реализует опциональную сквозную архитектуру без NMS (nms=False), сочетая простоту развертывания RTDETRv2 с высокоэффективной архитектурой YOLO. Кроме того, в ней представлен оптимизатор MuSGD, вдохновленный инновациями в обучении LLM, который обеспечивает превосходную стабильность обучения. Благодаря удалению DFL (функция потерь с фокальным распределением удалена для упрощения экспорта и повышения совместимости с периферийными устройствами и устройствами с низким энергопотреблением) YOLO26 обеспечивает до 43% более быструю инференцию на CPU, чем модели предыдущих поколений, и становится исключительным выбором для периферийных вычислений по сравнению с более тяжелыми моделями. Кроме того, ProgLoss + STAL обеспечивают улучшенные функции потерь и заметно повышают качество распознавания мелких объектов — это важно для IoT, робототехники и аэрофотосъемки.
Простота использования пакета Ultralytics для Python не имеет себе равных. Разработчики могут обучать, валидировать и экспортировать модели с помощью интуитивно понятного API, который избавляет от шаблонного кода, обычно необходимого в исследовательских репозиториях.
from ultralytics import RTDETR
# Загрузи предварительно обученную модель RT-DETR из экосистемы Ultralytics
model = RTDETR("rtdetr-l.pt")
# Обучи модель на датасете COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Экспортируй модель для оптимизированной инференции на TensorRT
model.export(format="engine")Модели Ultralytics изначально поддерживают множество задач, включая сегментацию экземпляров и классификацию изображений, предоставляя универсальный набор инструментов для решения разнообразных отраслевых задач. Кроме того, удаление функции потерь с фокальным распределением (DFL) в современных моделях Ultralytics упрощает вычислительный граф и обеспечивает более плавный экспорт на встраиваемые NPU и TPU.
Для удобной разметки данных и управления моделями платформа Ultralytics предоставляет комплексную облачную среду для контроля всего жизненного цикла машинного обучения, что делает ее лучшим выбором для развертывания надежных решений компьютерного зрения в промышленной эксплуатации.