RTDETRv2 и EfficientDet#
Выбор оптимальной архитектуры нейронной сети — определяющее решение для любого проекта в области компьютерного зрения. В этом подробном техническом сравнении рассматриваются две значимые модели обнаружения объектов: RTDETRv2 — современный детектор на основе Transformer — и EfficientDet — легко масштабируемая сверточная нейронная сеть. Мы оценим их отличия в архитектуре, метриках производительности, методологиях обучения и оптимальных сценариях развертывания, чтобы помочь тебе принимать решения для своих конвейеров AI на основе данных.
RTDETRv2: Transformer для обнаружения объектов в реальном времени#
Развивая успех оригинального RT-DETR, RTDETRv2 совершенствует парадигму обнаружения объектов на основе Transformer. Оптимизируя структуры энкодера и декодера, модель обеспечивает высокую точность при сохранении скорости инференса в реальном времени, эффективно сокращая разрыв между традиционными CNN и vision Transformer.
Сведения о модели
- Авторы: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang и Yi Liu
- Организация: Baidu
- Дата: 2024-07-24
- Ссылки: Arxiv, GitHub, Документация
Архитектура и ключевые преимущества#
RTDETRv2 использует гибридную архитектуру, объединяющую мощный CNN-бэкбон (обычно ResNet или HGNet) с эффективным декодером Transformer. Самая характерная особенность RTDETRv2 — встроенная возможность обходиться без подавления немаксимумов (NMS). Традиционным детекторам требуется NMS для фильтрации дублирующихся ограничивающих рамок, что добавляет переменную задержку инференса на этапе постобработки. RTDETRv2 формулирует обнаружение как задачу прямого предсказания множества, используя двудольное сопоставление для выдачи уникальных предсказаний.
Эта модель особенно хорошо подходит для серверных развертываний, где доступно много памяти GPU. Механизм глобального внимания обеспечивает исключительное понимание контекста, благодаря чему модель отлично разделяет перекрывающиеся объекты в плотной, загроможденной среде, например в автоматизированных системах охранной сигнализации или при мониторинге больших скоплений людей.
Ограничения#
Несмотря на высокую мощность, архитектуры Transformer по своей природе требуют больше памяти CUDA во время обучения по сравнению со стандартными CNN. Кроме того, для тонкой настройки RTDETRv2 может потребоваться больше времени на сходимость обучающих данных, из-за чего быстрое прототипирование становится несколько более ресурсоемким.
EfficientDet: масштабируемые и эффективные CNN#
EfficientDet представляет семейство моделей обнаружения объектов, оптимизированных одновременно под точность и эффективность при широком спектре ресурсных ограничений. Это по-прежнему классический пример масштабируемого дизайна машинного зрения.
Сведения о модели
- Авторы: Mingxing Tan, Ruoming Pang и Quoc V. Le
- Организация: Google
- Дата: 20.11.2019
- Ссылки: Arxiv, GitHub, Документация
Архитектура и ключевые преимущества#
Инновации EfficientDet сосредоточены в двух ключевых областях: двунаправленной сети пирамиды признаков (BiFPN) и методе составного масштабирования. BiFPN обеспечивает простое и быстрое многоуровневое извлечение признаков, вводя обучаемые веса для определения важности различных входных признаков и многократно применяя объединение многоуровневых признаков сверху вниз и снизу вверх. Метод составного масштабирования одновременно и равномерно масштабирует разрешение, глубину и ширину сети.
Модели EfficientDet варьируются от сверхлегкой D0 до массивной D7. Благодаря этому они отлично подходят для развертывания AI на периферийных устройствах, где разработчикам необходимо балансировать между жесткими ограничениями вычислительных ресурсов и требованиями к точности, например в первых мобильных приложениях дополненной реальности.
Ограничения#
EfficientDet — более старая архитектура, которая в значительной степени опирается на anchor boxes и традиционный конвейер постобработки NMS. Процесс генерации anchor boxes требует тщательной настройки гиперпараметров, а этап NMS может стать узким местом при развертывании на встраиваемом оборудовании, например на Raspberry Pi. Кроме того, модель не имеет встроенной поддержки современных задач, таких как оценка позы или ориентированные ограничивающие рамки (OBB).
Сравнение производительности и метрик#
Чтобы понять точные компромиссы между этими моделями, необходимо проанализировать их пропускную способность и эффективность использования параметров. В таблице ниже показано, как современная серия RTDETRv2 сравнивается с масштабируемым семейством EfficientDet.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Как видно выше, RTDETRv2 обеспечивает значительно более высокую среднюю точность (mAP) при сопоставимом количестве параметров с моделями EfficientDet среднего уровня, активно используя архитектуру Transformer для повышения точности.
Варианты применения и рекомендации#
Выбор между RT-DETR и EfficientDet зависит от конкретных требований твоего проекта, ограничений развертывания и предпочтений в отношении экосистемы.
Когда стоит выбрать RT-DETR#
RT-DETR — подходящий выбор для:
- Исследований обнаружения на основе Transformer: Проектов, изучающих механизмы внимания и архитектуры Transformer для сквозного обнаружения объектов без NMS.
- Сценариев с высокой точностью и гибкими требованиями к задержке: Приложений, в которых точность обнаружения является главным приоритетом, а немного большая задержка инференса приемлема.
- Обнаружения крупных объектов: Сцен с преимущественно средними и крупными объектами, где механизм глобального внимания Transformer дает естественное преимущество.
Когда стоит выбрать EfficientDet#
EfficientDet рекомендуется для:
- Конвейеров Google Cloud и TPU: систем, тесно интегрированных с Google Cloud Vision API или инфраструктурой TPU, где EfficientDet имеет нативную оптимизацию.
- Исследований составного масштабирования: академических бенчмарков, посвящённых изучению влияния сбалансированного масштабирования глубины, ширины и разрешения сети.
- Мобильного развертывания через TFLite: проектов, которым необходим экспорт в TensorFlow Lite для Android или встраиваемых устройств под управлением Linux.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Альтернатива от Ultralytics: развитие передовых технологий#
Хотя RTDETRv2 и EfficientDet обладают значительными преимуществами, современная разработка AI требует фреймворков, которые наряду с передовой производительностью обеспечивают удобный опыт разработчика. Экосистема Ultralytics предлагает значительно более оптимизированный подход к задачам компьютерного зрения.
Если ты изучаешь передовые методы обнаружения, недавно выпущенная Ultralytics YOLO26 объединяет лучшие стороны CNN и Transformer.
YOLO26 реализует сквозной дизайн без NMS, обеспечивая простоту развертывания RTDETRv2 в сверхэффективной архитектуре YOLO. Кроме того, в ней представлен оптимизатор MuSGD, вдохновленный инновациями в обучении LLM, для повышения стабильности обучения. Благодаря удалению DFL (Distribution Focal Loss удален для упрощения экспорта и улучшения совместимости с периферийными устройствами и устройствами с низким энергопотреблением) YOLO26 обеспечивает до 43% более быстрый инференс на CPU, чем предыдущие поколения, что делает ее отличным выбором для периферийных вычислений по сравнению с более тяжелыми моделями. Кроме того, ProgLoss + STAL обеспечивает улучшенные функции потерь с заметным повышением качества распознавания небольших объектов, что особенно важно для IoT, робототехники и аэрофотосъемки.
Удобство, которое предоставляет пакет Ultralytics для Python, не имеет аналогов. Разработчики могут обучать, валидировать и экспортировать модели с помощью интуитивно понятного API, абстрагирующего типовой код, который обычно требуется в исследовательских репозиториях.
from ultralytics import RTDETR
# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export for optimized inference on TensorRT
model.export(format="engine")Модели Ultralytics изначально поддерживают несколько задач, включая сегментацию экземпляров и классификацию изображений, предоставляя универсальный набор инструментов для различных отраслевых задач. Кроме того, удаление Distribution Focal Loss (DFL) в современных моделях Ultralytics упрощает вычислительный граф, гарантируя более плавный экспорт на встраиваемые NPU и TPU.
Для удобной разметки данных и управления моделями платформа Ultralytics предоставляет комплексную облачную среду для контроля всего жизненного цикла машинного обучения, что делает ее оптимальным выбором для развертывания надежных решений компьютерного зрения в производственной среде.