EfficientDet и DAMO-YOLO#
При создании масштабируемых конвейеров компьютерного зрения крайне важно правильно выбрать архитектуру модели, поскольку это влияет и на возможность развертывания, и на точность обнаружения. В этом руководстве подробно и технически сравниваются две известные архитектуры распознавания изображений: EfficientDet и DAMO-YOLO.
Обе модели привнесли значительные инновации в область обнаружения объектов, однако стремительное развитие ИИ для компьютерного зрения открыло путь к более интегрированным экосистемам. В этом обзоре мы разберем основные принципы работы этих устаревших сетей и покажем, почему современные решения, такие как платформа Ultralytics и Ultralytics YOLO26, стали отраслевым стандартом для производственной среды.
EfficientDet: масштабируемое и эффективное обнаружение объектов#
Созданная исследователями Google модель EfficientDet предназначена для систематического масштабирования архитектуры при сохранении высокой эффективности. Для этого применяется составное масштабирование глубины и ширины сети, а также разрешения входных данных.
Подробнее об EfficientDet:
- Авторы: Mingxing Tan, Ruoming Pang и Quoc V. Le
- Организация: Google Brain
- Дата: 2019-11-20
- Arxiv: 1911.09070
- GitHub: google/automl
Архитектурные инновации#
Главный вклад EfficientDet — двунаправленная пирамидальная сеть признаков (BiFPN). В отличие от традиционных FPN, BiFPN обеспечивает быстрое и простое слияние признаков разных масштабов с помощью обучаемых весов, которые помогают определять важность различных входных признаков. В сочетании с базовой сетью EfficientNet это создает предсказуемо масштабируемое семейство моделей (от D0 до D7).
Преимущества и недостатки#
Главное преимущество EfficientDet — эффективное использование параметров. Метод составного масштабирования хорошо подходит для задач, где нужно максимизировать среднюю точность по всем классам (mAP) в облачных средах с жесткими ограничениями. Однако обучение EfficientDet с нуля печально известно своей сложностью и часто требует значительной настройки гиперпараметров. Кроме того, высокая зависимость модели от специфических операций TensorFlow усложняет переход к развертыванию на периферийных устройствах через ONNX или TensorRT по сравнению с упрощенными возможностями экспорта современных моделей YOLO.
DAMO-YOLO: автоматизированный поиск архитектуры на практике#
DAMO-YOLO использует иной подход: поиск нейронной архитектуры (NAS) автоматически проектирует оптимальные структуры сетей для инференции в реальном времени.
Сведения о DAMO-YOLO:
- Авторы: Сяньчжэ Сюй, Ици Цзян, Вэйхуа Чэнь, Илуне Хуан, Юань Чжан и Сюйюй Сунь
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
Архитектурные инновации#
В DAMO-YOLO представлено несколько новых технологий. В модели используется созданная с помощью NAS базовая сеть MAE-NAS, эффективная RepGFPN для шеи и конструкция ZeroHead, которая значительно снижает вычислительную стоимость головы обнаружения. Кроме того, применяется AlignedOTA для назначения меток и активно используется улучшение на основе дистилляции знаний для повышения производительности младших вариантов модели.
Преимущества и недостатки#
DAMO-YOLO демонстрирует высокую скорость инференции на GPU и специально разработана для развертывания на архитектурах NVIDIA с использованием TensorRT. Благодаря удалению тяжелых структур головы модель выдает предсказания с низкой задержкой. Однако автоматизированный поиск архитектуры может сделать структуру модели непрозрачной и затруднить ручную отладку или тонкую настройку для пользовательских периферийных устройств. В отличие от универсальной Ultralytics YOLO11, DAMO-YOLO ориентирована преимущественно на обнаружение объектов с обычными ограничивающими рамками и без дополнительных настроек не поддерживает такие сложные задачи, как оценка позы или обнаружение с помощью ориентированных ограничивающих рамок (OBB).
Сравнение производительности#
Чтобы выбрать модель, важно понимать практические компромиссы. В таблице ниже семейство EfficientDet сравнивается с серией DAMO-YOLO по ключевым показателям производительности.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
EfficientDet-d7 обеспечивает наивысшую теоретическую точность, но требует огромных вычислительных мощностей, поэтому не подходит для периферийного ИИ. DAMO-YOLO демонстрирует исключительную скорость с TensorRT, хотя для достижения сопоставимой точности ей обычно требуется больше параметров, чем моделям EfficientDet младших уровней.
Сценарии использования и рекомендации#
Выбор между EfficientDet и DAMO-YOLO зависит от требований конкретного проекта, ограничений развертывания и предпочтительной экосистемы.
Когда стоит выбрать EfficientDet#
EfficientDet — хороший выбор для:
- Google Cloud и конвейеры TPU: Системы, тесно интегрированные с API Google Cloud Vision или инфраструктурой TPU, где EfficientDet оптимизирована изначально.
- Исследования составного масштабирования: Академические исследования и сравнительное тестирование, посвящённые влиянию сбалансированного масштабирования глубины, ширины и разрешения сети.
- Развертывание на мобильных устройствах через LiteRT: Проекты, для которых требуется экспорт в LiteRT (ранее TensorFlow Lite) для Android или встраиваемых устройств с Linux.
Когда стоит выбрать DAMO-YOLO#
DAMO-YOLO рекомендуется для следующих задач:
- Высокопроизводительная видеоаналитика: Обработка видеопотоков с высокой частотой кадров на фиксированной инфраструктуре NVIDIA GPU, где основной показатель — пропускная способность при размере пакета 1.
- Промышленные производственные линии: Сценарии со строгими ограничениями по задержке GPU на выделенном оборудовании, например контроль качества в реальном времени на сборочных линиях.
- Исследования в области поиска нейросетевых архитектур: Изучение влияния автоматизированного поиска архитектур (MAE-NAS) и эффективных перенастраиваемых базовых сетей на качество обнаружения.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Преимущества Ultralytics: развитие моделей предыдущих поколений#
EfficientDet и DAMO-YOLO дают полезные академические результаты, однако современным разработчикам нужны фреймворки, сочетающие передовую производительность и удобство работы. Именно здесь раскрываются преимущества экосистемы Ultralytics.
Непревзойденная простота использования и экосистема#
Развертывание моделей из отдельных исследовательских репозиториев с множеством специфических доработок часто оборачивается проблемами интеграции. Ultralytics предлагает единую, тщательно поддерживаемую экосистему с подробной документацией и удобным Python API. Используешь ли ты Google Colab для обучения или экспортируешь модель в CoreML для инференции на мобильных устройствах, для конвейера хватит всего нескольких строк кода.
from ultralytics import YOLO
# Загрузи настоятельно рекомендуемую компактную модель YOLO26
model = YOLO("yolo26n.pt")
# Легко обучи модель на собственном наборе данных
model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Экспортируй обученную модель в ONNX для производственной среды
model.export(format="onnx")Революция YOLO26#
Для разработчиков, рассматривающих EfficientDet или DAMO-YOLO, Ultralytics YOLO26 — следующий решающий этап эволюции. Выпущенная в начале 2026 года модель предлагает возможности, кардинально меняющие подход к задаче:
- Сквозная архитектура без NMS: впервые предложенная в YOLOv10, встроенная голова YOLO26 с сопоставлением один к одному (
nms=False) устраняет необходимость в постобработке с подавлением немаксимумов (NMS). Это значительно упрощает архитектуру развертывания и обеспечивает стабильную задержку на разном оборудовании. - До 43% более быстрая инференция на CPU: YOLO26 тщательно оптимизирована для развертывания на периферийных устройствах без мощных GPU — в таких сценариях DAMO-YOLO испытывает трудности. Модель обеспечивает значительный прирост скорости на обычных CPU.
- Оптимизатор MuSGD: объединяя достижения в области больших языковых моделей и компьютерного зрения, YOLO26 использует оптимизатор MuSGD (вдохновленный Moonshot AI), который обеспечивает очень стабильное обучение и быстрое схождение, особенно по сравнению с хрупкими циклами обучения EfficientDet.
- Отказ от DFL: удаление Distribution Focal Loss упрощает процесс экспорта и гарантирует повышенную совместимость с маломощными микроконтроллерами и устройствами Raspberry Pi.
- ProgLoss + STAL: эти продвинутые функции потерь значительно улучшают распознавание небольших объектов — область, в которой старые архитектуры традиционно показывают слабые результаты.
Эффективное использование памяти и универсальность задач#
В отличие от моделей на базе Transformer и сильно объединенных сетей NAS, модели Ultralytics отличаются особенно эффективным использованием памяти. Во время обучения они потребляют значительно меньше памяти CUDA, что позволяет быстро повторять эксперименты на обычном пользовательском оборудовании.
Кроме того, EfficientDet и DAMO-YOLO ограничены только ограничивающими рамками, тогда как Ultralytics изначально поддерживает сегментацию экземпляров и классификацию изображений в рамках того же интуитивно понятного фреймворка. Тем, кто продолжает работать над старыми проектами, стоит рассмотреть Ultralytics YOLOv8 — надежную и широко используемую альтернативу.
Заключение#
При выборе архитектуры для компьютерного зрения нужно сопоставить теоретическую производительность с практическими условиями развертывания. EfficientDet предлагает математически элегантный подход к масштабированию, а DAMO-YOLO — впечатляющую скорость на GPU. Однако команды, для которых важны быстрая разработка, надежное развертывание и передовые возможности, найдут явные преимущества в моделях Ultralytics. Благодаря таким инновациям, как инференция без NMS и оптимизация MuSGD, YOLO26 обеспечивает прочную основу для проектов компьютерного зрения — одну из самых функциональных, удобных в сопровождении и эффективных на сегодняшний день.