DAMO-YOLO и EfficientDet#
Развитие компьютерного зрения привело к появлению множества мощных архитектур, предназначенных для самых разных задач реального мира. Одни фреймворки ориентированы на масштабируемость, другие делают упор на скорость инференса в реальном времени. В этом техническом сравнении мы рассмотрим DAMO-YOLO и EfficientDet — две влиятельные модели с разными подходами к решению задачи детекции объектов. Мы подробно разберём их архитектуры, сравним результаты тестов производительности и объясним, почему недавно выпущенная Ultralytics YOLO26 — оптимальный выбор для современных промышленных развёртываний.
Обзор архитектур#
Обе модели созданы для поиска компромисса между эффективностью и точностью, но для достижения этих целей они используют принципиально разные механизмы.
DAMO-YOLO: скорость благодаря поиску нейронной архитектуры#
DAMO-YOLO создана для расширения возможностей детекции в реальном времени. Модель использует автоматизированные методы поиска, чтобы создавать высокоэффективные сети, оптимизированные для сред с низкой задержкой.
Сведения о DAMO-YOLO:
- Авторы: Сяньчжэ Сюй, Ици Цзян, Вэйхуа Чэнь, Илуне Хуан, Юань Чжан и Сюйюй Сунь
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
В основе DAMO-YOLO лежит архитектура с поиском нейронной архитектуры (NAS), оптимизированная и по скорости, и по точности. В модели используется RepGFPN (обобщённая пирамида признаков с перепараметризацией), которая улучшает слияние признаков, сохраняя высокую скорость инференса. Кроме того, архитектура ZeroHead сокращает вычислительные затраты, обычно связанные с головами детекции. Модель также использует AlignedOTA (согласованное назначение на основе оптимального транспорта) и дистилляцию, благодаря которым даже самые компактные варианты перенимают богатые представления у более крупных моделей.
EfficientDet: масштабирование с помощью комплексного масштабирования#
В отличие от подхода, в первую очередь ориентированного на скорость, EfficientDet фокусируется на систематическом масштабировании под разные вычислительные бюджеты.
Подробнее об EfficientDet:
- Авторы: Mingxing Tan, Ruoming Pang и Quoc V. Le
- Организация: Google Brain
- Дата: 2019-11-20
- Arxiv: https://arxiv.org/abs/1911.09070
- GitHub: https://github.com/google/automl/tree/master/efficientdet
EfficientDet представляет BiFPN (двунаправленную пирамиду признаков), которая позволяет легко и быстро объединять признаки разных масштабов. В отличие от традиционных методов, при которых архитектуру увеличивают, произвольно добавляя слои или каналы, EfficientDet использует комплексное масштабирование: оно одновременно и равномерно изменяет разрешение, глубину и ширину базовой сети, сети признаков и сетей для предсказания рамок и классов. Благодаря этому модель обеспечивает точность на уровне лучших решений на мощном оборудовании, а её компактные варианты подходят для сред с ограниченными ресурсами.
Сравнение производительности и метрик#
При прямом сравнении этих моделей становится очевиден компромисс между максимальной точностью и скоростью инференса. В таблице ниже приведены ключевые показатели производительности, которые показывают, как возможности инференса DAMO-YOLO соотносятся с семейством моделей EfficientDet.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Как видно выше, EfficientDet-d7 обеспечивает наивысшую общую точность и подходит для требовательных облачных приложений. В то же время серия DAMO-YOLO обеспечивает весьма конкурентную точность при значительно меньшей задержке на GPU, что делает её более подходящим вариантом для развертывания в реальном времени на периферийных устройствах.
Сценарии использования и рекомендации#
Выбор между DAMO-YOLO и EfficientDet зависит от требований твоего проекта, ограничений развертывания и предпочтительной экосистемы.
Когда стоит выбрать DAMO-YOLO#
DAMO-YOLO — хороший выбор для:
- Высокопроизводительная видеоаналитика: Обработка видеопотоков с высокой частотой кадров на фиксированной инфраструктуре NVIDIA GPU, где основной показатель — пропускная способность при размере пакета 1.
- Промышленные производственные линии: Сценарии со строгими ограничениями по задержке GPU на выделенном оборудовании, например контроль качества в реальном времени на сборочных линиях.
- Исследования в области поиска нейросетевых архитектур: Изучение влияния автоматизированного поиска архитектур (MAE-NAS) и эффективных перенастраиваемых базовых сетей на качество обнаружения.
Когда стоит выбрать EfficientDet#
EfficientDet подойдёт для следующих задач:
- Google Cloud и конвейеры TPU: Системы, тесно интегрированные с API Google Cloud Vision или инфраструктурой TPU, где EfficientDet оптимизирована изначально.
- Исследования составного масштабирования: Академические исследования и сравнительное тестирование, посвящённые влиянию сбалансированного масштабирования глубины, ширины и разрешения сети.
- Развертывание на мобильных устройствах через LiteRT: Проекты, для которых требуется экспорт в LiteRT (ранее TensorFlow Lite) для Android или встраиваемых устройств с Linux.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Современная альтернатива: Ultralytics YOLO26#
Хотя DAMO-YOLO и EfficientDet стали важными академическими достижениями, для практического развертывания зачастую нужен более сбалансированный, функциональный и удобный для разработчиков подход. Именно здесь Ultralytics YOLO26 задаёт новый отраслевой стандарт.
Выпущенная в январе 2026 года, YOLO26 продолжает традиции предшественников, в том числе Ultralytics YOLO11 и YOLOv8, и кардинально меняет подход к детекции объектов.
YOLO26 использует встроенную сквозную архитектуру без NMS (nms=False). Благодаря отказу от подавления немаксимумов (NMS) на этапе постобработки — узкого места, которое годами тормозило детекторы объектов, — YOLO26 обеспечивает более простой и значительно быстрый процесс развертывания, особенно на периферийном оборудовании.
Непревзойдённая производительность и универсальность#
YOLO26 не просто повышает скорость — она выводит стабильность обучения и точность на новый уровень. В модели появился оптимизатор MuSGD — гибрид SGD и Muon, вдохновлённый инновациями в обучении LLM. Он обеспечивает значительно более быструю сходимость и повышает эффективность обучения. В отличие от ресурсоёмких альтернатив на базе Transformer, таких как RT-DETR, YOLO26 требует очень мало памяти и может обучаться на обычном потребительском оборудовании.
Кроме того, в YOLO26 используются ProgLoss + STAL, которые значительно улучшают распознавание мелких объектов — это важно для таких задач, как съёмка с дронов и робототехника. Для оптимизации под маломощные устройства из YOLO26 убрали Distribution Focal Loss (DFL), что позволило ускорить инференс на CPU до 43% по сравнению с предыдущими поколениями.
Экосистема и простота использования#
Одна из главных сложностей моделей вроде EfficientDet — сложный процесс интеграции. В отличие от них, платформа Ultralytics предлагает хорошо поддерживаемую сквозную экосистему. Благодаря унифицированному API пользователи могут легко переключаться между детекцией, сегментацией экземпляров, классификацией изображений, оценкой позы и ориентированными ограничивающими рамками (OBB).
Вот как просто обучить YOLO26 и запустить инференс с помощью пакета Ultralytics для Python:
from ultralytics import YOLO
# Загружаем компактную модель YOLO26, соответствующую передовым достижениям
model = YOLO("yolo26n.pt")
# Обучаем модель на собственном наборе данных с минимальным потреблением памяти
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Запускаем сверхбыстрый инференс без NMS
predictions = model.predict("https://ultralytics.com/images/bus.jpg", nms=False)Заключение#
Сравнение DAMO-YOLO и EfficientDet помогает понять компромиссы между поиском нейронной архитектуры и комплексным масштабированием, однако современным разработчикам нужны инструменты, которые соединяют академические исследования с реалиями промышленной эксплуатации.
Если для тебя важны простота использования, активное сообщество открытого исходного кода и оптимальный баланс скорости и точности, Ultralytics YOLO26 — очевидный выбор. Архитектура без NMS, низкие затраты на обучение и бесшовная интеграция с комплексной экосистемой Ultralytics делают её идеальным решением для твоего следующего проекта в области компьютерного зрения.