DAMO-YOLO и EfficientDet#
Эволюция компьютерного зрения привела к появлению множества мощных архитектур, адаптированных под различные задачи реального мира. Одни фреймворки ориентированы на масштабирование до огромных объёмов, другие уделяют основное внимание скорости вывода в реальном времени. В этом техническом сравнении мы рассмотрим DAMO-YOLO и EfficientDet — две влиятельные модели, демонстрирующие разные подходы к решению задачи обнаружения объектов. Мы разберём их архитектуры, сравним результаты бенчмарков и в итоге выясним, почему недавно выпущенная Ultralytics YOLO26 представляет собой оптимальный выбор для современных производственных развёртываний.
Обзор архитектур#
Обе модели разработаны для решения проблемы компромисса между эффективностью и точностью, но для достижения своих целей используют принципиально разные механизмы.
DAMO-YOLO: скорость благодаря поиску нейронной архитектуры#
DAMO-YOLO разработан для расширения возможностей обнаружения объектов в реальном времени и использует автоматизированные методы поиска для создания высокоэффективных сетей, адаптированных к средам с низкой задержкой.
Сведения о DAMO-YOLO:
- Авторы: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang и Xiuyu Sun
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
В основе DAMO-YOLO лежит магистральная сеть, созданная с помощью поиска нейронной архитектуры (NAS), которая оптимизирует одновременно скорость и точность. В ней используется RepGFPN (репараметризованная обобщённая пирамидальная сеть признаков), улучшающая слияние признаков при сохранении высокой скорости вывода. Кроме того, конструкция ZeroHead снижает вычислительные затраты, обычно связанные с головами обнаружения. Модель также использует AlignedOTA (сопоставление с выравниванием на основе оптимального транспорта) и улучшение дистилляции, благодаря чему даже самые компактные варианты обучаются богатым представлениям на основе более крупных моделей.
EfficientDet: масштабируемость благодаря составному масштабированию#
В отличие от подхода, ориентированного прежде всего на скорость, EfficientDet фокусируется на систематическом масштабировании под различные вычислительные бюджеты.
Сведения об EfficientDet:
- Авторы: Mingxing Tan, Ruoming Pang и Quoc V. Le
- Организация: Google Brain
- Дата: 20.11.2019
- Arxiv: https://arxiv.org/abs/1911.09070
- GitHub: https://github.com/google/automl/tree/master/efficientdet
EfficientDet представляет BiFPN (двунаправленную пирамидальную сеть признаков), обеспечивающую простое и быстрое слияние признаков разных масштабов. В отличие от традиционных методов, которые увеличивают архитектуры за счёт произвольного добавления слоёв или каналов, EfficientDet использует метод составного масштабирования, одновременно равномерно изменяя разрешение, глубину и ширину магистральной сети, сети признаков и сетей предсказания рамок и классов. Благодаря этому модель достигает передовой точности на высокопроизводительном оборудовании и при этом предлагает компактные варианты для сред с ограниченными ресурсами.
Сравнение производительности и метрик#
При непосредственном сравнении этих моделей становится очевидным компромисс между максимальной точностью и скоростью вывода. В таблице ниже представлены основные показатели производительности, позволяющие сравнить возможности DAMO-YOLO по выводу с семейством моделей EfficientDet.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Как видно выше, EfficientDet-d7 обеспечивает наивысшую общую точность, поэтому подходит для требовательных облачных приложений. В свою очередь, серия DAMO-YOLO обеспечивает сопоставимую точность при значительно меньшей задержке на GPU, что делает её более сильным кандидатом для развёртывания на периферийных устройствах в реальном времени.
Варианты применения и рекомендации#
Выбор между DAMO-YOLO и EfficientDet зависит от конкретных требований твоего проекта, ограничений развёртывания и предпочтений в отношении экосистемы.
Когда стоит выбрать DAMO-YOLO#
DAMO-YOLO — хороший выбор для:
- Высокопроизводительная видеоаналитика: Обработка видеопотоков с высоким FPS на фиксированной инфраструктуре NVIDIA GPU, где пропускная способность при размере пакета 1 является основной метрикой.
- Промышленные производственные линии: Сценарии со строгими ограничениями по задержке GPU на выделенном оборудовании, например контроль качества в реальном времени на сборочных линиях.
- Исследования поиска нейронных архитектур: Изучение влияния автоматизированного поиска архитектур (MAE-NAS) и эффективных репараметризованных базовых сетей на производительность обнаружения.
Когда стоит выбрать EfficientDet#
EfficientDet рекомендуется для:
- Конвейеров Google Cloud и TPU: систем, тесно интегрированных с Google Cloud Vision API или инфраструктурой TPU, где EfficientDet имеет нативную оптимизацию.
- Исследований составного масштабирования: академических бенчмарков, посвящённых изучению влияния сбалансированного масштабирования глубины, ширины и разрешения сети.
- Мобильного развертывания через TFLite: проектов, которым необходим экспорт в TensorFlow Lite для Android или встраиваемых устройств под управлением Linux.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Современная альтернатива: Ultralytics YOLO26#
Хотя DAMO-YOLO и EfficientDet представляют собой важные академические достижения, для развёртывания в реальных условиях часто требуется более сбалансированный, функциональный и удобный для разработчиков подход. Именно здесь Ultralytics YOLO26 задаёт новый отраслевой стандарт.
Выпущенная в январе 2026 года, YOLO26 развивает наследие предшественников, включая Ultralytics YOLO11 и YOLOv8, кардинально меняя подход к обнаружению объектов.
YOLO26 поддерживает нативную сквозную архитектуру без NMS. Благодаря устранению подавления немаксимумов (NMS) на этапе постобработки — узкого места, которое годами ограничивало детекторы объектов, — YOLO26 обеспечивает более простой и значительно быстрый конвейер развёртывания, особенно на периферийном оборудовании.
Непревзойдённая производительность и универсальность#
YOLO26 не просто повышает скорость — она переосмысливает стабильность обучения и точность. В модели представлен оптимизатор MuSGD — гибрид SGD и Muon, вдохновлённый инновациями в обучении LLM, который обеспечивает значительно более быструю сходимость и высокую эффективность обучения. В отличие от тяжёлых альтернатив на основе Transformer, таких как RT-DETR, YOLO26 сохраняет чрезвычайно низкие требования к памяти, поэтому её можно обучать на оборудовании потребительского класса.
Кроме того, YOLO26 включает ProgLoss + STAL, значительно улучшая распознавание небольших объектов, что важно для таких задач, как аэрофотосъёмка с дронов и робототехника. Для оптимизации работы на устройствах с низким энергопотреблением в YOLO26 удалена Distribution Focal Loss (DFL), что обеспечивает до 43% более быстрый вывод на CPU по сравнению с предыдущими поколениями.
Экосистема и простота использования#
Одно из главных препятствий при работе с такими моделями, как EfficientDet, — сложный процесс интеграции. В отличие от этого, Ultralytics Platform предлагает хорошо поддерживаемую сквозную экосистему. Благодаря унифицированному API ты можешь легко переключаться между обнаружением объектов, сегментацией экземпляров, оценкой позы, классификацией изображений и ориентированными ограничивающими рамками (OBB).
Ниже показано, насколько просто обучить YOLO26 и выполнить вывод с её помощью, используя пакет Ultralytics для Python:
from ultralytics import YOLO
# Load the state-of-the-art YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset with minimal memory footprint
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run ultra-fast NMS-free inference
predictions = model.predict("image.jpg")Заключение#
Изучение материала DAMO-YOLO и EfficientDet даёт ценное представление о компромиссах между поиском нейронной архитектуры и составным масштабированием, однако современным разработчикам нужны инструменты, которые устраняют разрыв между академическими исследованиями и реалиями промышленной эксплуатации.
Для разработчиков, которые ставят на первое место простоту использования, активное сообщество с открытым исходным кодом и сбалансированное сочетание скорости и точности без компромиссов, Ultralytics YOLO26 — очевидный выбор. Её архитектура без NMS, низкие накладные расходы на обучение и бесшовная интеграция с комплексной экосистемой Ultralytics делают её оптимальным фреймворком для твоего следующего проекта в области компьютерного зрения.