YOLO Vision 2026:

EfficientDet против DAMO-YOLO#

При создании масштабируемых конвейеров computer vision выбор правильной архитектуры модели является критически важным решением, которое влияет как на реализуемость развертывания, так и на точность обнаружения. Это руководство предлагает глубокое техническое сравнение двух известных архитектур в области визуального распознавания: EfficientDet и DAMO-YOLO.

Хотя обе модели принесли значительные инновации в область object detection, стремительное развитие искусственного интеллекта в области зрения проложило путь к более интегрированным экосистемам. В ходе этого анализа мы рассмотрим основные принципы работы этих устаревших сетей и покажем, почему современные решения, такие как Ultralytics Platform и Ultralytics YOLO26, стали отраслевым стандартом для производственных сред.

EfficientDet: масштабируемое и эффективное обнаружение объектов#

Представленная исследователями Google, модель EfficientDet была разработана для систематического масштабирования архитектуры при сохранении высокой эффективности. Этого удалось достичь за счет использования составного масштабирования по глубине сети, ширине и разрешению входных данных.

Сведения об EfficientDet: Авторы: Mingxing Tan, Ruoming Pang и Quoc V. Le
Организация: Google Brain
Дата: 2019-11-20
Arxiv: 1911.09070
GitHub: google/automl

Архитектурные инновации#

Основным вкладом EfficientDet является двунаправленная пирамидальная сеть признаков (BiFPN). В отличие от традиционных FPN, BiFPN обеспечивает простое и быстрое многомасштабное слияние признаков за счет использования обучаемых весов для определения важности различных входных признаков. Это комбинируется с backbone EfficientNet, в результате чего получается семейство моделей (от D0 до D7), которые масштабируются предсказуемо.

Сильные и слабые стороны#

Ключевая сильная сторона EfficientDet заключается в эффективности ее параметров. Для задач, где необходимо максимизировать mean Average Precision (mAP) в жестко ограниченных облачных средах, метод составного масштабирования является весьма предсказуемым. Тем не менее, EfficientDet известна своей сложностью обучения с нуля и часто требует значительной hyperparameter tuning. Более того, сильная зависимость от конкретных операций TensorFlow делает переход на краевые устройства через ONNX или TensorRT более сложным по сравнению с оптимизированными export capabilities, представленными в современных моделях YOLO.

Узнай больше об EfficientDet

DAMO-YOLO: автоматизированный поиск архитектуры в действии#

DAMO-YOLO представляет собой особый подход, использующий нейросетевой поиск архитектуры (NAS) для автоматического проектирования оптимальных структур сетей для вывода в реальном времени.

Сведения о DAMO-YOLO: Авторы: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang и Xiuyu Sun
Организация: Alibaba Group
Дата: 2022-11-23
Arxiv: 2211.15444v2
GitHub: tinyvision/DAMO-YOLO

Архитектурные инновации#

DAMO-YOLO представляет несколько инновационных технологий. В нем используется созданный с помощью NAS бэкбон под названием MAE-NAS, эффективная структура RepGFPN для шеи и дизайн ZeroHead, который существенно снижает вычислительную сложность детектирующей головки. Кроме того, в нем применяется AlignedOTA для назначения меток и активно используется улучшение с помощью дистилляции знаний для повышения производительности его более мелких вариантов.

Сильные и слабые стороны#

DAMO-YOLO превосходит других в скорости инференса на GPU, специально разработанной для развертывания на архитектурах NVIDIA с использованием TensorRT. За счет удаления тяжелых структур головы модель обеспечивает предсказания с низкой задержкой. И наоборот, автоматический поиск архитектуры может сделать структуру модели непрозрачной и трудной для ручной отладки или тонкой настройки для пользовательских периферийных устройств. В отличие от высокоуниверсальной Ultralytics YOLO11, DAMO-YOLO в первую очередь ориентирована на стандартное обнаружение ограничивающих рамок и не имеет встроенной поддержки для сложных задач, таких как pose estimation или oriented bounding box (OBB) обнаружение "из коробки".

Узнай больше о DAMO-YOLO

Сравнение производительности#

Понимание эмпирических компромиссов имеет важное значение для выбора модели. В таблице ниже сравнивается семейство EfficientDet с серией DAMO-YOLO по ключевым performance metrics.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
Анализ данных

EfficientDet-d7 достигает наивысшей теоретической точности, но требует огромной вычислительной мощности, что делает ее непригодной для edge AI. DAMO-YOLO предлагает исключительную скорость TensorRT, хотя обычно требует больше параметров, чем модели EfficientDet более низкого уровня, для достижения сопоставимой точности.

Сценарии использования и рекомендации#

Выбор между EfficientDet и DAMO-YOLO зависит от твоих конкретных требований к проекту, ограничений развертывания и предпочтений в экосистеме.

Когда стоит выбрать EfficientDet#

EfficientDet — отличный выбор, если:

  • Конвейеры Google Cloud и TPU: Системы с глубокой интеграцией в Google Cloud Vision API или инфраструктуру TPU, где EfficientDet имеет встроенную оптимизацию.
  • Исследования составного масштабирования: Академическое тестирование, сфокусированное на изучении эффектов сбалансированного масштабирования глубины, ширины и разрешения сети.
  • Мобильное развертывание через TFLite: Проекты, которым специально требуется экспорт TensorFlow Lite для Android или встраиваемых устройств Linux.

Когда выбирать DAMO-YOLO#

DAMO-YOLO рекомендуется для:

  • Высокопроизводительной видеоаналитики: обработки видеопотоков с высоким FPS на фиксированной инфраструктуре NVIDIA GPU, где пропускная способность при batch-1 является основной метрикой.
  • Промышленных производственных линий: сценариев с жесткими ограничениями по задержке GPU на специализированном оборудовании, таких как проверка качества в реальном времени на сборочных линиях.
  • Исследований Neural Architecture Search: изучения влияния автоматизированного поиска архитектуры (MAE-NAS) и эффективных репараметризованных бэкендов на производительность детекции.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает наилучшее сочетание производительности и удобства для разработчика:

  • Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
  • Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
  • Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.

Преимущество Ultralytics: развитие за пределами устаревших моделей#

Хотя EfficientDet и DAMO-YOLO дают ценные академические знания, современным разработчикам требуются фреймворки, которые балансируют между передовой производительностью и удобством использования для разработчиков. Именно здесь Ultralytics ecosystem превосходит остальных.

Непревзойденная простота использования и экосистема#

Развертывание моделей из отдельных, сильно кастомизированных исследовательских репозиториев часто приводит к кошмарам интеграции. Ultralytics предоставляет единую, глубоко well-maintained ecosystem с обширной документацией и питоническим API. Независимо от того, используешь ли ты Google Colab для обучения или выполняешь экспорт в CoreML для мобильного инференса, конвейер требует всего нескольких строк кода.

from ultralytics import YOLO

# Load the highly recommended YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model effortlessly on a custom dataset
model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Export the trained model to ONNX for production
model.export(format="onnx")

Революция YOLO26#

Для разработчиков, оценивающих EfficientDet или DAMO-YOLO, Ultralytics YOLO26 представляет собой ультимативный эволюционный шаг. Выпущенная в начале 2026 года, она представляет возможности, меняющие парадигму:

  • Сквозной дизайн без NMS: Впервые предложенная YOLOv10, YOLO26 изначально исключает необходимость постпроцессинга подавления немаксимумов (NMS). Это приводит к значительно более простым архитектурам развертывания и стабильной задержке на различных аппаратных средствах.
  • До 43% более быстрый вывод на CPU: для периферийных развертываний, где не хватает мощных GPU (сценарии, с которыми DAMO-YOLO справляется с трудом), YOLO26 сильно оптимизирована, обеспечивая огромный прирост скорости на стандартных CPU.
  • Оптимизатор MuSGD: преодолевая разрыв между инновациями LLM и компьютерным зрением, YOLO26 включает оптимизатор MuSGD (вдохновленный Moonshot AI), обеспечивающий невероятно стабильное обучение и быструю сходимость по сравнению с хрупкими циклами обучения EfficientDet.
  • Удаление DFL: Удаление функции потерь фокуса распределения (DFL) упрощает процесс экспорта, гарантируя превосходную совместимость с маломощными микроконтроллерами и устройствами Raspberry Pi.
  • ProgLoss + STAL: эти передовые функции потерь дают значительные улучшения в распознавании мелких объектов — области, где старые архитектуры традиционно терпят неудачу.

Эффективность памяти и универсальность задач#

В отличие от transformer моделей или сильно объединенных NAS-сетей, модели Ultralytics характеризуются своей строгой эффективностью памяти. Они потребляют значительно меньший объем памяти CUDA во время обучения, обеспечивая быстрые итерации на оборудовании потребительского уровня.

Более того, в то время как EfficientDet и DAMO-YOLO строго ограничены ограничивающими рамками, Ultralytics изначально поддерживает instance segmentation и image classification в рамках того же интуитивно понятного фреймворка. Для пользователей, поддерживающих старые проекты, Ultralytics YOLOv8 остается надежной и широко развертываемой альтернативой, которую стоит изучить.

Заключение#

Выбор правильной архитектуры зрения включает в себя сопоставление сырой теоретической производительности с реальностью развертывания. EfficientDet предлагает математически элегантный подход к масштабированию, а DAMO-YOLO обеспечивает впечатляющую исходную скорость GPU. Тем не менее, для команд, уделяющих приоритетное внимание быстрой разработке, надежным развертываниям и передовым функциям, Ultralytics models явно вырываются вперед. Сочетая в себе такие инновации, как инференс без NMS и оптимизацию MuSGD, YOLO26 гарантирует, что твои проекты компьютерного зрения построены на самой способной, поддерживаемой и эффективной основе из доступных на сегодняшний день.

Комментарии