YOLO Vision 2026:

DAMO-YOLO против YOLO11#

При выборе архитектуры для детекции объектов в реальном времени для твоего следующего проекта по компьютерному зрению критически важно понимать нюансы между ведущими моделями. Это подробное руководство содержит глубокий технический анализ, сравнивающий DAMO-YOLO и Ultralytics YOLO11, исследуя их архитектуры, метрики производительности, методологии обучения и идеальные сценарии развертывания в реальных условиях.

Сведения о DAMO-YOLO:
Авторы: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang и Xiuyu Sun
Организация: Alibaba Group
Дата: 2022-11-23
Arxiv: 2211.15444v2
GitHub: tinyvision/DAMO-YOLO
Документация: Документация DAMO-YOLO

Сведения о YOLO11:
Авторы: Glenn Jocher и Jing Qiu
Организация: Ultralytics
Дата: 2024-09-27
GitHub: ultralytics/ultralytics
Документация: Документация YOLO11

Философия архитектурного проектирования#

Базовая архитектура модели детекции объектов определяет скорость её вывода, точность и адаптируемость к различным аппаратным средам.

DAMO-YOLO внедряет ряд академических инноваций, в значительной степени полагаясь на Neural Architecture Search (NAS) для автоматического проектирования своего бэкенда. Модель использует эффективную RepGFPN (Reparameterized Generalized Feature Pyramid Network) для улучшения объединения признаков и дизайн ZeroHead, который значительно уменьшает массивную «голову» предсказания, часто встречавшуюся в предыдущих архитектурах. Хотя этот подход на основе NAS позволяет DAMO-YOLO достигать определенных показателей эффективности на выбранных GPU, полученные архитектуры иногда лишены гибкости, необходимой для бесшовной работы на разнообразных периферийных устройствах.

В отличие от них, YOLO11 опирается на многолетние фундаментальные исследования, чтобы предложить высоко оптимизированную архитектуру ручной сборки. Она сосредоточена на оптимизированном бэкбоне и высокоэффективной нейросети для шеи (neck), которая сокращает избыточные вычисления. Одним из главных преимуществ YOLO11 является ее улучшенная эффективность использования параметров: она обеспечивает высокое представление признаков без высоких требований к видеопамяти, характерных для моделей на базе Transformer, таких как RT-DETR. Это делает YOLO11 исключительно универсальной, позволяя ей плавно работать на потребительских GPU, мобильных устройствах и специализированных периферийных ускорителях.

Производительность и метрики#

Оценка производительности требует смотреть дальше базовой точности, учитывая баланс между скоростью, размером модели и вычислительной нагрузкой (FLOPs).

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

Как показывает таблица, YOLO11 достигает весьма благоприятного баланса производительности. Например, вариант YOLO11s превосходит DAMO-YOLOs по точности, сохраняя при этом значительно меньший объем параметров. Такое сокращение требований к памяти напрямую приводит к снижению затрат на развертывание и более быстрой работе на периферийных устройствах.

Узнай больше о YOLO11

Методики обучения и удобство использования#

Конвейер обучения — это то, где разработчики проводят большую часть своего времени, поэтому эффективность обучения является первостепенной задачей.

DAMO-YOLO использует многоэтапный процесс обучения, сильно зависящий от дистилляции знаний. В нем используется AlignedOTA (Optimal Transport Assignment) для назначения меток, и часто требуется обучение более крупной модели-"учителя" для дистилляции знаний в меньшие модели-"ученики". Эта методология резко увеличивает нагрузку на CUDA memory и общее время вычислений, необходимое для достижения оптимальной сходимости.

И наоборот, экосистема Ultralytics избавляет от сложности обучения моделей. YOLO11 разработана для исключительной простоты использования и оснащена оптимизированным Python API и исчерпывающими интерфейсами CLI, которые позволяют инженерам запускать обучение на пользовательских наборах данных одной командой. Конвейер обучения по своей сути эффективен с точки зрения ресурсов, минимизируя пики памяти, благодаря чему даже более крупные модели можно обучать на стандартном оборудовании.

Оптимизированное обучение с Ultralytics

Обучение модели Ultralytics не требует написания шаблонного кода. Встроенные конвейеры для загрузки данных, аугментации и вычисления функции потерь полностью оптимизированы «из коробки».

Вот краткий пример того, как просто обучить и развернуть модель Ultralytics:

from ultralytics import YOLO

# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")

# Train the model effortlessly on a custom dataset
model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)

# Export the trained model to ONNX for seamless deployment
model.export(format="onnx")

Узнай больше о YOLO11

Применение в реальных условиях и универсальность#

Выбор между этими архитектурами часто зависит от широты задач, требуемых твоей средой развертывания.

Где подходит DAMO-YOLO#

DAMO-YOLO — это строго фреймворк для детекции объектов. Он превосходен в академических исследовательских средах, где команды изучают репараметризацию или воспроизводят специфические эксперименты Neural Architecture Search. Он также может быть развернут в жестко ограниченных промышленных средах, где очень специфический GPU-ускоритель идеально соответствует бэкенду, сгенерированному NAS.

Преимущество Ultralytics#

Модели Ultralytics, включая YOLO11, блистают в реальных коммерческих приложениях благодаря своей непревзойденной универсальности и хорошо поддерживаемой экосистеме. В отличие от DAMO-YOLO, фреймворк Ultralytics изначально поддерживает многомодальные задачи. От сегментации экземпляров в медицинской визуализации до оценки позы для биомеханического анализа в спорте — все это обрабатывается единой унифицированной кодовой базой.

Отрасли, использующие YOLO11, включают:

  • Умное сельское хозяйство: использование детекции объектов для мониторинга здоровья сельскохозяйственных культур и автоматизации уборочной техники.
  • Ритейл-аналитика: Внедрение умного видеонаблюдения для анализа клиентского трафика и автоматизации управления запасами.
  • Логистика и цепочки поставок: Высокоскоростное обнаружение штрихкодов и упаковок с использованием ориентированных ограничивающих рамок (OBB) на быстро движущихся конвейерных лентах.

Сценарии использования и рекомендации#

Выбор между DAMO-YOLO и YOLO11 зависит от требований твоего конкретного проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда выбирать DAMO-YOLO#

DAMO-YOLO — сильный выбор для:

  • Высокопроизводительной видеоаналитики: обработки видеопотоков с высоким FPS на фиксированной инфраструктуре NVIDIA GPU, где пропускная способность при batch-1 является основной метрикой.
  • Промышленных производственных линий: сценариев с жесткими ограничениями по задержке GPU на специализированном оборудовании, таких как проверка качества в реальном времени на сборочных линиях.
  • Исследований Neural Architecture Search: изучения влияния автоматизированного поиска архитектуры (MAE-NAS) и эффективных репараметризованных бэкендов на производительность детекции.

Когда выбирать YOLO11#

YOLO11 рекомендуется для:

  • Развертывание на периферийных устройствах для продакшена: Коммерческие приложения на таких устройствах, как Raspberry Pi или NVIDIA Jetson, где надежность и активное обслуживание имеют первостепенное значение.
  • Многозадачные приложения компьютерного зрения: Проекты, требующие обнаружения, сегментации, оценки позы и OBB в рамках единого универсального фреймворка.
  • Быстрое прототипирование и развертывание: Команды, которым необходимо быстро перейти от сбора данных к продакшену с помощью удобного Ultralytics Python API.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает наилучшее сочетание производительности и удобства для разработчика:

  • Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
  • Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
  • Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.

Следующее поколение: представляем YOLO26#

Хотя YOLO11 остается мощным и надежным выбором, ландшафт компьютерного зрения развивается быстро. Для разработчиков, запускающих новые проекты, новейшая модель YOLO26 представляет собой новый передовой уровень (SOTA).

Выпущенная в январе 2026 года, YOLO26 представляет несколько революционных достижений:

  • Сквозной дизайн без NMS: исключая постобработку Non-Maximum Suppression, YOLO26 обеспечивает более быстрое, детерминированное время вывода и драматически упрощает конвейеры развертывания.
  • До 43% быстрее на CPU: благодаря удалению Distribution Focal Loss (DFL), модель исключительно хорошо подходит для периферийных и маломощных устройств, лишенных выделенных GPU.
  • Оптимизатор MuSGD: интегрируя инновации обучения LLM (вдохновленные Moonshot AI), этот гибридный оптимизатор обеспечивает стабильную и быструю сходимость во время обучения.
  • Продвинутые функции потерь: используя ProgLoss + STAL, YOLO26 демонстрирует заметные улучшения в распознавании мелких объектов, что критично для аэрофотосъемки и робототехники.

Узнай больше о YOLO26

Заключение#

И DAMO-YOLO, и YOLO11 внесли значительный вклад в развитие быстрого и точного компьютерного зрения. В то время как DAMO-YOLO предлагает интересные академические идеи в области поиска архитектур и дистилляции, Ultralytics YOLO11 (и новаторская модель YOLO26) обеспечивает превосходный опыт разработчика.

Благодаря более низким требованиям к памяти, обширной документации, многозадачным возможностям и интеграции с мощной Ultralytics Platform, модели Ultralytics остаются главным выбором для исследователей и корпоративных инженеров, желающих создавать надежные и масштабируемые ИИ-решения. Для тех, кто изучает другие передовые архитектуры, сравнение YOLO26 против RT-DETR дает дополнительное представление об альтернативах на базе Transformer.

Комментарии