DAMO-YOLO и YOLO11#
При выборе архитектуры обнаружения объектов в реальном времени для следующего проекта в области компьютерного зрения важно понимать нюансы, отличающие ведущие модели. В этом подробном руководстве представлен углублённый технический анализ DAMO-YOLO и Ultralytics YOLO11: рассматриваются их архитектуры, показатели производительности, методики обучения и оптимальные сценарии развертывания в реальных условиях.
Сведения о DAMO-YOLO:
- Авторы: Сяньчжэ Сюй, Ици Цзян, Вэйхуа Чэнь, Илуне Хуан, Юань Чжан и Сюйюй Сунь
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- Документация: Документация DAMO-YOLO
Сведения о YOLO11:
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2024-09-27
- GitHub: ultralytics/ultralytics
- Документация: Документация YOLO11
Философия проектирования архитектуры#
Архитектура модели обнаружения объектов определяет скорость инференса, точность и адаптивность модели в различных аппаратных средах.
DAMO-YOLO предлагает несколько академических инноваций и активно использует поиск нейронной архитектуры (NAS) для автоматического проектирования базовой сети. Для улучшения слияния признаков применяется эффективная RepGFPN (обобщённая пирамида признаков с репараметризацией), а архитектура ZeroHead значительно уменьшает размер громоздкой головы предсказаний, характерной для предыдущих архитектур. Такой подход на основе NAS позволяет DAMO-YOLO добиться определённой эффективности на выбранных GPU, но полученным архитектурам иногда не хватает гибкости для беспроблемного обобщения на разные периферийные устройства.
В отличие от неё, YOLO11 опирается на многолетние фундаментальные исследования и предлагает тщательно оптимизированную архитектуру, разработанную вручную. В ней используются упрощённая базовая сеть и высокоэффективная шея, сокращающая избыточные вычисления. Одно из главных преимуществ YOLO11 — улучшенная эффективность использования параметров: модель обеспечивает высокую выразительность признаков без значительных требований к VRAM, типичных для моделей на основе Transformer, таких как RT-DETR. Благодаря этому YOLO11 отличается исключительной универсальностью и стабильно работает на потребительских GPU, мобильных устройствах и специализированных периферийных ускорителях.
Производительность и метрики#
При оценке производительности важно смотреть не только на итоговую точность, но и учитывать баланс между скоростью, размером модели и вычислительной нагрузкой (FLOPs).
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Как видно из таблицы, YOLO11 обеспечивает весьма удачный баланс производительности. Например, вариант YOLO11s превосходит DAMO-YOLOs по точности и при этом содержит значительно меньше параметров. Снижение требований к памяти напрямую уменьшает затраты на развертывание и повышает производительность на периферийных устройствах.
Методики обучения и удобство использования#
Разработчики тратят большую часть времени на конвейер обучения, поэтому его эффективность имеет первостепенное значение.
DAMO-YOLO использует многоэтапный процесс обучения, во многом основанный на дистилляции знаний. Для назначения меток применяется AlignedOTA (оптимальное транспортное сопоставление), а для передачи знаний более компактным моделям-«ученикам» часто требуется обучить крупную модель-«учителя». Такая методика значительно увеличивает потребление памяти CUDA и общее время вычислений, необходимое для достижения оптимальной сходимости.
Экосистема Ultralytics избавляет от сложностей обучения моделей. YOLO11 создана для исключительного удобства: благодаря упрощённому Python API и полноценным интерфейсам CLI инженеры могут запускать обучение на собственных наборах данных одной командой. Конвейер обучения эффективно использует ресурсы и сводит к минимуму скачки потребления памяти, поэтому даже крупные модели можно обучать на стандартном оборудовании.
Для обучения модели Ultralytics не нужен шаблонный код. Встроенные конвейеры загрузки данных, аугментации и вычисления функции потерь полностью оптимизированы и готовы к работе.
Вот краткий пример того, как просто обучить и развернуть модель Ultralytics:
from ultralytics import YOLO
# Загрузи предварительно обученную малую модель YOLO11
model = YOLO("yolo11s.pt")
# Легко обучи модель на собственном наборе данных
model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Экспортируй обученную модель в ONNX для простого развертывания
model.export(format="onnx")Применение в реальных условиях и универсальность#
Выбор между этими архитектурами часто зависит от разнообразия задач, которые должна решать среда развертывания.
Для каких задач подходит DAMO-YOLO#
DAMO-YOLO — исключительно фреймворк для обнаружения объектов. Он особенно полезен в академических исследованиях, где команды изучают репараметризацию или воспроизводят отдельные эксперименты с поиском нейронной архитектуры. Его также можно развернуть в жёстко ограниченных промышленных средах, где конкретный GPU-ускоритель идеально подходит для базовой сети, созданной с помощью NAS.
Преимущества Ultralytics#
Модели Ultralytics, включая YOLO11, отлично подходят для коммерческого применения благодаря непревзойдённой универсальности и тщательно поддерживаемой экосистеме. В отличие от DAMO-YOLO, фреймворк Ultralytics изначально поддерживает несколько задач. От сегментации экземпляров в медицинской визуализации до оценки позы для биомеханического анализа в спорте — всё это можно выполнять на единой кодовой базе.
Сферы, в которых применяют YOLO11:
- Умное сельское хозяйство: обнаружение объектов для мониторинга состояния посевов и автоматизации уборочной техники.
- Аналитика в розничной торговле: внедрение умного видеонаблюдения для анализа потока покупателей и автоматизации управления запасами.
- Логистика и цепочки поставок: скоростное обнаружение штрихкодов и посылок на быстро движущихся конвейерных лентах с помощью ориентированных ограничивающих рамок (OBB).
Сценарии использования и рекомендации#
Выбор между DAMO-YOLO и YOLO11 зависит от требований конкретного проекта, ограничений среды развертывания и предпочтений в отношении экосистемы.
Когда стоит выбрать DAMO-YOLO#
DAMO-YOLO — хороший выбор для:
- Высокопроизводительная видеоаналитика: Обработка видеопотоков с высокой частотой кадров на фиксированной инфраструктуре NVIDIA GPU, где основной показатель — пропускная способность при размере пакета 1.
- Промышленные производственные линии: Сценарии со строгими ограничениями по задержке GPU на выделенном оборудовании, например контроль качества в реальном времени на сборочных линиях.
- Исследования в области поиска нейросетевых архитектур: Изучение влияния автоматизированного поиска архитектур (MAE-NAS) и эффективных перенастраиваемых базовых сетей на качество обнаружения.
Когда выбирать YOLO11#
YOLO11 рекомендуется для:
- Промышленное развертывание на периферийных устройствах: коммерческие приложения на устройствах вроде Raspberry Pi или NVIDIA Jetson, где особенно важны надёжность и активная поддержка.
- Многозадачные приложения компьютерного зрения: проекты, в которых в рамках единого фреймворка требуются обнаружение объектов, сегментация, оценка позы и OBB.
- Быстрое прототипирование и развертывание: команды, которым нужно быстро пройти путь от сбора данных до промышленной эксплуатации с помощью удобного Python API Ultralytics.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Следующее поколение: знакомься с YOLO26#
YOLO11 остаётся мощным и надёжным решением, однако область компьютерного зрения быстро развивается. Для разработчиков, начинающих новые проекты, новейшая модель YOLO26 задаёт новый уровень качества.
Выпущенная в январе 2026 года YOLO26 предлагает несколько революционных улучшений:
- Сквозная архитектура без NMS: благодаря опциональной голове с назначением один-к-одному (
nms=False) YOLO26 пропускает постобработку Non-Maximum Suppression, обеспечивая более быстрый и детерминированный инференс и значительно упрощая конвейеры развертывания. - Инференс на CPU до 43% быстрее: благодаря удалению Distribution Focal Loss (DFL) модель особенно хорошо подходит для периферийных устройств и устройств с низким энергопотреблением без выделенных GPU.
- Оптимизатор MuSGD: этот гибридный оптимизатор объединяет новшества из обучения LLM, вдохновлённые Moonshot AI, и обеспечивает стабильную и быструю сходимость во время обучения.
- Продвинутые функции потерь: благодаря ProgLoss + STAL YOLO26 заметно лучше распознаёт мелкие объекты, что важно для аэрофотосъёмки и робототехники.
Заключение#
И DAMO-YOLO, и YOLO11 внесли значительный вклад в развитие быстрого и точного компьютерного зрения. DAMO-YOLO представляет интерес с академической точки зрения благодаря исследованиям поиска архитектур и дистилляции, а Ultralytics YOLO11 и революционная YOLO26 обеспечивают более удобную работу для разработчиков.
Благодаря сниженным требованиям к памяти, подробной документации, поддержке нескольких задач и интеграции с мощной платформой Ultralytics модели Ultralytics остаются лучшим выбором для исследователей и инженеров корпоративного сектора, которые создают надёжные и масштабируемые решения на базе AI. Если ты рассматриваешь другие современные архитектуры, сравнение YOLO26 и RT-DETR поможет больше узнать об альтернативах на основе Transformer.