DAMO-YOLO и YOLO11#
При выборе архитектуры обнаружения объектов в реальном времени для следующего проекта в области компьютерного зрения крайне важно понимать различия между ведущими моделями. Это подробное руководство содержит глубокий технический анализ DAMO-YOLO и Ultralytics YOLO11, включая их архитектуры, показатели производительности, методики обучения и оптимальные сценарии развертывания в реальных условиях.
Сведения о DAMO-YOLO:
- Авторы: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang и Xiuyu Sun
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- Документация: Документация DAMO-YOLO
Сведения о YOLO11:
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2024-09-27
- GitHub: ultralytics/ultralytics
- Документация: Документация по YOLO11
Философия архитектурного проектирования#
Базовая архитектура модели обнаружения объектов определяет скорость ее вывода, точность и адаптируемость к различным аппаратным средам.
DAMO-YOLO реализует несколько академических инноваций, в значительной степени опираясь на поиск нейронной архитектуры (NAS) для автоматического проектирования своей базовой сети. В модели используется эффективная RepGFPN (обобщенная пирамидальная сеть признаков с репараметризацией) для улучшения объединения признаков, а также конструкция ZeroHead, значительно уменьшающая громоздкую голову предсказаний, часто встречающуюся в предыдущих архитектурах. Хотя такой подход на основе NAS позволяет DAMO-YOLO достичь определенной эффективности на отдельных GPU, получаемым архитектурам иногда не хватает гибкости для беспроблемного обобщения на различных периферийных устройствах.
В отличие от нее, YOLO11 опирается на многолетние фундаментальные исследования и предлагает высокооптимизированную архитектуру, разработанную вручную. Основное внимание уделяется упрощенной базовой сети и высокоэффективной шее, которая сокращает избыточные вычисления. Одно из главных преимуществ YOLO11 — улучшенная эффективность использования параметров: модель обеспечивает высокую выразительность признаков без значительных требований к VRAM, характерных для моделей на основе Transformer, таких как RT-DETR. Благодаря этому YOLO11 отличается исключительной универсальностью и стабильно работает на потребительских GPU, мобильных устройствах и специализированных периферийных ускорителях.
Производительность и метрики#
Оценивать производительность нужно не только по итоговой точности, но и с учетом баланса между скоростью, размером модели и вычислительной нагрузкой (FLOPs).
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
Как показывает таблица, YOLO11 обеспечивает очень удачный баланс производительности. Например, вариант YOLO11s превосходит DAMO-YOLOs по точности, сохраняя при этом значительно меньшее количество параметров. Такое снижение требований к памяти напрямую уменьшает стоимость развертывания и обеспечивает более гибкую работу на периферийных устройствах.
Методики обучения и удобство использования#
Именно на конвейер обучения разработчики тратят большую часть времени, поэтому эффективность обучения имеет первостепенное значение.
DAMO-YOLO использует многоэтапный процесс обучения, в значительной степени зависящий от дистилляции знаний. Для назначения меток применяется AlignedOTA (назначение на основе оптимального транспорта), а для передачи знаний небольшим моделям-«ученикам» часто требуется обучить более крупную модель-«учителя». Эта методика значительно увеличивает объем используемой памяти CUDA и общее время вычислений, необходимое для достижения оптимальной сходимости.
В свою очередь, экосистема Ultralytics абстрагирует сложность обучения моделей. YOLO11 создана для исключительно простого использования: оптимизированный Python API и полноценные интерфейсы CLI позволяют инженерам запускать обучение на пользовательских наборах данных одной командой. Конвейер обучения изначально эффективно использует ресурсы и минимизирует скачки потребления памяти, поэтому даже крупные модели можно обучать на стандартном оборудовании.
Для обучения модели Ultralytics не требуется писать шаблонный код. Встроенные конвейеры загрузки данных, аугментации и вычисления функции потерь полностью оптимизированы для работы сразу после установки.
Вот небольшой пример того, насколько просто обучить и развернуть модель Ultralytics:
from ultralytics import YOLO
# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model effortlessly on a custom dataset
model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Export the trained model to ONNX for seamless deployment
model.export(format="onnx")Применение в реальных условиях и универсальность#
Выбор между этими архитектурами часто зависит от широты задач, которые должна решать система в среде развертывания.
Где подходит DAMO-YOLO#
DAMO-YOLO представляет собой строго фреймворк для обнаружения объектов. Он отлично проявляет себя в академических исследовательских средах, где команды изучают репараметризацию или воспроизводят конкретные эксперименты по поиску архитектур нейросетей. Его также можно развертывать в жестко ограниченных промышленных условиях, где очень специфический GPU-ускоритель идеально соответствует бэкбону, созданному с помощью NAS.
Преимущества Ultralytics#
Модели Ultralytics, включая YOLO11, превосходно подходят для реальных коммерческих приложений благодаря своей непревзойденной универсальности и поддерживаемой экосистеме. В отличие от DAMO-YOLO, фреймворк Ultralytics поддерживает множество задач на уровне ядра. От сегментации экземпляров в медицинской визуализации до оценки поз для биомеханического анализа в спорте — все это обрабатывает одна унифицированная кодовая база.
К отраслям, использующим YOLO11, относятся:
- Умное сельское хозяйство: обнаружение объектов для мониторинга состояния посевов и автоматизации уборочной техники.
- Аналитика розничной торговли: внедрение умного видеонаблюдения для анализа потока покупателей и автоматизации управления запасами.
- Логистика и цепочки поставок: высокоскоростное обнаружение штрихкодов и упаковок с использованием ориентированных ограничивающих рамок (OBB) на быстро движущихся конвейерных лентах.
Варианты применения и рекомендации#
Выбор между DAMO-YOLO и YOLO11 зависит от конкретных требований твоего проекта, ограничений среды развертывания и предпочтений в отношении экосистемы.
Когда стоит выбрать DAMO-YOLO#
DAMO-YOLO — хороший выбор для:
- Высокопроизводительная видеоаналитика: Обработка видеопотоков с высоким FPS на фиксированной инфраструктуре NVIDIA GPU, где пропускная способность при размере пакета 1 является основной метрикой.
- Промышленные производственные линии: Сценарии со строгими ограничениями по задержке GPU на выделенном оборудовании, например контроль качества в реальном времени на сборочных линиях.
- Исследования поиска нейронных архитектур: Изучение влияния автоматизированного поиска архитектур (MAE-NAS) и эффективных репараметризованных базовых сетей на производительность обнаружения.
Когда выбирать YOLO11#
YOLO11 рекомендуется для:
- Промышленного развертывания на периферийных устройствах: коммерческих приложений на таких устройствах, как Raspberry Pi или NVIDIA Jetson, где особенно важны надежность и активная поддержка.
- Многоцелевых приложений компьютерного зрения: проектов, которым в рамках единого унифицированного фреймворка требуются детектирование, сегментация, оценка позы и OBB.
- Быстрого прототипирования и развертывания: команд, которым нужно быстро перейти от сбора данных к промышленной эксплуатации с помощью оптимизированного Ultralytics Python API.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Следующее поколение: знакомство с YOLO26#
Хотя YOLO11 остается мощным и надежным вариантом, сфера компьютерного зрения быстро развивается. Для разработчиков, начинающих новые проекты, новейшая модель YOLO26 представляет собой новый передовой стандарт.
Выпущенная в январе 2026 года, YOLO26 предлагает несколько революционных улучшений:
- Сквозная архитектура без NMS: благодаря устранению постобработки Non-Maximum Suppression YOLO26 обеспечивает более быстрое детерминированное выполнение и значительно упрощает конвейеры развертывания.
- До 43% более быстрый вывод на CPU: благодаря удалению Distribution Focal Loss (DFL) модель особенно хорошо подходит для периферийных устройств и устройств с низким энергопотреблением, не оснащенных выделенными GPU.
- Оптимизатор MuSGD: этот гибридный оптимизатор, объединяющий инновации обучения LLM и идеи Moonshot AI, обеспечивает стабильную и быструю сходимость во время обучения.
- Продвинутые функции потерь: благодаря использованию ProgLoss + STAL YOLO26 демонстрирует заметное улучшение распознавания небольших объектов, что особенно важно для аэрофотосъемки и робототехники.
Заключение#
И DAMO-YOLO, и YOLO11 внесли значительный вклад в развитие быстрого и точного компьютерного зрения. DAMO-YOLO предлагает интересные академические идеи в области поиска архитектур и дистилляции, тогда как Ultralytics YOLO11 (и революционная YOLO26) обеспечивает превосходный опыт для разработчиков.
Благодаря более низким требованиям к памяти, обширной документации, поддержке многозадачности и интеграции с мощной Ultralytics Platform модели Ultralytics остаются главным выбором для исследователей и корпоративных инженеров, создающих надежные и масштабируемые решения на основе ИИ. Если ты изучаешь другие современные архитектуры, сравнение YOLO26 и RT-DETR даст дополнительные сведения об альтернативах на основе Transformer.