DAMO-YOLO и YOLOv6-3.0#
Стремительное развитие компьютерного зрения привело к появлению узкоспециализированных архитектур для промышленных задач. Среди них особенно выделяются две мощные модели, ориентированные на производительность в реальном времени и эффективность развёртывания: DAMO-YOLO и YOLOv6-3.0. На этой странице подробно сравниваются их архитектуры, метрики производительности и методы обучения, чтобы помочь тебе выбрать вариант для развёртывания.
DAMO-YOLO: поиск архитектуры нейронной сети для обнаружения объектов#
DAMO-YOLO разработали исследователи Alibaba Group. Эта модель предлагает новый подход в семействе YOLO: поиск архитектуры нейронной сети (NAS) глубоко интегрирован в структуру её базовой сети.
- Авторы: Сяньчжэ Сюй, Ици Цзян, Вэйхуа Чэнь, Илуне Хуан, Юань Чжан и Сюйюй Сунь
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
Архитектурные инновации#
В DAMO-YOLO используется оптимизированная с помощью NAS базовая сеть MAE-NAS, которая автоматически подбирает оптимальные структуры сети с учётом заданных ограничений по задержке. Это позволяет модели эффективно масштабироваться на разных аппаратных платформах. Для улучшения слияния признаков архитектура использует Efficient RepGFPN (обобщённую пирамидальную сеть признаков с перепараметризацией), значительно улучшая представление признаков на разных масштабах.
Кроме того, модель использует архитектуру «ZeroHead». Удаление сложных многоветвевых структур в голове детектора позволяет эффективнее сохранять пространственную информацию и уменьшать вычислительные затраты. В процессе обучения также применяются AlignedOTA (сопоставление с оптимальным транспортом с выравниванием) и эффективная дистилляция знаний, благодаря которой компактные модели-ученики учатся у более крупных моделей-учителей.
Хотя дистилляция знаний помогает DAMO-YOLO достичь высокой точности, для неё требуется многоэтапный процесс обучения. Из-за этого нужно значительно больше вычислительных ресурсов GPU, чем при обучении стандартных моделей за один этап.
YOLOv6-3.0: максимальная производительность в промышленных задачах#
Разработанная отделом Meituan Vision AI Department, YOLOv6-3.0 позиционируется как промышленный детектор объектов, специально созданный для максимальной пропускной способности на оборудовании NVIDIA.
- Авторы: Чуйи Ли, Лулу Ли, Ифэй Гэн, Хунлян Цзян, Мэн Чэн, Бо Чжан, Зайдань Кэ, Сяомин Сюй и Сянсян Чу
- Организация: Meituan
- Дата: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
Основные функции и улучшения#
YOLOv6-3.0 построена на эффективной для аппаратного ускорения базовой сети EfficientRep и особенно быстро работает на современных GPU с такими оптимизациями, как TensorRT. В версии 3.0 в сеть добавлен двунаправленный модуль конкатенации (BiC), который улучшает локализацию объектов разного размера.
Ещё одна заметная особенность — стратегия обучения с поддержкой якорей (AAT). Во время обучения AAT сочетает стабильность детекторов на основе якорей со скоростью инференса архитектуры без якорей. Такой гибридный подход обеспечивает отличную сходимость без увеличения задержки при развёртывании, что делает модель эффективным решением для обработки огромных потоков видео в системах аналитики умных городов и автоматизированных касс.
Сравнение производительности#
При оценке этих моделей для инференса в реальном времени важно учитывать баланс между количеством параметров, FLOPs и точностью. Ниже приведено подробное сравнение их производительности.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
DAMO-YOLO немного превосходит конкурентов в малом классе (46,0 mAP против 45,0 mAP), но YOLOv6-3.0 лучше масштабируется и показывает более высокие результаты в среднем и большом классах, сохраняя при этом минимальное количество параметров в конфигурации nano.
Если твоё оборудование позволяет выполнять масштабный автоматизированный поиск для настройки базовой сети, подход DAMO-YOLO на основе NAS будет очень эффективным. Но если ты полностью полагаешься на стандартное ускорение GPU, например T4 или A100, структуры EfficientRep в YOLOv6 часто обеспечивают более высокий FPS.
Сценарии использования и рекомендации#
Выбор между DAMO-YOLO и YOLOv6 зависит от требований конкретного проекта, ограничений развёртывания и предпочтений в отношении экосистемы.
Когда стоит выбрать DAMO-YOLO#
DAMO-YOLO — хороший выбор для:
- Высокопроизводительная видеоаналитика: Обработка видеопотоков с высокой частотой кадров на фиксированной инфраструктуре NVIDIA GPU, где основной показатель — пропускная способность при размере пакета 1.
- Промышленные производственные линии: Сценарии со строгими ограничениями по задержке GPU на выделенном оборудовании, например контроль качества в реальном времени на сборочных линиях.
- Исследования в области поиска нейросетевых архитектур: Изучение влияния автоматизированного поиска архитектур (MAE-NAS) и эффективных перенастраиваемых базовых сетей на качество обнаружения.
Когда стоит выбрать YOLOv6#
YOLOv6 рекомендуется для следующих задач:
- Развертывание с учетом промышленного оборудования: сценарии, в которых аппаратно-ориентированный дизайн и эффективная репараметризация модели обеспечивают оптимальную производительность на конкретном целевом оборудовании.
- Быстрая одноэтапная детекция: приложения, где приоритетом является максимальная скорость инференса на GPU для обработки видео в реальном времени в контролируемых условиях.
- Интеграция с экосистемой Meituan: команды, уже работающие с технологическим стеком и инфраструктурой развертывания Meituan.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Преимущества Ultralytics: знакомство с YOLO26#
Несмотря на возможности DAMO-YOLO и YOLOv6-3.0, у этих моделей фрагментированные экосистемы, ограничения по числу задач и сложные процессы развёртывания. Для современных инженерных команд модели Ultralytics обеспечивают значительно более удобную работу и предлагают революционную YOLO26.
Выпущенная в январе 2026 года, YOLO26 задаёт новый стандарт развёртывания на периферии и в облаке, значительно оптимизируя требования к памяти и вычислительную эффективность.
Почему стоит выбрать YOLO26?#
- Сквозная архитектура без NMS: развивая идеи YOLOv10, YOLO26 поддерживает нативный сквозной инференс, исключающий постобработку с подавлением немаксимумов благодаря опциональной голове с сопоставлением один к одному (
nms=False). Это значительно упрощает код развёртывания и уменьшает разброс задержки инференса на периферийных устройствах. - Улучшенная оптимизация: в YOLO26 используется оптимизатор MuSGD — гибрид SGD и Muon, вдохновлённый большими языковыми моделями. Он обеспечивает стабильное обучение и более быструю сходимость.
- Широкая аппаратная совместимость: благодаря удалению DFL (Distribution Focal Loss) выходные головы становятся проще, а совместимость с периферийными устройствами повышается. YOLO26 обеспечивает до 43% более быстрый инференс на CPU, значительно превосходя YOLOv6 на мобильных устройствах и периферийных IoT-платформах.
- Повышенная точность: благодаря ProgLoss + STAL YOLO26 значительно улучшает обнаружение мелких объектов, что делает модель оптимальным решением для аэрофотосъёмки и выявления дефектов.
- Непревзойдённая универсальность: в отличие от промышленных моделей, которые умеют только строить ограничивающие рамки, семейство YOLO26 поддерживает несколько задач, включая классификацию изображений, сегментацию экземпляров, оценку позы и ориентированные ограничивающие рамки (OBB).
Бесшовная работа с экосистемой#
Платформа Ultralytics охватывает весь жизненный цикл машинного обучения. Обучение модели больше не требует сложного многоэтапного процесса дистилляции. Благодаря автоматическому расширению данных, единой настройке гиперпараметров и экспорту в форматы ONNX, OpenVINO и CoreML в один клик ты переходишь от набора данных к готовому решению за часы, а не недели.
Кроме того, модели Ultralytics известны своей эффективностью использования памяти и не страдают от огромных ограничений по VRAM, характерных для архитектур Transformer, таких как RT-DETR.
Пример кода для быстрого старта#
Обучать модель Ultralytics, например YOLO26, и выполнять инференс с её помощью очень просто. В приведённом ниже скрипте Python показано, как начать обучение, запустить инференс и экспортировать модель всего несколькими строками кода:
from ultralytics import YOLO
# Загрузи высокоэффективную нано-модель YOLO26
model = YOLO("yolo26n.pt")
# Легко обучи модель на собственном наборе данных
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Выполни инференс на тестовом изображении
prediction = model("https://ultralytics.com/images/bus.jpg")
# Экспортируй модель в TensorRT для максимальной пропускной способности GPU
model.export(format="engine", dynamic=True)Заключение#
DAMO-YOLO и YOLOv6-3.0 — впечатляющие инженерные достижения, расширяющие возможности промышленного обнаружения объектов. Однако это узкоспециализированные инструменты, для которых часто требуются сложная настройка и строго определённая аппаратная конфигурация.
Для разработчиков и исследователей, которым важны оптимальный баланс производительности, поддержка нескольких задач и активно поддерживаемая экосистема, нет равных YOLO26 от Ultralytics. Благодаря оптимизаторам, вдохновлённым LLM, и продуманной архитектуре с инференсом без NMS YOLO26 упрощает развёртывание ИИ и обеспечивает передовую точность как на периферии, так и в облаке.
Если ты оцениваешь модели для нового проекта в области компьютерного зрения, рекомендуем изучить возможности экосистемы Ultralytics YOLO. Чтобы лучше понять развитие ИИ для компьютерного зрения в реальном времени, сравни эти модели с другими архитектурами, например EfficientDet, или с предыдущими важными версиями, например YOLO11.