YOLOv6-3.0 и DAMO-YOLO#
Компьютерное зрение постоянно развивается: новые архитектуры расширяют возможности детекции объектов в реальном времени. Среди заметных моделей в этой области — YOLOv6-3.0 и DAMO-YOLO. Обе модели предлагают уникальные архитектурные инновации, призванные повысить производительность на промышленном оборудовании. В этом руководстве подробно сравниваются архитектуры, методики обучения и оптимальные сценарии использования моделей, а также рассматриваются преимущества моделей нового поколения, таких как Ultralytics YOLO26.
Обзор моделей#
YOLOv6-3.0: промышленная пропускная способность#
Разработанная подразделением Vision AI компании Meituan, YOLOv6-3.0 создана специально для промышленных приложений с высокой пропускной способностью. Она ориентирована на максимальную производительность на аппаратных ускорителях, например GPU NVIDIA.
- Авторы: Chuyi Li, Lulu Li, Yifei Geng и др.
- Организация: Meituan
- Дата: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
- Документация: Документация Ultralytics YOLOv6
В YOLOv6-3.0 добавлен модуль двунаправленной конкатенации (BiC) для улучшения слияния признаков и используется стратегия обучения с поддержкой якорей (AAT). Эта стратегия сочетает преимущества якорных моделей и безъякорных детекторов во время обучения, сохраняя полностью безъякорный инференс. Базовая сеть EfficientRep хорошо приспособлена к аппаратному обеспечению и пакетной обработке на GPU, что делает её подходящей для обработки больших объёмов данных видеоаналитики.
DAMO-YOLO: скорость и точность благодаря NAS#
Созданная Alibaba Group, модель DAMO-YOLO использует поиск по нейронной архитектуре (NAS), чтобы автоматически находить наиболее эффективные структуры базовой сети для инференса в реальном времени.
- Авторы: Xianzhe Xu, Yiqi Jiang, Weihua Chen и др.
- Организация: Alibaba Group
- Дата: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
DAMO-YOLO выделяется сетью RepGFPN (перепараметризованная обобщённая сеть пирамиды признаков), обеспечивающей эффективное слияние признаков разных масштабов, и архитектурой ZeroHead, значительно снижающей вычислительные затраты на голову детекции. В модели также применяются назначение меток AlignedOTA и эффективные методы дистилляции знаний, повышающие точность без увеличения числа параметров модели.
Хотя DAMO-YOLO демонстрирует отличную точность, сильная зависимость от дистилляции знаний во время обучения требует гораздо более крупной модели-«учителя». Это значительно увеличивает объем памяти CUDA, необходимый на этапе обучения, по сравнению с более простыми архитектурами.
Сравнение производительности#
При оценке моделей обнаружения объектов критически важен баланс между средней точностью (mAP) и скоростью инференса. Ниже приведено подробное сравнение YOLOv6-3.0 и DAMO-YOLO для моделей разных размеров.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
YOLOv6-3.0 демонстрирует исключительную скорость на GPU NVIDIA при использовании оптимизаций TensorRT, особенно в nano- и small-вариантах. Однако бэкбоны DAMO-YOLO, оптимизированные с помощью NAS, обычно требуют меньше FLOPs в моделях среднего и крупного размера, что дает небольшое преимущество по задержке при крупных развертываниях.
Преимущества Ultralytics: знакомство с YOLO26#
Хотя YOLOv6-3.0 и DAMO-YOLO — мощные инструменты, разработчики часто сталкиваются со сложными конвейерами развертывания, высокими требованиями к памяти во время обучения и негибкими одноцелевыми архитектурами. Экосистема Ultralytics обеспечивает значительно более простой опыт разработки.
С выходом YOLO26 Ultralytics переосмыслила передовые достижения в области компьютерного зрения и ИИ. Выпущенная в январе 2026 года, Ultralytics YOLO26 расширяет границы эффективности и универсальности.
Основные нововведения YOLO26#
- Сквозная архитектура без NMS: развивая идеи, впервые реализованные в YOLOv10, необязательная голова one-to-one в YOLO26 (
nms=False) устраняет постобработку методом подавления немаксимумов (NMS). Это значительно сокращает разброс задержки и упрощает развертывание на граничных устройствах через CoreML или LiteRT. - Удаление DFL: удаление Distribution Focal Loss упрощает экспорт YOLO26 и значительно повышает совместимость с маломощными микроконтроллерами и граничным оборудованием.
- Инференс на CPU до 43% быстрее: для приложений без выделенного GPU оптимизации YOLO26 для CPU обеспечивают непревзойденную скорость, превосходя модели, сильно зависящие от GPU, например YOLOv6.
- Оптимизатор MuSGD: вдохновленная методами обучения LLM, такими как Kimi K2 от Moonshot AI, модель YOLO26 использует оптимизатор MuSGD (гибрид SGD и Muon), обеспечивающий стабильное обучение и быструю сходимость.
- ProgLoss + STAL: усовершенствованные функции потерь значительно улучшают распознавание мелких объектов, что делает YOLO26 идеальным решением для работы с дронами и отслеживания удаленных целей.
- Универсальность для множества задач: в отличие от DAMO-YOLO, предназначенной только для обнаружения объектов, YOLO26 из коробки поддерживает сегментацию экземпляров, оценку позы (с помощью Residual Log-Likelihood Estimation) и ориентированные ограничивающие рамки (OBB) в рамках единого API.
В отличие от сложных архитектур Transformer, таких как RT-DETR, и конвейеров DAMO-YOLO, требующих интенсивной дистилляции, модели Ultralytics известны низким потреблением VRAM. Ты можешь легко обучать модель YOLO26 на обычном пользовательском оборудовании.
Упрощенный рабочий процесс на Python#
Для обучения и развертывания передовых моделей не должны требоваться сотни строк шаблонного кода. Пакет Ultralytics для Python упрощает весь цикл машинного обучения.
from ultralytics import YOLO
# Загрузи передовую small-модель YOLO26
model = YOLO("yolo26s.pt")
# Легко обучи модель благодаря встроенной обработке данных
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Запусти сверхбыстрый инференс и отобрази результаты
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# Экспортируй модель в ONNX или TensorRT без лишних усилий
model.export(format="onnx")Оптимальные сценарии применения#
Выбор подходящей архитектуры полностью зависит от ограничений твоего развертывания:
Когда использовать YOLOv6-3.0#
- Видеоаналитика с большими пакетами: отлично подходит для обработки плотных видеопотоков на корпоративных GPU-серверах, где можно в полной мере использовать TensorRT.
- Промышленная автоматизация: обнаружение дефектов на высокоскоростных производственных линиях для контроля качества.
Когда использовать DAMO-YOLO#
- Специализированные чипы: исследование отображения результатов поиска нейронной архитектуры на конкретное проприетарное оборудование NPU.
- Академические исследования: оценка новых методов дистилляции знаний для сетей реального времени.
Когда использовать Ultralytics YOLO26#
- Развертывание на граничных и мобильных устройствах: архитектура без NMS, удаление DFL и прирост скорости CPU на 43% делают YOLO26 бесспорным лидером для интеграции с iOS, Android и Raspberry Pi.
- От быстрого прототипирования до производства: бесшовная интеграция с платформой Ultralytics позволяет командам за несколько дней, а не месяцев, пройти путь от разметки датасета до развертывания в глобальном облаке.
- Сложные конвейеры компьютерного зрения: когда проект требует одновременно обнаруживать ограничивающие рамки, ключевые точки человеческой позы и точные маски сегментации.
Заключение#
И YOLOv6-3.0, и DAMO-YOLO внесли значительный вклад в развитие науки об обнаружении объектов в реальном времени. YOLOv6 усовершенствовала максимальное использование GPU, а DAMO-YOLO продемонстрировала возможности автоматизированного поиска архитектур.
Однако для разработчиков, которым нужно оптимальное сочетание точности, скорости инференса и удобства сопровождения экосистемы, семейство Ultralytics YOLO остается лучшим выбором. Благодаря революционным оптимизациям, представленным в YOLO26, порог входа в разработку корпоративных приложений компьютерного зрения стал как никогда низким.
В документации ты также можешь сравнить эти модели с другими архитектурами, например YOLO11 или подходами на основе Transformer, такими как RT-DETR.