DAMO-YOLO и YOLO26#
Область компьютерного зрения постоянно развивается, поскольку нужны архитектуры, сочетающие высокую точность с инференсом с низкой задержкой. В этом сравнении подробно рассматриваются технические особенности DAMO-YOLO и Ultralytics YOLO26, их архитектурные инновации, методы обучения и оптимальные сценарии использования.
Понимание различий между этими моделями крайне важно для принятия взвешенных архитектурных решений при разработке современных ИИ-систем — независимо от того, развёртываешь ли ты модели компьютерного зрения на периферийных устройствах или создаёшь высокопроизводительные облачные конвейеры.
DAMO-YOLO: поиск нейронной архитектуры в крупных масштабах#
DAMO-YOLO, разработанная Alibaba Group, была выпущена 23 ноября 2022 года. Модель, созданная Сяньчжэ Сюем, Ици Цзяном, Вэйхуа Чэнем, Илуня Хуаном, Юанем Чжаном и Сюйюем Сунем, ориентирована на автоматизированный поиск эффективных архитектур с помощью поиска нейронных архитектур (NAS).
Ознакомься с оригинальным исследованием в их статье на ArXiv или изучи исходный код в репозитории DAMO-YOLO на GitHub.
Ключевые особенности архитектуры#
В DAMO-YOLO реализовано несколько технических инноваций, призванных расширить возможности детекции объектов в реальном времени:
- Магистральные сети MAE-NAS: DAMO-YOLO использует поиск на основе максимальной энтропии для нахождения оптимальных магистральных сетей. Такой подход с поиском нейронных архитектур позволяет находить архитектуры, которые точно балансируют между точностью детекции и скоростью инференса на конкретном оборудовании.
- Эффективная RepGFPN: Тяжёлая архитектура шеи значительно улучшает объединение признаков, что особенно полезно при анализе сложных сцен, например на аэрофотоснимках.
- Архитектура ZeroHead: Значительно упрощённая голова детекции, которая минимизирует вычислительную сложность последних слоёв предсказания.
- AlignedOTA и дистилляция: DAMO-YOLO использует оптимальное транспортное сопоставление с выравниванием (AlignedOTA), чтобы устранить неоднозначность назначения меток. Кроме того, в модели применяется надёжная стратегия дистилляции знаний, повышающая точность небольших ученических моделей с помощью более крупных учительских сетей.
Преимущества Ultralytics: YOLO26#
Выпущенная 14 января 2026 года Гленном Джочером и Цзин Цю из Ultralytics, YOLO26 представляет собой вершину доступного высокопроизводительного ИИ для компьютерного зрения. Продолжая традиции YOLO11 и YOLOv10, YOLO26 с самого начала проектировалась с расчётом на периферийное развёртывание, универсальность для множества задач и непревзойдённую простоту использования.
Инновации YOLO26#
В Ultralytics YOLO26 реализовано несколько революционных возможностей, которые делают её оптимальным выбором для современных приложений компьютерного зрения:
- Сквозная архитектура без NMS: Встроенная голова YOLO26 с сопоставлением один к одному (
nms=False) исключает подавление немаксимумов (NMS) на этапе постобработки. Этот сквозной подход, впервые применённый в YOLOv10, значительно упрощает конвейеры развёртывания и обеспечивает детерминированный инференс с низкой задержкой. - До 43% более быстрый инференс на CPU: YOLO26 архитектурно оптимизирована для периферийных вычислений и обеспечивает исключительную скорость на периферийных устройствах и стандартных CPU, что делает её идеальной для IoT-устройств с питанием от аккумулятора.
- Оптимизатор MuSGD: Вдохновлённая методами обучения больших языковых моделей, например Kimi K2 от Moonshot AI, YOLO26 использует гибрид SGD и Muon. Это переносит стабильность обучения больших языковых моделей в компьютерное зрение и обеспечивает более быструю и надёжную сходимость.
- Отказ от DFL: Отказ от Distribution Focal Loss упрощает граф модели и позволяет без затруднений экспортировать её в такие форматы, как ONNX и TensorRT.
- ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание мелких объектов — важную возможность для эксплуатации дронов и сельского хозяйства.
YOLO26 включает специализированные улучшения для разных модальностей: многомасштабный прототип для сегментации экземпляров, оценку остаточного логарифма правдоподобия (RLE) для оценки позы и продвинутую функцию потерь угла для устранения проблем на границах при детекции ориентированных ограничивающих рамок (OBB).
Сравнение производительности#
При оценке этих моделей особенно важно учитывать баланс между точностью (mAP) и вычислительной эффективностью (скорость/FLOPs). В таблице ниже показано сравнение моделей на отраслевом стандарте — наборе данных COCO.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Как видно выше, YOLO26 стабильно обеспечивает более высокую точность при значительно меньшем количестве параметров и FLOPs, благодаря чему архитектура оказывается намного эффективнее как при обучении, так и при инференсе.
Эффективность обучения и удобство использования#
Сложности DAMO-YOLO#
Хотя DAMO-YOLO обеспечивает конкурентоспособную точность, методология обучения модели весьма сложна. Использование поиска нейронных архитектур (NAS) и масштабной дистилляции знаний означает, что для обучения пользовательской модели часто требуются значительные ресурсы GPU и специальные знания. Этот многоэтапный процесс — обучение огромной учительской модели с последующей дистилляцией в меньшую ученическую — может замедлить работу гибких инженерных команд, которым нужно быстро проводить итерации на пользовательских наборах данных.
Упрощённый процесс работы с Ultralytics#
В отличие от этого, Ultralytics YOLO26 спроектирована так, чтобы её было легко освоить с нуля и использовать на профессиональном уровне. Весь жизненный цикл обучения, валидации и развёртывания доступен через чистый, унифицированный Python API и CLI. Кроме того, YOLO26 при обучении требует значительно меньше памяти CUDA, чем модели на базе Transformer, такие как RT-DETR, что позволяет исследователям обучать передовые модели на оборудовании потребительского класса.
Вот пример того, как просто обучить, оценить и экспортировать модель YOLO26 с помощью Ultralytics SDK:
from ultralytics import YOLO
# Загрузи последнюю нано-модель YOLO26
model = YOLO("yolo26n.pt")
# Обучи модель на наборе данных COCO8 в течение 50 эпох
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Оценить производительность модели на проверочной выборке
metrics = model.val()
# Выполни инференс на тестовом изображении
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# Экспортируй модель в формат ONNX для развёртывания
model.export(format="onnx")Командам, которым нужна среда без кода, платформа Ultralytics предлагает понятный интерфейс для разметки наборов данных, облачного обучения и удобного развёртывания.
Применение в реальных условиях#
Выбор подходящей архитектуры во многом зависит от целевой среды развёртывания и ограничений оборудования.
Промышленный контроль качества#
Для высокоскоростной автоматизации производства DAMO-YOLO может хорошо работать на выделенном оборудовании GPU. Однако для современных сборочных линий предпочтительнее YOLO26. Её сквозная архитектура без NMS обеспечивает детерминированную задержку без скачков, что необходимо для синхронизации визуальных данных с роботизированными исполнительными механизмами в реальном времени.
Периферийный ИИ и мобильные устройства#
Для развёртывания компьютерного зрения на устройствах с питанием от аккумулятора необходима максимальная эффективность. DAMO-YOLO использует специализированные архитектуры шеи RepGFPN, а YOLO26n (Nano) специально оптимизирована для периферийных вычислений. Отказ от DFL и на 43% более быстрый инференс на CPU делают эту модель идеальным решением для умных камер, мобильных приложений и охранных систем сигнализации.
Требования проектов с несколькими задачами#
Если проект требует большего, чем просто детекция объектов — например, анализа движений игроков в спорте с помощью оценки позы или выделения точных границ объектов на уровне пикселей с помощью сегментации экземпляров, — YOLO26 изначально поддерживает все эти задачи в единой кодовой базе. DAMO-YOLO ограничена исключительно детекцией ограничивающих рамок.
Сценарии использования и рекомендации#
Выбор между DAMO-YOLO и YOLO26 зависит от требований конкретного проекта, ограничений среды развёртывания и предпочтений в отношении экосистемы.
Когда стоит выбрать DAMO-YOLO#
DAMO-YOLO — хороший выбор для:
- Высокопроизводительная видеоаналитика: Обработка видеопотоков с высокой частотой кадров на фиксированной инфраструктуре NVIDIA GPU, где основной показатель — пропускная способность при размере пакета 1.
- Промышленные производственные линии: Сценарии со строгими ограничениями по задержке GPU на выделенном оборудовании, например контроль качества в реальном времени на сборочных линиях.
- Исследования в области поиска нейросетевых архитектур: Изучение влияния автоматизированного поиска архитектур (MAE-NAS) и эффективных перенастраиваемых базовых сетей на качество обнаружения.
Когда выбирать YOLO26#
YOLO26 рекомендуется для:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Заключение#
Обе архитектуры — значительные достижения в области глубокого обучения. DAMO-YOLO позволяет наглядно оценить возможности поиска нейронных архитектур и методов дистилляции, адаптированных под бенчмарки конкретного оборудования.
Однако разработчикам, исследователям и компаниям, которым нужно готовое к эксплуатации решение, лучше подойдёт Ultralytics YOLO26. Благодаря сквозной архитектуре без NMS, значительному приросту скорости инференса на CPU, универсальности для множества задач и интеграции в хорошо поддерживаемую экосистему Ultralytics эта модель стала самым надёжным и практичным инструментом для решения реальных задач компьютерного зрения.
Пользователи, которые хотят изучить другие модели в экосистеме Ultralytics, могут обратиться к подробной документации по YOLO11, YOLOv8 и модели на базе Transformer RT-DETR.