DAMO-YOLO и YOLO26#
Ландшафт компьютерного зрения постоянно меняется под влиянием потребности в архитектурах, сочетающих высокую точность с низкой задержкой инференса. В этом сравнении подробно рассматриваются технические особенности DAMO-YOLO и Ultralytics YOLO26, включая их архитектурные инновации, методики обучения и оптимальные варианты применения.
Независимо от того, разворачиваешь ли ты модели компьютерного зрения на периферийных устройствах или создаёшь высокопроизводительные облачные конвейеры, понимание различий между этими моделями крайне важно для принятия обоснованных архитектурных решений при современной разработке AI.
DAMO-YOLO: поиск нейронной архитектуры в широком масштабе#
DAMO-YOLO, разработанная Alibaba Group, была выпущена 23 ноября 2022 года. Модель, созданная Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang и Xiuyu Sun, ориентирована на автоматизированный поиск эффективных архитектур с использованием поиска нейронных архитектур (NAS).
Ты можешь ознакомиться с оригинальным исследованием в их статье на ArXiv или изучить исходный код в репозитории DAMO-YOLO на GitHub.
Ключевые архитектурные особенности#
DAMO-YOLO предлагает несколько технических инноваций, призванных расширить возможности обнаружения объектов в реальном времени:
- Магистральные сети MAE-NAS: DAMO-NAS использует поиск на основе максимальной энтропии для подбора оптимальных магистральных сетей. Этот подход поиска архитектуры нейросетей обнаруживает архитектуры, которые строго балансируют точность детектирования и скорость инференса на конкретном аппаратном обеспечении.
- Efficient RepGFPN: сложная шея сети, значительно улучшающая слияние признаков, что особенно полезно при анализе сложных сцен, например на аэрофотоснимках.
- ZeroHead Design: значительно упрощённая голова обнаружения, которая минимизирует вычислительную сложность финальных слоёв предсказания.
- AlignedOTA и Distillation: DAMO-YOLO применяет выровненное назначение на основе оптимального транспорта (AlignedOTA) для устранения неоднозначностей при назначении меток, а также использует устойчивую стратегию дистилляции знаний для повышения точности небольших ученических моделей с помощью крупных моделей-учителей.
Преимущество Ultralytics: YOLO26#
Выпущенный 14 января 2026 года Гленном Йохером и Цзин Цю в Ultralytics, YOLO26 представляет собой вершину доступного и высокопроизводительного компьютерного зрения на основе ИИ. Опираясь на наследие YOLO11 и YOLOv10, YOLO26 разработан с нуля для развертывания на периферийных устройствах, универсальности в многозадачности и непревзойденной простоты использования.
Инновации YOLO26#
Ultralytics YOLO26 предлагает несколько революционных возможностей, делающих её оптимальным выбором для современных приложений компьютерного зрения:
- End-to-End NMS-Free Design: YOLO26 нативно устраняет постобработку с подавлением немаксимумов (NMS). Этот сквозной подход, впервые представленный в YOLOv10, значительно упрощает конвейеры развертывания и обеспечивает детерминированный инференс с низкой задержкой.
- До 43% более быстрый инференс на CPU: архитектурно оптимизированная для периферийных вычислений, YOLO26 обеспечивает исключительную скорость на периферийных устройствах и стандартных CPU, что делает её идеальной для IoT-устройств с питанием от аккумулятора.
- Оптимизатор MuSGD: вдохновлённый обучением LLM, например Kimi K2 от Moonshot AI, YOLO26 объединяет SGD и Muon. Это переносит стабильность обучения больших языковых моделей в компьютерное зрение, обеспечивая более быструю и надёжную сходимость.
- Удаление DFL: удаление Distribution Focal Loss упрощает граф модели и обеспечивает беспроблемный экспорт в такие форматы, как ONNX и TensorRT.
- ProgLoss + STAL: эти усовершенствованные функции потерь заметно улучшают распознавание небольших объектов, что критически важно для операций с дронами и сельского хозяйства.
YOLO26 включает специализированные улучшения для нескольких модальностей: многомасштабный прототип для сегментации экземпляров, остаточную оценку логарифма правдоподобия (RLE) для оценки позы и усовершенствованную функцию потерь угла для устранения проблем с границами при обнаружении ориентированных ограничивающих рамок (OBB).
Сравнение производительности#
При оценке этих моделей первостепенное значение имеет баланс между точностью (mAP) и вычислительной эффективностью (Speed/FLOPs). В таблице ниже показано сравнение этих моделей с использованием отраслевого набора данных COCO.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
Как видно выше, YOLO26 стабильно обеспечивает более высокую точность при значительно меньшем количестве параметров и FLOPs, что приводит к гораздо более эффективной архитектуре как для обучения, так и для инференса.
Эффективность обучения и удобство использования#
Сложности DAMO-YOLO#
Хотя DAMO-YOLO обеспечивает конкурентоспособную точность, её методика обучения отличается высокой сложностью. Зависимость от поиска нейронных архитектур (NAS) и интенсивной дистилляции знаний означает, что обучение пользовательской модели часто требует значительных ресурсов GPU и специальных знаний. Этот многоэтапный процесс — обучение огромной модели-учителя с последующей дистилляцией в небольшую ученическую модель — может стать узким местом для гибких инженерных команд, стремящихся быстро итерировать пользовательские наборы данных.
Упрощённый подход Ultralytics#
Напротив, Ultralytics YOLO26 создана для удобства использования по принципу «от новичка до эксперта». Весь жизненный цикл обучения, валидации и развертывания скрыт за чистым унифицированным API и CLI на Python. Кроме того, YOLO26 требует значительно меньше памяти CUDA при обучении по сравнению с моделями на основе Transformer, такими как RT-DETR, позволяя исследователям обучать передовые модели на оборудовании потребительского класса.
Ниже приведён пример того, насколько просто обучить, оценить и экспортировать модель YOLO26 с помощью Ultralytics SDK:
from ultralytics import YOLO
# Load the latest YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Evaluate the model's performance on the validation set
metrics = model.val()
# Run inference on a sample image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# Export the model to ONNX format for deployment
model.export(format="onnx")Для команд, предпочитающих среду без кода, Ultralytics Platform предоставляет интуитивно понятный интерфейс для разметки наборов данных, облачного обучения и бесшовного развертывания.
Практические применения#
Выбор подходящей архитектуры во многом зависит от целевой среды развертывания и аппаратных ограничений.
Промышленный контроль качества#
Для высокоскоростной автоматизации производства DAMO-YOLO может хорошо работать на выделенном оборудовании GPU. Однако для современных сборочных линий предпочтительнее YOLO26. Её End-to-End NMS-Free design обеспечивает детерминированную задержку без джиттера, что необходимо для синхронизации визуальных данных с роботизированными приводами в реальном времени.
Edge AI и мобильные устройства#
Развертывание компьютерного зрения на устройствах с питанием от аккумулятора требует исключительной эффективности. В то время как DAMO-YOLO использует специализированные шеи RepGFPN, YOLO26n (Nano) специально оптимизирована для периферийных вычислений. Удаление DFL и инференс на CPU на 43% быстрее делают её оптимальным решением для умных камер, мобильных приложений и систем охранной сигнализации.
Требования многозадачного проекта#
Если проект требует большего, чем просто обнаружение объектов, например анализа механики движений игроков в спорте с помощью оценки позы или извлечения точных границ объектов на уровне пикселей с помощью сегментации экземпляров, YOLO26 предоставляет нативную поддержку всех этих задач в единой унифицированной кодовой базе. DAMO-YOLO строго ограничена обнаружением ограничивающих рамок.
Варианты применения и рекомендации#
Выбор между DAMO-YOLO и YOLO26 зависит от конкретных требований проекта, ограничений развертывания и предпочтений относительно экосистемы.
Когда стоит выбрать DAMO-YOLO#
DAMO-YOLO — хороший выбор для:
- Высокопроизводительная видеоаналитика: Обработка видеопотоков с высоким FPS на фиксированной инфраструктуре NVIDIA GPU, где пропускная способность при размере пакета 1 является основной метрикой.
- Промышленные производственные линии: Сценарии со строгими ограничениями по задержке GPU на выделенном оборудовании, например контроль качества в реальном времени на сборочных линиях.
- Исследования поиска нейронных архитектур: Изучение влияния автоматизированного поиска архитектур (MAE-NAS) и эффективных репараметризованных базовых сетей на производительность обнаружения.
Когда стоит выбрать YOLO26#
YOLO26 рекомендуется для:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Заключение#
Обе архитектуры представляют собой значительные достижения в области глубокого обучения. DAMO-YOLO даёт интересное представление о возможностях поиска нейронных архитектур и методов дистилляции, адаптированных под конкретные аппаратные показатели.
Тем не менее, для разработчиков, исследователей и предприятий, ищущих готовое к продакшену решение, Ultralytics YOLO26 выделяется как лучший выбор. Сочетание сквозного дизайна без NMS, огромного прироста производительности инференса на CPU, универсальности в многозадачности и интеграции в поддерживаемую экосистему Ultralytics делает YOLO26 самым надежным и практичным инструментом для решения реальных задач компьютерного зрения сегодня.
Для пользователей, заинтересованных в изучении других моделей экосистемы Ultralytics, доступна подробная документация по YOLO11, YOLOv8 и основанной на Transformer модели RT-DETR.