DAMO-YOLO против YOLO26#
Ландшафт компьютерного зрения постоянно развивается, движимый потребностью в архитектурах, которые сочетают в себе высокую точность с низкой задержкой вывода. В этом сравнении мы углубимся в технические тонкости DAMO-YOLO и Ultralytics YOLO26, исследуя их архитектурные инновации, методологии обучения и идеальные варианты использования.
Независимо от того, разворачиваешь ли ты модели зрения на граничных устройствах или создаешь облачные конвейеры с высокой пропускной способностью, понимание нюансов между этими моделями имеет решающее значение для принятия обоснованных архитектурных решений в современной разработке ИИ.
DAMO-YOLO: нейронный архитектурный поиск в масштабе#
DAMO-YOLO, разработанный Alibaba Group, был выпущен 23 ноября 2022 года. Созданная Сяньчжэ Сюй, Ици Цзяном, Вэйхуа Чэнем, Илунь Хуанем, Юань Чжаном и Сюью Сунем, эта модель уделяет особое внимание автоматическому поиску эффективных архитектур с использованием поиска архитектуры нейронных сетей (NAS).
Ты можешь ознакомиться с оригинальным исследованием в их статье на ArXiv или изучить исходный код в репозитории DAMO-YOLO на GitHub.
Ключевые архитектурные особенности#
DAMO-YOLO представляет несколько технических инноваций, разработанных для расширения границ обнаружения объектов в реальном времени:
- Backbones MAE-NAS: DAMO-YOLO использует многоцелевой эволюционный поиск для нахождения оптимальных бэкбонов. Этот подход NAS обнаруживает архитектуры, которые строго балансируют точность обнаружения и скорость вывода на конкретном оборудовании.
- Efficient RepGFPN: тяжелая конструкция шейки, которая значительно улучшает слияние признаков, что крайне полезно при анализе сложных сцен, таких как аэрофотоснимки.
- Дизайн ZeroHead: сильно упрощенная головка обнаружения, которая минимизирует вычислительную сложность финальных уровней предсказания.
- AlignedOTA и дистилляция: DAMO-YOLO использует Aligned Optimal Transport Assignment (AlignedOTA) для разрешения неоднозначностей при назначении меток в сочетании со стратегией улучшения на основе надежной дистилляции знаний для повышения точности небольших моделей-учеников с использованием более крупных сетей-учителей.
Преимущество Ultralytics: YOLO26#
Выпущенная 14 января 2026 года Гленном Джохером и Цзин Цю в Ultralytics, YOLO26 представляет собой вершину доступного и высокопроизводительного компьютерного зрения на основе ИИ. Опираясь на наследие YOLO11 и YOLOv10, YOLO26 разработана с нуля для развертывания с упором на периферийные устройства, мультимодальной универсальности и непревзойденной простоты использования.
Инновации YOLO26#
Ultralytics YOLO26 представляет несколько прорывных функций, которые делают ее окончательным выбором для современных приложений компьютерного зрения:
- Сквозной дизайн без NMS: YOLO26 нативно исключает постобработку Non-Maximum Suppression (NMS). Впервые примененный в YOLOv10, этот сквозной подход радикально упрощает конвейеры развертывания и обеспечивает детерминированный вывод с низкой задержкой.
- Инференс на CPU быстрее до 43%: архитектурно оптимизированная для периферийных вычислений, YOLO26 обеспечивает исключительную скорость на периферийных устройствах и стандартных CPU, что делает ее идеальной для работающих от батарей устройств интернета вещей (IoT).
- Оптимизатор MuSGD: вдохновленный обучением LLM (как Kimi K2 от Moonshot AI), YOLO26 включает гибрид SGD и Muon. Это привносит стабильность обучения больших языковых моделей в компьютерное зрение, что приводит к более быстрой и надежной сходимости.
- Удаление DFL: благодаря удалению функции Distribution Focal Loss граф модели упрощается, что обеспечивает беспрепятственный экспорт в такие форматы, как ONNX и TensorRT.
- ProgLoss + STAL: эти продвинутые функции потерь обеспечивают заметные улучшения в распознавании мелких объектов, что является критически важной функцией для операций с дронами и сельского хозяйства.
YOLO26 включает специализированные улучшения для нескольких модальностей: многомасштабное прото-ядро для сегментации экземпляров, метод Residual Log-Likelihood Estimation (RLE) для оценки позы и продвинутую функцию потерь по углу для снижения граничных проблем при обнаружении ориентированных ограничивающих рамок (OBB).
Сравнение производительности#
При оценке этих моделей баланс между точностью (mAP) и вычислительной эффективностью (Speed/FLOPs) имеет первостепенное значение. В приведенной ниже таблице показано сравнение этих моделей с использованием стандартного для индустрии набора данных COCO.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
Как видно выше, YOLO26 стабильно обеспечивает более высокую точность при значительно меньшем количестве параметров и FLOPs, что приводит к гораздо более эффективной архитектуре как для обучения, так и для вывода.
Эффективность обучения и удобство использования#
Сложности DAMO-YOLO#
Хотя DAMO-YOLO достигает конкурентоспособной точности, ее методология обучения очень сложна. Опора на Neural Architecture Search (NAS) и тяжелую дистилляцию знаний означает, что обучение пользовательской модели часто требует значительных ресурсов GPU и специализированных знаний. Этот многоэтапный процесс — обучение массивной модели-учителя для дистилляции в меньшую модель-ученика — может стать «бутылочным горлышком» для гибких инженерных команд, пытающихся быстро итерировать на пользовательских наборах данных.
Оптимизированный опыт Ultralytics#
Напротив, Ultralytics YOLO26 разработана для удобства работы по принципу «от новичка до профи». Весь жизненный цикл обучения, валидации и развертывания инкапсулирован за чистым, унифицированным Python API и CLI. Кроме того, YOLO26 требует значительно меньше памяти CUDA во время обучения по сравнению с моделями на базе Transformer, такими как RT-DETR, что позволяет исследователям обучать современные модели на потребительском «железе».
Вот пример того, как просто обучать, оценивать и экспортировать модель YOLO26 с помощью SDK Ultralytics:
from ultralytics import YOLO
# Load the latest YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Evaluate the model's performance on the validation set
metrics = model.val()
# Run inference on a sample image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# Export the model to ONNX format for deployment
model.export(format="onnx")Для команд, которые предпочитают среду без написания кода, Ultralytics Platform предоставляет интуитивно понятный интерфейс для разметки датасетов, облачного обучения и простого развертывания.
Применение в реальных условиях#
Выбор правильной архитектуры во многом зависит от целевой среды развертывания и ограничений оборудования.
Промышленный контроль качества#
Для высокоскоростной автоматизации производства DAMO-YOLO может хорошо работать на специализированном GPU-оборудовании. Тем не менее, YOLO26 является предпочтительным выбором для современных сборочных линий. Ее дизайн End-to-End без NMS обеспечивает детерминированную задержку без дрожания, что необходимо при синхронизации визуальных данных с роботизированными приводами в реальном времени.
Граничный ИИ и мобильные устройства#
Развертывание компьютерного зрения на устройствах с питанием от батарей требует экстремальной эффективности. В то время как DAMO-YOLO опирается на специфические шейки RepGFPN, YOLO26n (Nano) специально оптимизирована для периферийных вычислений. Удаление DFL и инференс на CPU на 43% быстрее делают ее идеальным решением для умных камер, мобильных приложений и охранных сигнализаций.
Мультимодальные требования к проекту#
Если проект требует большего, чем просто обнаружение объектов — например, анализа механики движений игрока в спорте с использованием оценки позы или извлечения точных границ пикселей с помощью сегментации экземпляров — YOLO26 обеспечивает нативную поддержку всех этих задач в рамках единой кодовой базы. DAMO-YOLO строго ограничена обнаружением с помощью ограничивающих рамок.
Сценарии использования и рекомендации#
Выбор между DAMO-YOLO и YOLO26 зависит от твоих конкретных требований к проекту, ограничений развертывания и предпочтений в экосистеме.
Когда выбирать DAMO-YOLO#
DAMO-YOLO — сильный выбор для:
- Высокопроизводительной видеоаналитики: обработки видеопотоков с высоким FPS на фиксированной инфраструктуре NVIDIA GPU, где пропускная способность при batch-1 является основной метрикой.
- Промышленных производственных линий: сценариев с жесткими ограничениями по задержке GPU на специализированном оборудовании, таких как проверка качества в реальном времени на сборочных линиях.
- Исследований Neural Architecture Search: изучения влияния автоматизированного поиска архитектуры (MAE-NAS) и эффективных репараметризованных бэкендов на производительность детекции.
Когда стоит выбрать YOLO26#
YOLO26 рекомендуется для:
- Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
- Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
- Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.
Заключение#
Обе архитектуры представляют собой значительные достижения в области глубокого обучения. DAMO-YOLO предлагает захватывающий взгляд на мощь Neural Architecture Search и методов дистилляции, адаптированных для конкретных аппаратных бенчмарков.
Однако для разработчиков, исследователей и предприятий, ищущих готовое к производству решение, Ultralytics YOLO26 выделяется как лучший выбор. Сочетание сквозного дизайна без NMS, массивного прироста скорости вывода на CPU, мультимодальной универсальности и интеграции в хорошо поддерживаемую экосистему Ultralytics делает ее самым надежным и практичным инструментом для решения современных задач компьютерного зрения.
Для пользователей, заинтересованных в изучении других моделей в экосистеме Ultralytics, доступна исчерпывающая документация по YOLO11, YOLOv8 и RT-DETR на базе Transformer.