YOLO Vision 2026:

DAMO-YOLO против YOLO26#

Ландшафт компьютерного зрения постоянно развивается, движимый потребностью в архитектурах, которые сочетают в себе высокую точность с низкой задержкой вывода. В этом сравнении мы углубимся в технические тонкости DAMO-YOLO и Ultralytics YOLO26, исследуя их архитектурные инновации, методологии обучения и идеальные варианты использования.

Независимо от того, разворачиваешь ли ты модели зрения на граничных устройствах или создаешь облачные конвейеры с высокой пропускной способностью, понимание нюансов между этими моделями имеет решающее значение для принятия обоснованных архитектурных решений в современной разработке ИИ.

DAMO-YOLO: нейронный архитектурный поиск в масштабе#

DAMO-YOLO, разработанный Alibaba Group, был выпущен 23 ноября 2022 года. Созданная Сяньчжэ Сюй, Ици Цзяном, Вэйхуа Чэнем, Илунь Хуанем, Юань Чжаном и Сюью Сунем, эта модель уделяет особое внимание автоматическому поиску эффективных архитектур с использованием поиска архитектуры нейронных сетей (NAS).

Ты можешь ознакомиться с оригинальным исследованием в их статье на ArXiv или изучить исходный код в репозитории DAMO-YOLO на GitHub.

Ключевые архитектурные особенности#

DAMO-YOLO представляет несколько технических инноваций, разработанных для расширения границ обнаружения объектов в реальном времени:

  • Backbones MAE-NAS: DAMO-YOLO использует многоцелевой эволюционный поиск для нахождения оптимальных бэкбонов. Этот подход NAS обнаруживает архитектуры, которые строго балансируют точность обнаружения и скорость вывода на конкретном оборудовании.
  • Efficient RepGFPN: тяжелая конструкция шейки, которая значительно улучшает слияние признаков, что крайне полезно при анализе сложных сцен, таких как аэрофотоснимки.
  • Дизайн ZeroHead: сильно упрощенная головка обнаружения, которая минимизирует вычислительную сложность финальных уровней предсказания.
  • AlignedOTA и дистилляция: DAMO-YOLO использует Aligned Optimal Transport Assignment (AlignedOTA) для разрешения неоднозначностей при назначении меток в сочетании со стратегией улучшения на основе надежной дистилляции знаний для повышения точности небольших моделей-учеников с использованием более крупных сетей-учителей.

Узнай больше о DAMO-YOLO

Преимущество Ultralytics: YOLO26#

Выпущенная 14 января 2026 года Гленном Джохером и Цзин Цю в Ultralytics, YOLO26 представляет собой вершину доступного и высокопроизводительного компьютерного зрения на основе ИИ. Опираясь на наследие YOLO11 и YOLOv10, YOLO26 разработана с нуля для развертывания с упором на периферийные устройства, мультимодальной универсальности и непревзойденной простоты использования.

Инновации YOLO26#

Ultralytics YOLO26 представляет несколько прорывных функций, которые делают ее окончательным выбором для современных приложений компьютерного зрения:

  • Сквозной дизайн без NMS: YOLO26 нативно исключает постобработку Non-Maximum Suppression (NMS). Впервые примененный в YOLOv10, этот сквозной подход радикально упрощает конвейеры развертывания и обеспечивает детерминированный вывод с низкой задержкой.
  • Инференс на CPU быстрее до 43%: архитектурно оптимизированная для периферийных вычислений, YOLO26 обеспечивает исключительную скорость на периферийных устройствах и стандартных CPU, что делает ее идеальной для работающих от батарей устройств интернета вещей (IoT).
  • Оптимизатор MuSGD: вдохновленный обучением LLM (как Kimi K2 от Moonshot AI), YOLO26 включает гибрид SGD и Muon. Это привносит стабильность обучения больших языковых моделей в компьютерное зрение, что приводит к более быстрой и надежной сходимости.
  • Удаление DFL: благодаря удалению функции Distribution Focal Loss граф модели упрощается, что обеспечивает беспрепятственный экспорт в такие форматы, как ONNX и TensorRT.
  • ProgLoss + STAL: эти продвинутые функции потерь обеспечивают заметные улучшения в распознавании мелких объектов, что является критически важной функцией для операций с дронами и сельского хозяйства.
Улучшения для конкретных задач

YOLO26 включает специализированные улучшения для нескольких модальностей: многомасштабное прото-ядро для сегментации экземпляров, метод Residual Log-Likelihood Estimation (RLE) для оценки позы и продвинутую функцию потерь по углу для снижения граничных проблем при обнаружении ориентированных ограничивающих рамок (OBB).

Узнай больше о YOLO26

Сравнение производительности#

При оценке этих моделей баланс между точностью (mAP) и вычислительной эффективностью (Speed/FLOPs) имеет первостепенное значение. В приведенной ниже таблице показано сравнение этих моделей с использованием стандартного для индустрии набора данных COCO.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

Как видно выше, YOLO26 стабильно обеспечивает более высокую точность при значительно меньшем количестве параметров и FLOPs, что приводит к гораздо более эффективной архитектуре как для обучения, так и для вывода.

Эффективность обучения и удобство использования#

Сложности DAMO-YOLO#

Хотя DAMO-YOLO достигает конкурентоспособной точности, ее методология обучения очень сложна. Опора на Neural Architecture Search (NAS) и тяжелую дистилляцию знаний означает, что обучение пользовательской модели часто требует значительных ресурсов GPU и специализированных знаний. Этот многоэтапный процесс — обучение массивной модели-учителя для дистилляции в меньшую модель-ученика — может стать «бутылочным горлышком» для гибких инженерных команд, пытающихся быстро итерировать на пользовательских наборах данных.

Оптимизированный опыт Ultralytics#

Напротив, Ultralytics YOLO26 разработана для удобства работы по принципу «от новичка до профи». Весь жизненный цикл обучения, валидации и развертывания инкапсулирован за чистым, унифицированным Python API и CLI. Кроме того, YOLO26 требует значительно меньше памяти CUDA во время обучения по сравнению с моделями на базе Transformer, такими как RT-DETR, что позволяет исследователям обучать современные модели на потребительском «железе».

Вот пример того, как просто обучать, оценивать и экспортировать модель YOLO26 с помощью SDK Ultralytics:

from ultralytics import YOLO

# Load the latest YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Evaluate the model's performance on the validation set
metrics = model.val()

# Run inference on a sample image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Export the model to ONNX format for deployment
model.export(format="onnx")

Для команд, которые предпочитают среду без написания кода, Ultralytics Platform предоставляет интуитивно понятный интерфейс для разметки датасетов, облачного обучения и простого развертывания.

Применение в реальных условиях#

Выбор правильной архитектуры во многом зависит от целевой среды развертывания и ограничений оборудования.

Промышленный контроль качества#

Для высокоскоростной автоматизации производства DAMO-YOLO может хорошо работать на специализированном GPU-оборудовании. Тем не менее, YOLO26 является предпочтительным выбором для современных сборочных линий. Ее дизайн End-to-End без NMS обеспечивает детерминированную задержку без дрожания, что необходимо при синхронизации визуальных данных с роботизированными приводами в реальном времени.

Граничный ИИ и мобильные устройства#

Развертывание компьютерного зрения на устройствах с питанием от батарей требует экстремальной эффективности. В то время как DAMO-YOLO опирается на специфические шейки RepGFPN, YOLO26n (Nano) специально оптимизирована для периферийных вычислений. Удаление DFL и инференс на CPU на 43% быстрее делают ее идеальным решением для умных камер, мобильных приложений и охранных сигнализаций.

Мультимодальные требования к проекту#

Если проект требует большего, чем просто обнаружение объектов — например, анализа механики движений игрока в спорте с использованием оценки позы или извлечения точных границ пикселей с помощью сегментации экземпляров — YOLO26 обеспечивает нативную поддержку всех этих задач в рамках единой кодовой базы. DAMO-YOLO строго ограничена обнаружением с помощью ограничивающих рамок.

Сценарии использования и рекомендации#

Выбор между DAMO-YOLO и YOLO26 зависит от твоих конкретных требований к проекту, ограничений развертывания и предпочтений в экосистеме.

Когда выбирать DAMO-YOLO#

DAMO-YOLO — сильный выбор для:

  • Высокопроизводительной видеоаналитики: обработки видеопотоков с высоким FPS на фиксированной инфраструктуре NVIDIA GPU, где пропускная способность при batch-1 является основной метрикой.
  • Промышленных производственных линий: сценариев с жесткими ограничениями по задержке GPU на специализированном оборудовании, таких как проверка качества в реальном времени на сборочных линиях.
  • Исследований Neural Architecture Search: изучения влияния автоматизированного поиска архитектуры (MAE-NAS) и эффективных репараметризованных бэкендов на производительность детекции.

Когда стоит выбрать YOLO26#

YOLO26 рекомендуется для:

  • Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
  • Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
  • Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.

Заключение#

Обе архитектуры представляют собой значительные достижения в области глубокого обучения. DAMO-YOLO предлагает захватывающий взгляд на мощь Neural Architecture Search и методов дистилляции, адаптированных для конкретных аппаратных бенчмарков.

Однако для разработчиков, исследователей и предприятий, ищущих готовое к производству решение, Ultralytics YOLO26 выделяется как лучший выбор. Сочетание сквозного дизайна без NMS, массивного прироста скорости вывода на CPU, мультимодальной универсальности и интеграции в хорошо поддерживаемую экосистему Ultralytics делает ее самым надежным и практичным инструментом для решения современных задач компьютерного зрения.

Для пользователей, заинтересованных в изучении других моделей в экосистеме Ultralytics, доступна исчерпывающая документация по YOLO11, YOLOv8 и RT-DETR на базе Transformer.

Комментарии