YOLO26 против DAMO-YOLO#
При выборе современной модели компьютерного зрения критически важно найти оптимальный баланс между скоростью инференса, точностью и простотой развертывания. В этом подробном руководстве сравниваются две видные модели в области визуального ИИ: Ultralytics YOLO26 и DAMO-YOLO. Хотя обе архитектуры расширяют границы детектирования объектов в реальном времени, их базовые принципы проектирования и предполагаемые сценарии использования существенно различаются.
Архитектурные инновации и дизайн#
Ultralytics YOLO26: стандарт компьютерного зрения, ориентированный на Edge-устройства#
Разработанная Гленном Джохером (Glenn Jocher) и Цзин Цю (Jing Qiu) в компании Ultralytics и выпущенная 14 января 2026 года, модель YOLO26 представляет собой огромный шаг вперед в линейке YOLO. Она создана с нуля для периферийных вычислений, органично объединяя передовые методы обучения LLM с продвинутыми архитектурами компьютерного зрения.
Ключевые архитектурные прорывы YOLO26 включают:
- Сквозной дизайн без NMS: Опираясь на новаторскую работу YOLOv10, YOLO26 изначально является сквозной (end-to-end). Полностью исключая неподавление максимумов (NMS) на этапе постобработки, она гарантирует детерминированную задержку и значительно упрощает конвейеры развертывания.
- Удаление DFL: Удаление функции потерь фокального распределения (Distribution Focal Loss) оптимизирует граф модели. Это делает экспорт в такие фреймворки развертывания, как ONNX и TensorRT, намного более плавным и обеспечивает лучшую совместимость с маломощными периферийными устройствами.
- Оптимизатор MuSGD: Этот гибрид стохастического градиентного спуска (SGD) и Muon, вдохновленный Kimi K2 от Moonshot AI, привносит инновации обучения LLM в компьютерное зрение, что приводит к удивительно стабильному обучению и быстрой сходимости.
- ProgLoss + STAL: Эти продвинутые функции потерь обеспечивают заметное улучшение распознавания мелких объектов, что является критически важной необходимостью для анализа аэрофотоснимков с дронов и сложных робототехнических конвейеров.
DAMO-YOLO: нейронный архитектурный поиск в масштабе#
Разработанная Сяньчжэ Сюй (Xianzhe Xu), Ици Цзян (Yiqi Jiang), Вэйхуа Чэнем (Weihua Chen), Илунем Хуаном (Yilun Huang), Юанем Чжаном (Yuan Zhang) и Сююй Сунем (Xiuyu Sun) из Alibaba Group (выпущена 23 ноября 2022 года), DAMO-YOLO уделяет огромное внимание автоматизированному поиску архитектур. Исследование, подробно описанное в их статье на arXiv, использует поиск архитектуры нейросетей (NAS) для нахождения оптимальных бэкбонов в условиях жестких ограничений по задержке.
Ключевые архитектурные особенности DAMO-YOLO включают:
- Бэкбон MAE-NAS: Использует многоцелевой эволюционный поиск для автоматического проектирования бэкбонов, которые балансируют точность с целевой скоростью развертывания.
- Эффективный RepGFPN: Надежный дизайн «тяжелой» горловины (heavy-neck), который оптимизирует слияние признаков в разных масштабах, делая модель высокоэффективной при обработке сложных визуальных сцен.
- ZeroHead: Радикально упрощенная детектирующая головка, разработанная для минимизации вычислительных затрат в финальных слоях предсказания.
Хотя архитектура DAMO-YOLO, основанная на NAS, отлично подходит для конкретных, заранее определенных аппаратных ограничений, дизайн без NMS и удаление DFL в YOLO26 делают ее гораздо более универсальным и предсказуемым выбором для широкого спектра разнообразных граничных и облачных сред.
Сравнение производительности и метрик#
Прямое сравнение вариантов моделей, обученных на стандартном наборе данных COCO, выявляет отчетливые профили производительности. В таблице ниже описаны компромиссы между точностью (mAP), скоростью и вычислительными затратами (количеством параметров и FLOPs).
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Анализ производительности#
При анализе данных баланс производительности сильно склоняется в пользу YOLO26 для современных приложений. Вариант Nano (YOLO26n) исключительно легкий — всего 2,4 млн параметров, обеспечивающий молниеносную скорость 1,7 мс на GPU NVIDIA T4. Более того, YOLO26 специально спроектирована для обеспечения до 43% более быстрого вывода на CPU, что делает ее бесспорным чемпионом для граничных устройств без выделенных GPU-ускорителей.
Хотя DAMO-YOLOt немного превосходит YOLO26n по чистой метрике mAP, это достигается ценой почти четырехкратного увеличения количества параметров (8.5M). По мере перехода к более крупным вариантам YOLO26 стабильно превосходит DAMO-YOLO по точности, сохраняя при этом меньший объем памяти, более низкое потребление памяти CUDA во время обучения и значительно более высокую скорость TensorRT.
Экосистема, удобство использования и эффективность обучения#
Истинная сила модели машинного обучения заключается не только в ее сухих метриках, но и в том, насколько легко она может использоваться разработчиками и исследователями.
Преимущество Ultralytics#
Выбор модели Ultralytics гарантирует доступ к высокоразвитой экосистеме, ориентированной на разработчиков. Сложные рабочие процессы, включающие аугментацию данных, подбор гиперпараметров и надежное отслеживание экспериментов, инкапсулированы в интуитивно понятные команды.
Более того, YOLO26 предлагает непревзойденную универсальность. В то время как DAMO-YOLO — это исключительно детектор объектов, YOLO26 «из коробки» предоставляет комплексные, специализированные улучшения для нескольких задач:
- Сегментация экземпляров: Использование специализированных потерь семантической сегментации и многомасштабного прототипирования.
- Оценка позы: Использование преимуществ продвинутой оценки остаточного логарифмического правдоподобия (RLE).
- Ориентированные ограничивающие рамки (OBB): Включение специализированных функций потерь по углам для идеального решения сложных проблем с границами.
- Классификация изображений: Для быстрого и легкого глобального аннотирования изображений.
Методологии обучения#
Обучение DAMO-YOLO часто включает сложный процесс дистилляции, при котором большая модель-«учитель» обучает меньшую модель-«ученика». Хотя этот метод дает незначительный прирост точности, он требует больших объемов памяти GPU и более длительных циклов обучения.
И наоборот, требования к памяти для YOLO26 значительно ниже. Благодаря оптимизатору MuSGD модель YOLO26 обучается быстро и эффективно на стандартном потребительском «железе». Вот как легко ты можешь обучить модель YOLO26, используя Python API Ultralytics на базе PyTorch:
from ultralytics import YOLO
# Initialize the natively end-to-end YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Export the optimized, NMS-free model
model.export(format="onnx")Применение в реальных условиях#
Выбор между этими архитектурами в конечном итоге зависит от твоей среды развертывания.
Edge AI и IoT-устройства#
Для умных камер розничной торговли, автоматизированных сельскохозяйственных мониторов или робототехники вычислительные ресурсы строго ограничены. Здесь YOLO26 является безальтернативным выбором. Ее на 43% более быстрый инференс на CPU, полностью свободный от NMS конвейер и крошечный объем параметров позволяют ей бесперебойно работать на периферийных устройствах вроде Raspberry Pi без ущерба для критически важной точности.
Высокоскоростное производство и контроль качества#
На линиях автоматизации производства с высоким темпом работы обнаружение дефектов на быстро движущихся конвейерных лентах требует минимальной и детерминированной задержки. Хотя DAMO-YOLO может работать приемлемо на определенных конфигурациях GPU, колеблющаяся задержка, вносимая традиционной постобработкой NMS, может рассинхронизировать роботизированные приводы. Сквозная природа YOLO26 гарантирует стабильное, предсказуемое время обработки кадров, обеспечивая безупречную интеграцию в высокоскоростную промышленную робототехнику.
Дроны и аэрофотосъемка#
Обнаружение крошечных объектов с большой высоты — задача заведомо сложная. Интеграция ProgLoss и STAL в YOLO26 кардинально улучшает распознавание мелких объектов. Независимо от того, отслеживаешь ли ты дикую природу или анализируешь транспортные заторы с БПЛА, YOLO26 последовательно идентифицирует объекты с меньшей площадью в пикселях, которые старые архитектуры, включая DAMO-YOLO, часто пропускают.
Сценарии использования и рекомендации#
Выбор между YOLO26 и DAMO-YOLO зависит от твоих конкретных требований проекта, ограничений развертывания и предпочтений в экосистеме.
Когда стоит выбрать YOLO26#
YOLO26 — отличный выбор для:
- Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
- Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
- Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.
Когда выбирать DAMO-YOLO#
DAMO-YOLO рекомендуется для:
- Высокопроизводительной видеоаналитики: обработки видеопотоков с высоким FPS на фиксированной инфраструктуре NVIDIA GPU, где пропускная способность при batch-1 является основной метрикой.
- Промышленных производственных линий: сценариев с жесткими ограничениями по задержке GPU на специализированном оборудовании, таких как проверка качества в реальном времени на сборочных линиях.
- Исследований Neural Architecture Search: изучения влияния автоматизированного поиска архитектуры (MAE-NAS) и эффективных репараметризованных бэкендов на производительность детекции.
Заключение#
Хотя DAMO-YOLO остается увлекательным исследованием возможностей нейронного архитектурного поиска для конкретных аппаратных целей, Ultralytics YOLO26 является превосходным, всесторонним решением для современного специалиста по ИИ. Благодаря сквозной архитектуре без NMS, значительно меньшим требованиям к памяти, гибридному оптимизатору MuSGD и безупречно поддерживаемой экосистеме, YOLO26 дает разработчикам возможность создавать и развертывать современные системы компьютерного зрения быстрее и надежнее, чем когда-либо прежде.