YOLOv6-3.0 и YOLOv9#
Развитие обнаружения объектов в реальном времени продолжается благодаря потребности в более высокой точности, меньшей задержке и эффективном использовании оборудования. В этом подробном сравнении рассматриваются две важные вехи: YOLOv6-3.0, созданная для высокой промышленной пропускной способности, и YOLOv9, представившая новые архитектуры для преодоления информационных узких мест глубокого обучения.
Обе модели предлагают уникальные архитектурные инновации, однако разработчики, которым нужен оптимальный баланс производительности и простоты развертывания, часто переходят на современные экосистемы. Для новых проектов рекомендуем изначально сквозную Ultralytics YOLO26: она обеспечивает точность на уровне передовых разработок и значительно упрощает работу разработчика.
YOLOv6-3.0: оптимизация промышленной пропускной способности#
Разработанная подразделением Vision AI компании Meituan, YOLOv6-3.0 была тщательно оптимизирована для максимальной пропускной способности в промышленных приложениях, особенно на GPU.
- Авторы: Чуйи Ли, Лулу Ли, Ифэй Гэн, Хунлян Цзян, Мэн Чэн, Бо Чжан, Зайдань Кэ, Сяомин Сюй и Сянсян Чу
- Организация: Meituan
- Дата: 13 января 2023 года
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
Архитектурные инновации#
В YOLOv6-3.0 появилось несколько важных изменений для улучшения объединения признаков и эффективности работы с оборудованием. В архитектуру добавлен модуль двунаправленной конкатенации (BiC) в шейной части, который обеспечивает более точную локализацию. Также используется стратегия обучения с помощью якорей (AAT). Она объединяет подробные подсказки обучения на основе якорей со скоростью вывода без якорей, повышая производительность без замедления развертывания.
В основе бэкбона лежит архитектура EfficientRep, тщательно оптимизированная для инференса на GPU. Благодаря этому модель отлично подходит для сценариев промышленного производства, где обычно используется интенсивная пакетная обработка.
Преимущества и недостатки#
Главное преимущество YOLOv6-3.0 — высокая частота кадров на GPU, например NVIDIA T4, что делает модель подходящей для высокоплотных потоков видеоанализа. Однако сильная зависимость от специфических аппаратных оптимизаций может приводить к неоптимальной задержке на периферийных устройствах, работающих только на CPU. Кроме того, настройка конвейера обучения может быть сложной по сравнению с более унифицированными фреймворками.
YOLOv9: программируемая информация о градиентах#
Выпущенная годом позже YOLOv9 решает проблему информационного узкого места, присущую глубоким нейронным сетям, и расширяет теоретические пределы архитектур CNN.
- Авторы: Chien-Yao Wang и Hong-Yuan Mark Liao
- Организация: Институт информатики Академии Синика
- Дата: 21 февраля 2024 года
- Arxiv: 2402.13616
- GitHub: WongKinYiu/yolov9
Архитектурные инновации#
Главный вклад YOLOv9 — программируемая градиентная информация (PGI), которая обеспечивает сохранение важных данных при прохождении через множество слоев сети и позволяет надежнее обновлять веса. Наряду с PGI в модели используется обобщенная сеть агрегации эффективных слоев (GELAN). GELAN максимально эффективно использует параметры, позволяя YOLOv9 обеспечивать более высокую точность с меньшим количеством FLOPs, чем у многих предшественников.
Преимущества и недостатки#
YOLOv9 демонстрирует отличную среднюю точность (mAP) на таких тестовых датасетах, как COCO, поэтому пользуется популярностью у исследователей, для которых важна максимальная точность. Однако, как и YOLOv6, модель по-прежнему использует традиционное подавление немаксимумов (NMS) для постобработки. Это увеличивает задержку и усложняет конвейер развертывания модели, особенно при переносе на периферийные устройства с использованием таких форматов, как ONNX или TensorRT.
Сравнение производительности#
При сравнении этих моделей важно учитывать баланс точности, количества параметров и скорости инференса.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
Преимущества Ultralytics: знакомство с YOLO26#
YOLOv6-3.0 и YOLOv9 предлагают надежные архитектуры, но для промышленной эксплуатации необходимы хорошо поддерживаемая экосистема, низкие требования к памяти и исключительная простота использования. Именно здесь выделяются платформа Ultralytics и такие модели, как YOLO11 и передовая YOLO26.
Выпущенная в начале 2026 года YOLO26 кардинально повышает эффективность развертывания, устраняя узкие места устаревших решений.
YOLO26 использует сквозную архитектуру без NMS: ее опциональная голова с назначением один к одному (nms=False) устраняет необходимость в постобработке с подавлением немаксимумов. Это значительно уменьшает разброс задержки инференса и упрощает логику развертывания на периферийных устройствах.
Ключевые инновации YOLO26#
- Оптимизатор MuSGD: вдохновленная обучением LLM, например Kimi K2 от Moonshot AI, YOLO26 использует гибрид SGD и Muon. Это обеспечивает беспрецедентную стабильность обучения и ускоряет сходимость в задачах компьютерного зрения.
- Инференс на CPU до 43% быстрее: в отличие от YOLOv6, ориентированной на мощные GPU, YOLO26 тщательно оптимизирована для периферийных устройств. Отказ от Distribution Focal Loss (DFL) упрощает голову модели, повышая совместимость с маломощными CPU и оборудованием для периферийных вычислений.
- ProgLoss + STAL: усовершенствованные функции потерь значительно улучшают обнаружение небольших объектов, что крайне важно для аэрофотосъемки и робототехники.
- Непревзойденная универсальность: если YOLOv6 предназначена только для обнаружения объектов, то YOLO26 без проблем справляется с сегментацией экземпляров, классификацией, оценкой позы и обнаружением ориентированных ограничивающих рамок (OBB).
Простое обучение с Ultralytics#
Для обучения современных моделей не должны требоваться сложные bash-скрипты. Python API Ultralytics упрощает рабочий процесс благодаря автоматической загрузке данных, минимальному использованию памяти CUDA и встроенному отслеживанию.
from ultralytics import YOLO
# Загрузи передовую наномодель YOLO26
model = YOLO("yolo26n.pt")
# Обучить на датасете COCO8 (optimizer='auto' выбирает MuSGD для продолжительного обучения)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Экспортировать обученную модель в ONNX одной командой
model.export(format="onnx")Оптимальные сценарии применения#
Выбор подходящей архитектуры полностью зависит от целевой среды развертывания:
- Используй YOLOv6-3.0 для: автоматизации производства и обнаружения дефектов, если в избытке доступны GPU серверного класса (например, A100), а пакетная обработка позволяет максимально увеличить пропускную способность.
- Используй YOLOv9 для: академических исследований или соревнований, где главная цель — выжать максимальный mAP на стандартизированных датасетах, таких как COCO.
- Используй YOLO26 для: почти всех современных коммерческих приложений. Возможность инференса без NMS, малый объем занимаемой памяти и быстрый инференс на CPU делают эту модель идеальной для систем охранной сигнализации, умной розницы и отслеживания объектов в реальном времени на встраиваемых устройствах.
Используя комплексную экосистему Ultralytics, разработчики могут без труда экспериментировать с YOLOv8, YOLO11 и YOLO26, чтобы найти оптимальный баланс производительности для своих задач в реальных условиях.