YOLOv9 и YOLOv6-3.0#
Развитие обнаружения объектов в реальном времени обеспечивают постоянные инновации в архитектурах нейронных сетей, позволяющие находить тонкий баланс между скоростью инференса, точностью и вычислительной эффективностью. Разработчикам и исследователям, которые разбираются в многообразии платформ компьютерного зрения, важно сравнивать ведущие архитектуры, чтобы выбрать подходящий инструмент для конкретной задачи.
В этом техническом руководстве подробно сравниваются две мощные модели: YOLOv9, известная эффективным сохранением информации при глубоком обучении, и YOLOv6-3.0, специально созданная для промышленного применения.
Обзор YOLOv9: максимальное сохранение признаков#
Представленная в начале 2024 года YOLOv9 решает одну из самых устойчивых проблем глубоких нейронных сетей — потерю информации при прямом проходе. Благодаря надёжным градиентам и сохранению важных данных на картах признаков модель расширяет границы теоретической точности.
- Авторы: Chien-Yao Wang и Hong-Yuan Mark Liao
- Организация: Институт информатики, Academia Sinica, Тайвань
- Дата: 21 февраля 2024 года
- Ссылки: Статья на Arxiv, репозиторий на GitHub
Архитектура и методики#
В YOLOv9 используются программируемая информация о градиентах (PGI) и обобщённая эффективная сеть агрегации слоёв (GELAN). PGI устраняет узкое место, связанное с потерей информации, с помощью дополнительного обучения с учителем. Это позволяет основной сети извлекать надёжные признаки без дополнительных затрат во время инференса. GELAN, в свою очередь, эффективнее использует параметры, благодаря чему модель достигает передовых результатов по средней точности (mAP), сохраняя вычислительные затраты на приемлемом уровне. Поэтому модель отлично подходит для анализа медицинских изображений и обнаружения очень мелких объектов, где критически важно сохранять точность признаков.
Обзор YOLOv6-3.0: создана для масштабных промышленных задач#
Разработанная компанией Meituan, YOLOv6-3.0 (также называемая v3.0) с самого начала создавалась для сложных промышленных задач. Выпущенная в начале 2023 года, она ориентирована прежде всего на эффективность развёртывания и предлагает набор моделей, удобных для квантования и хорошо работающих на периферийном оборудовании.
- Авторы: Чуйи Ли, Лулу Ли, Ифэй Гэн, Хунлян Цзян, Мэн Чэн, Бо Чжан, Зайдань Кэ, Сяомин Сюй и Сянсян Чу
- Организация: Meituan
- Дата: 13 января 2023 года
- Ссылки: Статья на Arxiv, репозиторий на GitHub
Архитектура и методики#
YOLOv6-3.0 выделяется стратегиями RepOptimizer и обучения с помощью якорей (AAT). В модели используется аппаратно-ориентированная архитектура нейронной сети, вдохновлённая RepVGG. Благодаря объединению слоёв она обеспечивает исключительно высокую скорость инференса на GPU. В версии 3.0 архитектура была дополнительно усовершенствована: модуль двунаправленной конкатенации (BiC) повысил точность локализации. Благодаря высокой степени оптимизации для форматов развёртывания, таких как TensorRT и OpenVINO, YOLOv6-3.0 часто используют в логистике, автоматизации производства и высокопроизводительных серверных системах.
Сравнение производительности#
При оценке этих моделей на стандартном наборе данных COCO видны различия в компромиссе между точностью и скоростью инференса.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
Технический анализ#
YOLOv6-3.0n лидирует по чистой скорости на оборудовании T4 (1,17 мс), а YOLOv9t обеспечивает немного более высокий mAP (38,3%), используя при этом менее половины параметров (2,0 млн против 4,7 млн) и значительно меньше FLOPs. Для сложных задач, требующих высокой точности, крупная YOLOv9e повышает mAP до 55,6%, демонстрируя возможности архитектуры PGI в глубоких сетях.
Если ты начинаешь новый проект в области компьютерного зрения, мы настоятельно рекомендуем использовать YOLO26. Выпущенная в 2026 году, эта модель включает встроенную сквозную архитектуру без NMS (nms=False), которая устраняет задержку постобработки NMS и обеспечивает до 43% более быстрый инференс на CPU.
Преимущества экосистемы Ultralytics#
Какую бы архитектуру ты ни выбрал, её нативная реализация через Python API Ultralytics обеспечит удобную работу разработчика.
Удобство использования и эффективность обучения#
Традиционно для обучения сложных моделей глубокого обучения требуется много шаблонного кода. Платформа Ultralytics берёт на себя решение этих сложных задач. Рабочий процесс остаётся простым и последовательным: будь то дообучение YOLOv9 для обнаружения дефектов или экспорт YOLOv6 для мобильных приложений.
Кроме того, архитектуры Ultralytics обычно требуют меньше памяти CUDA во время обучения, чем громоздкие модели на базе Transformer. Благодаря этому разработчики могут использовать более крупные размеры пакетов на потребительских GPU и значительно повысить эффективность обучения.
from ultralytics import YOLO
# Легко переключайся между архитектурами, меняя строку с именем файла модели
# model = YOLO("yolov6n.yaml") # YOLOv6 доступна в виде конфигурации YAML (без предварительно обученных весов)
model = YOLO("yolov9c.pt")
# Обучи модель со встроенной аугментацией данных и кэшированием
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")
# Экспортируй в ONNX или TensorRT без проблем
model.export(format="engine", quantize=16)Непревзойдённая универсальность для разных задач машинного зрения#
Хотя YOLOv6-3.0 тщательно оптимизирована для быстрого построения ограничивающих рамок, современные проекты компьютерного зрения часто требуют решения нескольких задач. Модели Ultralytics известны своей исключительной универсальностью. С помощью таких инструментов, как Ultralytics YOLOv8 и более новой YOLO26, единая платформа позволяет решать самые разные задачи: обнаружение объектов, сегментация экземпляров, классификация изображений, оценка позы и ориентированные ограничивающие рамки (OBB).
Представляем YOLO26: новый стандарт#
Для организаций, стремящихся одновременно добиться высокой производительности и упростить развёртывание, YOLO26 — оптимальное сочетание скорости и точности.
Развивая успех YOLO11, YOLO26 предлагает несколько новаторских функций:
- Оптимизатор MuSGD: Вдохновлённый методами обучения больших языковых моделей (LLM), такими как Kimi K2 от Moonshot AI, этот гибридный оптимизатор обеспечивает исключительно стабильное обучение и быструю сходимость.
- Удаление DFL: YOLO26 упрощает граф экспорта, удаляя Distribution Focal Loss. Благодаря этому модель значительно лучше совместима с маломощными чипами для периферийных вычислений.
- ProgLoss + STAL: Эти усовершенствованные функции потерь заметно улучшают распознавание небольших объектов, что важно для работы дронов и приложений IoT.
- Улучшения для отдельных задач: YOLO26 включает встроенное многомасштабное прототипирование для сегментации, оценивание остаточного логарифмического правдоподобия (RLE) для оценки позы и специальные алгоритмы угловых функций потерь для устранения сложных случаев при обнаружении OBB.
Оптимальные сценарии развёртывания#
В конечном счёте выбор подходящей архитектуры зависит от ограничений твоей производственной среды.
Выбирай YOLOv6-3.0, если у тебя уже есть конвейер для промышленного производства, ты активно используешь квантование и специализированные ускорители инференса, а минимальная задержка на оборудовании критически важна.
Выбирай YOLOv9, если работаешь над сложной задачей диагностики в здравоохранении или дальнего видеонаблюдения, где нельзя упускать малозаметные признаки на уровне пикселей.
Однако для сбалансированного подхода, который сочетает передовую точность с упрощённым развёртыванием без NMS, Ultralytics YOLO26 — однозначный выбор для современных проектов в области компьютерного зрения. Благодаря активной разработке, подробной документации и развитому сообществу эта модель незаменима для исследователей и разработчиков.