YOLOX и YOLOv9#
Ландшафт компьютерного зрения формировался благодаря постоянным архитектурным прорывам, сочетающим вычислительную эффективность с высокой точностью. Сравнение моделей обнаружения объектов реального времени YOLOX от Megvii и YOLOv9 от Academia Sinica показывает два разных подхода к разработке методов глубокого обучения. Одна модель первой предложила упрощённую парадигму без anchor-боксов, а другая внедрила продвинутые методы маршрутизации градиентов для максимального сохранения информации.
В этом техническом руководстве рассматриваются особенности архитектур, результаты бенчмарков и оптимальные сценарии использования, а также показано, как современные решения, такие как платформа Ultralytics и недавно выпущенная модель YOLO26, предлагают более эффективные альтернативы для готового к промышленному развёртыванию ПО.
YOLOX: новаторская парадигма без anchor-боксов#
Выпущенная в середине 2021 года, YOLOX стала важным шагом к сближению академических исследований и промышленного применения. Отказ от заранее заданных anchor-боксов значительно упростил эвристическую настройку для пользовательских наборов данных.
- Авторы: Чжэн Гэ, Сунтао Лю, Фэн Ван, Цзэмин Ли и Цзянь Сунь
- Организация: Megvii
- Дата выпуска: 18 июля 2021 года
- Первоисточник: статья на Arxiv
- Исходный код: репозиторий YOLOX на GitHub
- Документация: официальная документация YOLOX
Архитектурные инновации#
YOLOX внесла несколько важных изменений в стандартный конвейер обнаружения объектов. В модели появилась разделённая голова, которая разделяет задачи классификации и регрессии и значительно уменьшает конфликт между распознаванием объекта и определением его границ. Кроме того, YOLOX использует SimOTA — продвинутую стратегию назначения меток, которая динамически распределяет положительные примеры во время обучения, ускоряя сходимость и повышая общую производительность на стандартных тестовых наборах данных.
Сильные стороны и ограничения#
Главное преимущество YOLOX — упрощённая архитектура. Благодаря механизму без anchor-боксов разработчики тратят меньше времени на кластеризацию для поиска оптимальных размеров anchor-боксов под конкретные данные. Однако эта более старая архитектура изначально не учитывает недавние достижения в области механизмов внимания и маршрутизации градиентов, поэтому ей сложно сравниться по эффективности использования параметров с новыми сетями. Также в ней нет встроенной поддержки таких продвинутых задач, как сегментация экземпляров и оценка позы, в рамках унифицированного API.
YOLOv9: максимальное использование информации о градиентах#
Перенесёмся в 2024 год: YOLOv9 предложила глубоко теоретический подход к решению проблемы информационного узкого места, характерной для глубоких свёрточных нейронных сетей.
- Авторы: Chien-Yao Wang и Hong-Yuan Mark Liao
- Организация: Институт информатики Академии Синика
- Дата выпуска: 21 февраля 2024 года
- Первоисточник: статья на Arxiv
- Исходный код: репозиторий YOLOv9 на GitHub
- Документация: документация Ultralytics по YOLOv9
Архитектурные инновации#
Отличительная особенность YOLOv9 — программируемая информация о градиентах (PGI), которая не даёт важным семантическим данным теряться при прохождении через многочисленные слои сети. В сочетании с обобщённой эффективной сетью агрегации слоёв (GELAN) PGI позволяет YOLOv9 достигать исключительного соотношения количества параметров и точности. Благодаря этому модель сохраняет точные градиенты для обновления весов и остаётся эффективной даже в облегчённых вариантах.
Сильные стороны и ограничения#
YOLOv9 превосходит другие модели, устанавливая теоретические пределы точности моделей. Она демонстрирует впечатляющие показатели mAP на COCO и пользуется популярностью у исследователей. Однако, несмотря на эффективность, YOLOv9 по-прежнему использует традиционное подавление немаксимумов (NMS) для постобработки, что приводит к резким скачкам задержки во время инференса. Для инженеров, которые развёртывают ИИ на периферийных устройствах, обработка логики NMS добавляет в конвейер развёртывания ненужную сложность.
Традиционным моделям, таким как YOLOX и YOLOv9, требуется подавление немаксимумов (NMS) для фильтрации дублирующихся ограничивающих рамок. Этот этап по своей природе выполняется последовательно и часто создаёт узкое место на CPU, что подчёркивает необходимость в нативных сквозных архитектурах, используемых в новейших моделях Ultralytics.
Сравнение производительности#
Сравнение основных вычислительных показателей этих архитектур показывает, что YOLOv9 предлагает более современную базовую модель, а YOLOX остаётся лёгким вариантом для устаревших систем. Ниже приведено подробное сравнение их стандартных моделей.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
Хотя YOLOv9 демонстрирует более высокую точность при сопоставимом количестве параметров, разработчикам, которым нужен оптимальный баланс скорости, точности и простоты использования, стоит обратить внимание на новейшие разработки Ultralytics.
Преимущества Ultralytics: знакомься с YOLO26#
Исторические модели, такие как YOLOX и YOLOv9, дают ценное представление об эволюции компьютерного зрения, но современный передовой уровень задаёт Ultralytics YOLO26. Выпущенная в начале 2026 года YOLO26 принципиально меняет архитектуру конвейера обнаружения для современных корпоративных сред.
Непревзойдённые архитектурные инновации#
YOLO26 устраняет узкие места постобработки, характерные для предшественников, благодаря дополнительной сквозной архитектуре без NMS (nms=False), упрощая развёртывание на любом оборудовании. Кроме того, отказ от Distribution Focal Loss (DFL) и внедрение нового оптимизатора MuSGD — гибрида стохастического градиентного спуска и Muon — обеспечивают беспрецедентную стабильность обучения.
Для разработчиков, развёртывающих модели в условиях ограниченных ресурсов, например на Raspberry Pi, YOLO26 обеспечивает до 43% более быстрый инференс на CPU. Модель также использует ProgLoss + STAL (прогрессивную функцию потерь и назначение меток с учётом малых объектов), что значительно улучшает распознавание мелких объектов, критически важное для съёмки с воздуха и аналитики с дронов.
Упрощённая экосистема разработки#
В отличие от отдельных исследовательских репозиториев, экосистема Ultralytics обеспечивает непревзойдённые удобство и возможности для разработчиков. Используя Python API Ultralytics, инженеры могут значительно сократить количество шаблонного кода. Кроме того, требования к памяти тщательно оптимизированы: можно обучать надёжные модели, используя меньше видеопамяти GPU, чем для архитектур с интенсивным применением механизмов внимания.
from ultralytics import YOLO
# Загрузить компактную модель YOLO26 без NMS с высокой степенью оптимизации
model = YOLO("yolo26s.pt")
# Обучить модель на пользовательском наборе данных с минимальными затратами памяти
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Легко экспортировать модель в оптимизированные форматы для развёртывания
model.export(format="engine", quantize=16) # Экспортируем в TensorRTПомимо обнаружения объектов, YOLO26 поддерживает множество задач в рамках того же фреймворка. Будь то точные ориентированные ограничивающие рамки (OBB) для спутниковой съёмки или детализированные попиксельные маски для медицинской визуализации, рабочий процесс остаётся неизменным. Командам, использующим рабочие процессы предыдущего поколения, также доступна модель Ultralytics YOLO11, которая полностью поддерживается.
Оптимальные сценарии применения и стратегии развёртывания#
Выбор архитектуры полностью зависит от целевой среды развёртывания и требований проекта.
Периферийные вычисления и робототехника#
На маломощных устройствах модели, которым требуется ресурсоёмкая постобработка, могут резко снижать производительность. Хотя YOLOX-Nano очень компактна, её точности часто недостаточно для критически важных задач. Здесь оптимальный выбор — YOLO26: её голова без DFL и дополнительный инференс без NMS позволяют модели эффективно работать на потоках CPU, что делает её идеальной для автономной робототехники и управления умной парковкой.
Академические бенчмарки#
Если главная цель — анализировать поток градиентов и изучать узкие места глубоких сетей, YOLOv9 остаётся отличным объектом исследования. Фреймворк PGI позволяет наглядно изучить, как признаки сохраняются в слоях глубокой нейронной сети, и потому служит ценным инструментом для университетских исследователей, изучающих теорию свёрточных сетей.
Корпоративная видеоаналитика#
Для масштабной обработки видео, например в системах охранной сигнализации или при мониторинге дорожного движения, первостепенное значение имеют скорость и универсальные возможности экспорта. Встроенные средства экспорта фреймворка Ultralytics позволяют командам одной командой скомпилировать YOLO26 непосредственно в TensorRT или OpenVINO, значительно сокращая время выхода на рынок.
Используя широкие возможности экосистемы Ultralytics, команды машинного обучения могут обойти сложности работы с исходным исследовательским кодом и сосредоточиться на создании масштабируемых ИИ-приложений для реальных задач.