YOLO Vision 2026:

YOLOX против YOLOv5#

Выбор правильной модели обнаружения объектов — это критически важное решение, которое определяет успех любого проекта по компьютерному зрителю. Это руководство предоставляет исчерпывающее техническое сравнение двух ключевых моделей в мире ИИ: YOLOX от Megvii и Ultralytics YOLOv5. Анализируя их архитектуры, показатели производительности и экосистемы обучения, мы стремимся помочь разработчикам и исследователям сделать осознанный выбор для их конкретных сред развертывания.

Введение в модели#

Обе модели появились в период стремительного развития технологий обнаружения объектов в реальном времени, однако для достижения своей производительности они использовали разные архитектурные подходы.

YOLOX: безъякорный подход#

Выпущенный исследователями Чжэн Гэ, Сунтяо Лю, Фэн Ван, Цземин Ли и Цзянь Сунь из Megvii 18 июля 2021 года, YOLOX внес значительный сдвиг, отказавшись от традиционных якорных боксов. Задокументированный в их техническом отчете Arxiv, YOLOX объединил дизайн без якорей с разделенной головой и стратегией назначения меток SimOTA. Этот дизайн был направлен на преодоление разрыва между академическими исследованиями и промышленным применением, предлагая высокую производительность на стандартных наборах данных.

Узнать больше о YOLOX

YOLOv5: стандарт для промышленного ИИ в компьютерном зрении#

Созданный Гленном Джочером и выпущенный Ultralytics 26 июня 2020 года, YOLOv5 быстро стал отраслевым стандартом для развернутого компьютерного зрения. Созданный нативно на фреймворке PyTorch, он демократизировал передовой ИИ, предложив непревзойденную простоту использования, исключительно быстрое обучение и высоко отполированный репозиторий. Архитектура YOLOv5 была сосредоточена на идеальном балансе скорости, точности и простоты развертывания, что сделало ее фаворитом для всего — от периферийных устройств до масштабных облачных развертываний.

Узнай больше о YOLOv5

Архитектурные различия#

Понимание основных механических различий между этими сетями проясняет, почему они показывают разные результаты в различных задачах.

Безъякорный подход против якорного#

Самое заметное различие — это безъякорный механизм YOLOX. Традиционные модели, такие как YOLOv5, полагаются на предопределенные якорные рамки для предсказания ограничивающих рамок (BBox), что требует кластерного анализа обучающего набора данных для определения оптимальных размеров якорей. YOLOX устраняет это, предсказывая координаты ограничивающей рамки непосредственно в каждой пространственной локации. В то время как безъякорный подход сокращает количество параметров проектирования и необходимость эвристической настройки, усовершенствованный якорный подход YOLOv5, дополненный функцией auto-anchor, обеспечивает невероятно стабильную и предсказуемую сходимость обучения сразу «из коробки».

Разделенная «голова» (decoupled head) против объединенной (coupled head)#

В YOLOX используется разделенная «голова», что означает, что задачи классификации и регрессии разделены на разные ветви нейронной сети. Авторы утверждали, что это разрешает конфликты между изучением пространственных и семантических признаков. Напротив, YOLOv5 (в своих ранних версиях) использовала высокооптимизированную объединенную «голову», что максимизировало вычислительную эффективность и снижало задержку инференса, что критически важно для периферийных вычислений в реальном времени.

Архитектурная эволюция

В то время как YOLOX отстоял разделенную голову в 2021 году, Ultralytics позже переняла и усовершенствовала разделенные архитектуры в последующих моделях, таких как YOLOv8 и передовая YOLO26, объединив лучшее из обоих миров.

Стратегия назначения меток (Label Assignment)#

YOLOX использует SimOTA для назначения меток, что формулирует задачу сопоставления объектов ground truth с предсказаниями как задачу оптимальной транспортировки. Это динамическое назначение улучшает работу в сценах с высокой плотностью объектов. YOLOv5 применяет надежное назначение, основанное на правилах формы, гарантируя, что качественные положительные образцы стабильно подаются в функцию потерь, что способствует ее легендарной стабильности при обучении.

Производительность и бенчмарки#

Компромисс между скоростью и точностью — главный тест для этих архитектур. В приведенной ниже таблице показана производительность различных размеров моделей на стандартных бенчмарках.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(М)
FLOPs
(Б)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Хотя YOLOX достигает конкурентных значений mAP, особенно в своих крупных вариантах, YOLOv5 сохраняет заметное преимущество в скорости инференса через TensorRT по всем направлениям. Модель YOLOv5s, например, обеспечивает исключительное соотношение скорости и точности, что делает ее очень востребованной для приложений реального времени, где важна каждая миллисекунда.

Преимущество Ultralytics: обучение и удобство использования#

При переходе от исследований к продакшену экосистема, окружающая модель, часто так же важна, как и сама модель. Здесь преимущества экосистемы Ultralytics становятся очевидными.

Упрощенный пользовательский опыт#

YOLOv5 повсеместно хвалят за опыт разработчика «из нуля в герои». Python API Ultralytics и CLI позволяют загружать, обучать и развертывать модели с помощью одной строки кода. В отличие от этого, запуск YOLOX из репозитория GitHub Megvii требует более ручной настройки переменных окружения, сложных настроек путей Python и более крутой кривой обучения, типичной для кодовых баз академических исследований.

Эффективность обучения и требования к памяти#

Модели Ultralytics тщательно спроектированы для минимизации использования памяти во время обучения. YOLOv5 требует значительно меньше памяти CUDA по сравнению с сильно параметризованными трансформерными моделями, такими как RT-DETR или неоптимизированными исследовательскими моделями. Это позволяет разработчикам обучать большие размеры батча на оборудовании потребительского уровня, ускоряя цикл итеративной разработки.

Универсальность в задачах#

Хотя YOLOX является строго фреймворком обнаружения объектов, экосистема Ultralytics развила YOLOv5 для поддержки нескольких задач зрения. Из коробки ты можешь выполнять классификацию изображений, сегментацию экземпляров и обнаружение объектов, используя точно такой же синтаксис API.

Постоянные инновации

Если тебе требуются еще более продвинутые задачи, такие как оценка позы или обнаружение ориентированных ограничивающих рамок (OBB), мы настоятельно рекомендуем обновиться до новейшей архитектуры Ultralytics YOLO26, которая поддерживает все это нативно с передовой точностью.

Сравнение кода#

Разница в удобстве лучше всего видна в коде.

Обучение с YOLOv5:

from ultralytics import YOLO

# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")

# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")

# Display results
results[0].show()

Обучение с YOLOX: (Требует ручного клонирования репозитория, установки setup.py и сложных аргументов CLI)

# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -o

Подход Ultralytics устраняет трение, позволяя тебе сосредоточиться на твоем наборе данных и логике приложения, а не на отладке конфигурационных файлов. Кроме того, отслеживание твоих экспериментов происходит плавно благодаря встроенным интеграциям для Weights & Biases и Comet ML.

Идеальные сценарии использования и реальные приложения#

Выбор между этими моделями зависит от операционной среды твоего проекта.

В чем YOLOX превосходит#

YOLOX остается сильным кандидатом в академической среде, где исследователи изучают безъякорные парадигмы или стратегии назначения меток. Он также полезен в сценариях, где обнаружение в переполненных сценах является главной метрикой, а скорость развертывания на периферии — второстепенной.

В чем превосходит YOLOv5#

YOLOv5 — неоспоримый лидер практического развертывания.

  • Высокоскоростное производство: Для обнаружения дефектов на конвейерной линии минимальная задержка инференса YOLOv5 на периферийных GPU обеспечивает проверку продуктов без замедления ленты.
  • Дроны и аэрофотосъемка: Его эффективный объем памяти позволяет ему работать на легких сопутствующих компьютерах на дронах для таких задач, как мониторинг сельского хозяйства и отслеживание дикой природы.
  • Умный ритейл: От автоматизированного оформления заказа до управления запасами, YOLOv5 легко экспортируется в TensorRT и ONNX для массового развертывания на тысячах камер магазинов.

Взгляд в будущее: преимущество YOLO26#

Хотя YOLOv5 — легендарная модель, область ИИ развивается стремительно. Если ты начинаешь новый проект сегодня, мы настоятельно советуем обратить внимание на последнее поколение моделей Ultralytics.

Выпущенная в 2026 году, Ultralytics YOLO26 представляет собой огромный шаг вперед. Она имеет End-to-End NMS-Free Design, полностью исключая необходимость постобработки Non-Maximum Suppression, что значительно упрощает логику развертывания. Удалив Distribution Focal Loss (DFL) и используя передовой MuSGD Optimizer, YOLO26 достигает до на 43% более быстрого инференса на CPU по сравнению с предыдущими поколениями при сохранении более высокой точности, особенно на мелких объектах благодаря новым функциям потерь ProgLoss + STAL.

Независимо от того, выбираешь ли ты проверенную в боях надежность YOLOv5 или передовую производительность YOLO26, Платформа Ultralytics гарантирует, что у тебя есть лучшие доступные инструменты для плавного перевода твоих решений компьютерного зрения от концепции к продакшену. Обязательно изучи исчерпывающую документацию Ultralytics, чтобы раскрыть весь потенциал твоего конвейера ИИ.

Комментарии