Ultralytics YOLO27:

YOLOv5 и YOLOX#

Эволюция компьютерного зрения в реальном времени ознаменовалась многочисленными достижениями: различные архитектуры расширяли пределы скорости и точности. Две наиболее влиятельные модели в этой области — YOLOv5 и YOLOX. Хотя обе известны высокой производительностью в обнаружении объектов, они используют принципиально разные архитектурные подходы.

В этом руководстве представлен подробный технический анализ этих двух моделей: сравниваются их архитектуры, показатели производительности, методики обучения и оптимальные сценарии развертывания, чтобы помочь разработчикам и исследователям выбрать подходящий инструмент для своих проектов в области vision AI.

Обзор моделей и архитектурные различия#

Ultralytics YOLOv5#

Представленная компанией Ultralytics, YOLOv5 быстро стала отраслевым стандартом благодаря исключительному сочетанию производительности, простоты использования и эффективности использования памяти. Созданная непосредственно на базе фреймворка PyTorch, YOLOv5 использует архитектуру на основе anchor-боксов. Она опирается на заранее заданные формы ограничивающих рамок для предсказания расположения объектов, что делает ее высокоэффективной для стандартных задач обнаружения объектов.

Одно из главных преимуществ YOLOv5 — хорошо поддерживаемая экосистема. Модель предлагает обширную документацию, чрезвычайно простой Python API и встроенную интеграцию с Ultralytics Platform. Это позволяет разработчикам плавно переходить от разметки датасета к обучению и экспорту в такие форматы, как ONNX и TensorRT.

Преимущество экосистемы

Модели Ultralytics YOLO обычно требуют значительно меньше GPU-памяти во время обучения по сравнению со сложными альтернативами на основе Transformer. Небольшой объем потребляемой памяти делает YOLOv5 особенно доступной для исследователей, работающих на оборудовании потребительского класса.

Megvii YOLOX#

Разработанная исследователями из Megvii, YOLOX пошла другим путем, представив безъякорную архитектуру в семействе YOLO. Отказ от anchor-боксов упрощает голову обнаружения и значительно сокращает количество эвристических параметров, которые необходимо настраивать вручную во время обучения.

YOLOX также использует разделенную голову — задачи классификации и регрессии выполняются в разных ветвях сети — и стратегию назначения меток SimOTA. Эти инновации сокращают разрыв между академическими исследованиями и промышленными применениями, делая YOLOX особенно эффективной в условиях значительного разнообразия масштабов объектов.

Узнай больше о YOLOX

Производительность и метрики#

При оценке моделей компьютерного зрения критически важен компромисс между средней точностью (mAP) и скоростью инференса. Обе модели доступны в различных размерах — от Nano до Extra-Large — для работы с разными аппаратными ограничениями.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Хотя YOLOXx обеспечивает немного более высокую пиковую точность (51.1 mAP), YOLOv5 предлагает гораздо более надежный и тщательно протестированный конвейер развертывания на CPU и GPU. Скорости TensorRT для YOLOv5 демонстрируют глубокую оптимизацию для периферийных вычислительных устройств, что делает модель исключительно надежным выбором для аналитики видео в реальном времени.

Методики обучения и удобство использования#

Опыт разработчика при работе с этими двумя архитектурами существенно различается.

Подход YOLOX#

Для обучения YOLOX обычно требуется клонировать исходный репозиторий, управлять специфическими зависимостями и выполнять сложные скрипты командной строки. Хотя модель поддерживает продвинутые возможности, такие как обучение со смешанной точностью и конфигурации с несколькими узлами через MegEngine, порог вхождения может быть высоким для разработчиков, которым нужно быстро создавать прототипы.

Преимущества Ultralytics#

Напротив, Ultralytics уделяет приоритетное внимание исключительно удобному взаимодействию с пользователем. С помощью Python-пакета ultralytics разработчики могут загружать, обучать и валидировать модель с минимальным количеством шаблонного кода. Ultralytics автоматически обрабатывает сложные аугментации данных, эволюцию гиперпараметров и планирование скорости обучения.

from ultralytics import YOLO

# Load a pretrained YOLOv5 small model
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate the model's performance
metrics = model.val()

Кроме того, универсальность YOLOv5 выходит за рамки стандартного обнаружения объектов: модель обеспечивает надежную поддержку классификации изображений и сегментации экземпляров в рамках того же целостного API.

Упрощенное развертывание

После завершения обучения экспорт модели YOLOv5 в CoreML, TFLite или OpenVINO выполняется так же просто, как запуск model.export(format="onnx"). Это избавляет от необходимости использовать сторонние скрипты конвертации, которые часто требуются репозиториям, ориентированным на исследования.

Практические применения#

Выбор между этими моделями зависит от среды развертывания и технических требований:

  • Розничная торговля и управление запасами: Для приложений, требующих распознавания товаров в реальном времени на периферийных устройствах, таких как NVIDIA Jetson, YOLOv5 подходит исключительно хорошо. Небольшой объем потребляемой памяти и высокая скорость инференса TensorRT позволяют отслеживать объекты с нескольких камер без потери кадров.
  • Академические исследования и пользовательские архитектуры: YOLOX пользуется высокой популярностью в исследовательском сообществе. Ее разделенная голова и безъякорная архитектура делают модель отличной базовой системой для инженеров, которые хотят экспериментировать с новыми стратегиями назначения меток, а также для работы с датасетами, на которых традиционные anchor-боксы плохо обобщаются.
  • Сельскохозяйственный AI: Для задач точного земледелия, таких как обнаружение фруктов или выявление сорняков с помощью дронов, простота обучения и развертывания моделей YOLOv5 через Ultralytics Platform позволяет отраслевым специалистам внедрять AI-решения без глубоких знаний в области инженерии машинного обучения.

Варианты применения и рекомендации#

Выбор между YOLOv5 и YOLOX зависит от конкретных требований проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда стоит выбрать YOLOv5#

YOLOv5 — отличный выбор для:

  • Проверенных производственных систем: существующих развертываний, где важны длительная история стабильной работы YOLOv5, обширная документация и огромная поддержка сообщества.
  • Обучения при ограниченных ресурсах: сред с ограниченными ресурсами GPU, где эффективный конвейер обучения YOLOv5 и более низкие требования к памяти дают преимущества.
  • Широкой поддержки форматов экспорта: проектов, требующих развертывания во множестве форматов, включая ONNX, TensorRT, CoreML и TFLite.

Когда стоит выбрать YOLOX#

YOLOX рекомендуется для следующих задач:

  • Исследования обнаружения без якорей: Академические исследования, в которых чистая безъякорная архитектура YOLOX используется как базовая модель для экспериментов с новыми головками обнаружения или функциями потерь.
  • Сверхлёгкие периферийные устройства: Развертывание на микроконтроллерах или устаревшем мобильном оборудовании, где критически важен чрезвычайно малый размер варианта YOLOX-Nano (0.91M параметров).
  • Исследования назначения меток SimOTA: Исследовательские проекты, изучающие стратегии назначения меток на основе оптимального транспорта и их влияние на сходимость обучения.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Будущее ИИ для компьютерного зрения: встречай YOLO26#

Хотя и YOLOv5, и YOLOX уже заняли свое место в истории компьютерного зрения, эта область стремительно развивается. Разработчикам, начинающим новые проекты сегодня, Ultralytics настоятельно рекомендует обратить внимание на свою новейшую флагманскую модель YOLO26.

Выпущенная в январе 2026 года, YOLO26 представляет собой огромный шаг вперед как в производительности, так и в удобстве использования. В ней реализована революционная сквозная архитектура без NMS, полностью устраняющая постобработку Non-Maximum Suppression. Это значительно уменьшает вариативность задержки и упрощает логику развертывания на устройствах с низким энергопотреблением.

Кроме того, YOLO26 использует новый оптимизатор MuSGD — гибрид SGD и Muon, вдохновленный инновациями в обучении LLM, — для исключительно стабильной и быстрой сходимости. Благодаря удалению DFL (Distribution Focal Loss удалена для упрощения экспорта и улучшения совместимости с периферийными устройствами и устройствами с низким энергопотреблением) YOLO26 обеспечивает до 43% более быстрый инференс на CPU, укрепляя свои позиции как оптимальная модель для современных периферийных вычислений, робототехники и приложений IoT. Кроме того, ProgLoss + STAL обеспечивает улучшенные функции потерь с заметным повышением качества распознавания небольших объектов, что критически важно для IoT, робототехники и аэрофотосъемки. Пользователи, заинтересованные в предыдущих поколениях, также могут обратить внимание на YOLO11, хотя YOLO26 остается бесспорным лидером современного уровня.

Заключение#

И YOLOv5, и YOLOX предлагают впечатляющие возможности обнаружения объектов. YOLOX расширила границы архитектур, доказав в 2021 году, что безъякорные архитектуры могут конкурировать с традиционными методами и превосходить их. Однако YOLOv5 остается доминирующим решением благодаря непревзойденной простоте использования, обширной экосистеме и меньшим требованиям к памяти во время обучения.

Для подавляющего большинства коммерческих приложений экосистема Ultralytics обеспечивает самый быстрый путь от исходного датасета до развернутой промышленной модели. Используя проверенную временем YOLOv5 или переходя на передовую YOLO26, разработчики получают преимущества фреймворка, созданного для того, чтобы сделать vision AI доступным, эффективным и высокопроизводительным.

Комментарии