PP-YOLOE+ против YOLOX#
На развитие компьютерного зрения существенно повливал стремительный прогресс моделей обнаружения объектов. Среди важных вех этого процесса — PP-YOLOE+ и YOLOX, две архитектуры, расширившие границы производительности и точности в реальном времени. Исследователям и разработчикам, создающим системы визуального распознавания нового поколения, важно понимать особенности их архитектур, компромиссы в производительности и оптимальные сценарии развертывания.
Происхождение и характеристики моделей#
Перед тем как перейти к техническому разбору архитектур, полезно вспомнить историю создания обеих моделей. Каждую из них разработали для устранения конкретных узких мест в обнаружении объектов, а на их особенности заметно повлияли организации, которые их создали.
Подробности о PP-YOLOE+:
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Документация: README PaddleDetection PP-YOLOE+
Подробнее о YOLOX:
- Авторы: Чжэн Гэ, Сунтао Лю, Фэн Ван, Цзэмин Ли и Цзянь Сунь
- Организация: Megvii
- Дата: 2021-07-18
- Arxiv: https://arxiv.org/abs/2107.08430
- GitHub: https://github.com/Megvii-BaseDetection/YOLOX
- Документация: Официальная документация YOLOX
Архитектурные инновации#
Главные различия между этими двумя детекторами связаны с подходами к извлечению признаков и предсказанию ограничивающих рамок.
YOLOX привлекла внимание в 2021 году, успешно адаптировав семейство YOLO к архитектуре без якорей. Удаление якорных рамок значительно сократило число параметров проектирования и объем эвристической настройки, необходимых для пользовательских наборов данных. Кроме того, в модели появилась раздельная голова, которая распределяет задачи классификации и локализации по отдельным нейронным ветвям. Это устранило внутреннее противоречие между классификацией объекта и регрессией его пространственных координат, ускорив сходимость при обучении.
PP-YOLOE+, разработанная Baidu, тщательно оптимизирована для экосистемы PaddlePaddle. Она развивает PP-YOLOE и PP-YOLOv2, своих предшественников, за счет динамической стратегии сопоставления меток (TAL) и нового backbone CSPRepResNet. В backbone используется структурная репараметризация, благодаря которой модель применяет сложные многоветвевые архитектуры при обучении, а затем без проблем преобразует их в быструю сеть с одним путем вычислений для инференса.
Структурная репараметризация позволяет обучать модель с несколькими параллельными ветвями, улучшая распространение градиентов, а затем математически объединять эти ветви в один сверточный слой для развертывания. Это ускоряет инференс без потери точности.
Сравнение производительности и метрик#
При прямом сравнении становится ясно, что эти модели занимают разные позиции в спектре производительности. PP-YOLOE+ обычно обеспечивает более высокую абсолютную точность, а YOLOX предлагает очень легковесные варианты для оборудования с жесткими ограничениями.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
Примечание: лучшие значения в каждом соответствующем сегменте столбца выделены полужирным.
YOLOX предлагает варианты Nano и Tiny, которые занимают совсем мало места на диске и требуют минимум памяти CUDA. При этом PP-YOLOE+ отлично масштабируется на серверное оборудование и подходит для ресурсоемких промышленных приложений в экосистеме Baidu.
Применение в реальных условиях#
Выбор между этими фреймворками часто зависит от требований к интеграции и целевого оборудования.
В чем сильна YOLOX#
Благодаря архитектуре без якорей и наличию вариантов для самых компактных edge-устройств YOLOX популярна в робототехнике и на микроконтроллерах. Простой конвейер постобработки упрощает перенос модели в специализированные форматы для NPU, такие как TensorRT и NCNN.
В чем сильна PP-YOLOE+#
Организациям, глубоко интегрированным с производственными центрами Азии и использующим технологический стек Baidu, PP-YOLOE+ предлагает готовый, предварительно оптимизированный путь к развертыванию. Модель особенно эффективна для высокоточной проверки качества на мощных серверных стойках, где жесткие ограничения реального времени допускают использование более тяжелых моделей.
Сценарии использования и рекомендации#
Выбирай между PP-YOLOE+ и YOLOX с учетом требований конкретного проекта, ограничений развертывания и предпочтительной экосистемы.
Когда выбирать PP-YOLOE+#
PP-YOLOE+ — хороший выбор для:
- Интеграция с экосистемой PaddlePaddle: Организации с готовой инфраструктурой на базе фреймворка и инструментов PaddlePaddle от Baidu.
- Развертывание на периферийных устройствах с Paddle Lite: Развертывание на оборудовании со специально оптимизированными ядрами инференса для Paddle Lite или движка инференса Paddle.
- Обнаружение объектов на сервере с высокой точностью: Сценарии, где приоритетом является максимальная точность обнаружения на мощных серверах с GPU, а зависимость от конкретного фреймворка не имеет значения.
Когда стоит выбрать YOLOX#
YOLOX подойдёт для следующих задач:
- Исследования обнаружения без якорей: Академические исследования, в которых чистая архитектура YOLOX без якорей используется как базовая модель для экспериментов с новыми головами обнаружения или функциями потерь.
- Сверхкомпактные периферийные устройства: Развертывание на микроконтроллерах или устаревшем мобильном оборудовании, где критически важен крайне малый размер варианта YOLOX-Nano (0,91 млн параметров).
- Исследования назначения меток SimOTA: Исследовательские проекты по изучению стратегий назначения меток на основе оптимального транспорта и их влияния на сходимость обучения.
Когда выбирать Ultralytics (YOLO26)#
Для большинства новых проектов Ultralytics YOLO26 предлагает оптимальное сочетание производительности и удобства разработки:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Преимущества Ultralytics: знакомство с YOLO26#
Хотя PP-YOLOE+ и YOLOX стали выдающимися вехами в исследованиях, современная среда развёртывания требует более целостного и удобного для разработчиков подхода с высокой эффективностью. Именно здесь Ultralytics YOLO26 полностью переосмысливает стандарты современного визуального ИИ.
Для команд, которые хотят перейти от изолированных исследовательских репозиториев к готовым к эксплуатации системам, Ultralytics предлагает надёжную и хорошо поддерживаемую экосистему. Обучение модели больше не требует настройки сложных сред: достаточно обратиться к единому Python API.
Ключевые преимущества Ultralytics YOLO26:
- Сквозная архитектура без NMS: В отличие от PP-YOLOE+ и YOLOX, которым требуется подавление немаксимумов (NMS) для фильтрации избыточных ограничивающих рамок, YOLO26 предлагает встроенную сквозную голову (
nms=False). Это устраняет узкие места, связанные с задержками, и значительно упрощает логику развёртывания. - До 43% более быстрый инференс на CPU: Благодаря стратегическому отказу от Distribution Focal Loss (DFL) YOLO26 обеспечивает непревзойдённую скорость инференса на CPU, что делает модель намного эффективнее для периферийных вычислений и маломощных устройств.
- Оптимизатор MuSGD: Этот гибридный оптимизатор, вдохновлённый Kimi K2 от Moonshot AI, переносит стабильность обучения больших языковых моделей в компьютерное зрение, обеспечивая гораздо более быструю сходимость и снижая требования к памяти на этапах обучения.
- ProgLoss + STAL: Эти продвинутые функции потерь заметно улучшают распознавание мелких объектов — важную возможность для эксплуатации дронов и анализа детализированных аэрофотоснимков.
- Универсальность: В то время как PP-YOLOE+ и YOLOX ориентированы исключительно на детекцию, YOLO26 без труда справляется с сегментацией экземпляров, оценкой позы и ориентированными ограничивающими рамками (OBB), используя один и тот же понятный синтаксис.
Упрощённое обучение с Ultralytics#
Эффективность использования памяти и скорость обучения моделей Ultralytics не имеют себе равных: они значительно превосходят альтернативы на базе Transformer, требующие огромных затрат памяти CUDA. Всего несколько строк кода — и ты можешь использовать возможности YOLO26:
from ultralytics import YOLO
# Загрузи высокоэффективную сквозную нано-модель YOLO26
model = YOLO("yolo26n.pt")
# Обучи модель на примере датасета COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Проверка производительности модели
metrics = model.val()
# Экспортируй модель в ONNX или TensorRT без лишних усилий
model.export(format="engine")Командам, которым нужно решение без кода, платформа Ultralytics предоставляет облачное обучение, встроенную разметку наборов данных и развёртывание одним нажатием для всех твоих моделей YOLO.
Заключение#
PP-YOLOE+ и YOLOX уже заняли своё место в истории компьютерного зрения, предложив высокую точность и лёгкие безанкорные архитектуры соответственно. Однако для организаций, создающих будущее ИИ в сельском хозяйстве, умных городов и розничной торговли, постоянная поддержка, простота использования и встроенная архитектура без NMS делают Ultralytics YOLO26 бесспорным выбором.
Если ты изучаешь альтернативные архитектуры для конкретных бенчмарков, сравни более старую модель YOLO11 или варианты на базе Transformer, например RT-DETR, используя подробную документацию Ultralytics. Перейдя на единую экосистему Ultralytics, разработчики экономят драгоценное время и ресурсы и добиваются передовых результатов при развёртывании на периферии или в облаке.