PP-YOLOE+ и YOLOv7#
При построении конвейеров компьютерного зрения крайне важно выбрать подходящую модель обнаружения объектов. Две значимые архитектуры 2022 года, PP-YOLOE+ и YOLOv7, представили мощные усовершенствования для обнаружения объектов в реальном времени. В этом техническом сравнении подробно рассматриваются их архитектуры, методы обучения и результаты в реальных условиях, чтобы помочь тебе принять обоснованное решение для своих задач.
Обзор моделей#
И PP-YOLOE+, и YOLOv7 созданы для того, чтобы расширить границы точности и скорости, однако они принадлежат к разным экосистемам разработки и основаны на разных принципах проектирования.
PP-YOLOE+#
PP-YOLOE+, разработанная авторами PaddlePaddle из Baidu, стала развитием оригинальной PP-YOLOv2. Её представили как эффективный и высокоточный детектор объектов, оптимизированный для экосистемы PaddlePaddle.
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: 2203.16250
- GitHub: Репозиторий PaddleDetection
- Документация: Документация PP-YOLOE+
YOLOv7#
YOLOv7, разработанная Чиен-Яо Вангом, Алексеем Бочковским и Хун-Юань Марком Ляо, представила «обучаемый набор бесплатных улучшений» и на момент выхода установила новые рекордные показатели для детекторов объектов реального времени.
- Авторы: Chien-Yao Wang, Alexey Bochkovskiy и Hong-Yuan Mark Liao
- Организация: Институт информатики, Academia Sinica, Тайвань
- Дата: 2022-07-06
- Arxiv: 2207.02696
- GitHub: Репозиторий YOLOv7
- Документация: Документация Ultralytics YOLOv7
Архитектурные инновации#
Архитектура PP-YOLOE+#
PP-YOLOE+ активно использует безанкерный подход, упрощая развёртывание за счёт отказа от настройки анкерных рамок для пользовательских наборов данных. В модели применяются мощный бэкбон RepResNet и сеть PAN в стиле CSPNet (сеть агрегации путей) для эффективного объединения признаков разных масштабов. Кроме того, во время обучения используется концепция выравнивания задач (TAL), которая динамически согласует задачи классификации и локализации и обеспечивает высокую точность при решении различных задач компьютерного зрения.
Архитектура YOLOv7#
В YOLOv7 применён другой подход — сеть E-ELAN (расширенная эффективная сеть агрегации слоёв). Эта архитектура позволяет сети изучать более разнообразные признаки, не нарушая исходный путь градиента, что улучшает сходимость. YOLOv7 также активно использует перепараметризацию модели, в частности запланированные перепараметризованные свёртки: во время инференса они объединяют свёрточные слои, ускоряя выполнение без потери точности. Благодаря этому YOLOv7 особенно эффективна для таких задач, как отслеживание нескольких объектов и сложные системы охранной сигнализации.
Анализ производительности#
При выборе между скоростью, количеством параметров и точностью (mAP) результаты моделей зависят от конкретной версии и целевого оборудования. Ниже приведено подробное сравнение их метрик.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Хотя модель PP-YOLOE+x показывает немного более высокий mAP, варианты YOLOv7 обеспечивают очень хорошее соотношение количества параметров и точности. Архитектура YOLOv7 остаётся популярным выбором для обработки на GPU, где оптимизация с помощью TensorRT обеспечивает исключительно низкую задержку.
Преимущества Ultralytics#
При обучении и развёртывании этих моделей выбор фреймворка не менее важен, чем сама модель. Ultralytics обеспечивает упрощённую работу благодаря унифицированному Python API, которое упрощает весь жизненный цикл машинного обучения.
- Поддерживаемая экосистема: модели Ultralytics YOLO используют постоянно развивающуюся экосистему, подробную документацию и активное сообщество.
- Требования к памяти: Ultralytics активно оптимизирует загрузку данных и режимы обучения. Для обучения моделей Ultralytics YOLO обычно требуется значительно меньше памяти CUDA, чем для ресурсоёмких архитектур на основе Transformer, что позволяет разработчикам использовать большие размеры батча на потребительском оборудовании.
- Эффективность обучения: благодаря надёжным стратегиям аугментации данных и встроенной настройке гиперпараметров модели Ultralytics быстро сходятся, используя готовые предобученные веса.
Простая реализация с помощью API#
Пакет Ultralytics не поддерживает нативное обучение YOLOv7 (инструкции по использованию экспортированных версий upstream YOLOv7 см. в документации YOLOv7), но для обучения современной модели Ultralytics YOLO достаточно нескольких строк кода: сложные сценарии обучения полностью скрыты от пользователя.
from ultralytics import YOLO
# Загрузи предобученную модель YOLO26
model = YOLO("yolo26n.pt")
# Обучи модель на собственном датасете
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Экспортируй модель в TensorRT для развёртывания
model.export(format="engine", device=0)Новый стандарт: представляем YOLO26#
PP-YOLOE+ и YOLOv7 стали важными этапами развития обнаружения объектов, но область ИИ стремительно меняется. Для любого нового проекта в области компьютерного зрения мы настоятельно рекомендуем Ultralytics YOLO26. Выпущенная в январе 2026 года, YOLO26 знаменует огромный скачок вперёд в области периферийного ИИ для компьютерного зрения.
Почему YOLO26 превосходит старые архитектуры:
- Сквозная архитектура без NMS: YOLO26 изначально является сквозной моделью. Благодаря дополнительной голове с соответствием один к одному (
nms=False) модель пропускает постобработку с подавлением немаксимумов (NMS), обеспечивая предсказуемую детерминированную задержку инференса — это прорыв впервые появился в YOLOv10. - Удаление DFL: отказ от Distribution Focal Loss упрощает экспорт и значительно повышает совместимость с маломощными периферийными устройствами.
- Инференс на CPU до 43% быстрее: YOLO26 специально оптимизирована для эффективной работы непосредственно на CPU в сценариях без выделенных GPU, например на датчиках IoT для умных городов.
- Оптимизатор MuSGD: вдохновлённая передовыми методами обучения LLM, например Kimi K2 от Moonshot AI, YOLO26 использует гибрид SGD и Muon для исключительно стабильного обучения и быстрой сходимости.
- ProgLoss + STAL: эти улучшенные функции потерь значительно повышают точность обнаружения небольших объектов, что важно для таких задач, как аэрофотосъёмка с дронов и обнаружение дефектов на производстве.
Оптимальные сценарии применения и развертывания#
Когда стоит выбрать PP-YOLOE+#
PP-YOLOE+ особенно эффективна, если ты глубоко интегрирован в экосистему Baidu и PaddlePaddle. Если для развёртывания используется специализированное оборудование, рассчитанное на модели Paddle (например, в некоторых производственных конвейерах Азии), PP-YOLOE+ обеспечит высокую точность и простую интеграцию. Модель отлично подходит для автоматизации промышленного производства.
Когда использовать YOLOv7#
YOLOv7 остаётся отличным выбором для универсального высокопроизводительного инференса, особенно при развёртывании на оборудовании NVIDIA с использованием TensorRT. Интеграция в экосистему PyTorch делает её универсальной для академических исследований и пользовательских коммерческих конвейеров, например для управления толпой в реальном времени или сложных задач оценки позы, где особенно важна структурная целостность сети.
Другие модели, которые стоит рассмотреть#
В зависимости от твоих задач может быть полезно сравнить эти архитектуры с YOLO11, которая отличается гибкостью для широкого спектра производственных сценариев, или с RT-DETR, если проекту нужны особые преимущества визуальных Transformer по сравнению с традиционными свёрточными сетями.
Заключение#
PP-YOLOE+ и YOLOv7 значительно продвинули обнаружение объектов в реальном времени. PP-YOLOE+ отлично подходит для сред, стандартизированных на PaddlePaddle, а YOLOv7 предлагает высокую гибкость и производительность благодаря экосистеме PyTorch.
Однако по мере развития решений для компьютерного зрения важно использовать современные инструменты. Используя платформу Ultralytics и архитектуры нового поколения, такие как YOLO26, разработчики могут поддерживать свои приложения на переднем крае по скорости, точности и простоте использования.