PP-YOLOE+ и YOLOv7#
При создании конвейеров компьютерного зрения крайне важно выбрать подходящую модель обнаружения объектов. Две значимые архитектуры 2022 года — PP-YOLOE+ и YOLOv7 — привнесли мощные улучшения в обнаружение объектов в реальном времени. В этом техническом сравнении подробно рассматриваются их архитектуры, методики обучения и производительность в реальных условиях, чтобы помочь тебе принимать обоснованные решения для своих приложений.
Обзор моделей#
И PP-YOLOE+, и YOLOv7 создавались для расширения границ точности и скорости, однако они происходят из разных экосистем разработки и основаны на разных принципах проектирования.
PP-YOLOE+#
Разработанная авторами PaddlePaddle из Baidu, модель PP-YOLOE+ основана на оригинальной PP-YOLOv2. Она была представлена как эффективный и высокоточный детектор объектов, оптимизированный для экосистемы PaddlePaddle.
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: 2203.16250
- GitHub: Репозиторий PaddleDetection
- Документация: документация PP-YOLOE+
YOLOv7#
Разработанная Chien-Yao Wang, Alexey Bochkovskiy и Hong-Yuan Mark Liao, модель YOLOv7 представила «обучаемый набор бесплатных преимуществ» и на момент выпуска установила новые лучшие результаты для детекторов объектов реального времени.
- Авторы: Chien-Yao Wang, Alexey Bochkovskiy и Hong-Yuan Mark Liao
- Организация: Институт информационных наук Academia Sinica, Тайвань
- Дата: 2022-07-06
- Arxiv: 2207.02696
- GitHub: Репозиторий YOLOv7
- Документация: Документация Ultralytics YOLOv7
Архитектурные инновации#
Архитектура PP-YOLOE+#
PP-YOLOE+ в значительной степени опирается на безъякорную парадигму, упрощая процесс развертывания за счёт отсутствия необходимости настраивать якорные боксы для пользовательских наборов данных. В модели используются мощная основа RepResNet и PAN в стиле CSPNet (сеть агрегации путей) для эффективного объединения признаков разных масштабов. Кроме того, применяется концепция обучения выравниванию задач (TAL), которая динамически согласует задачи классификации и локализации во время обучения, обеспечивая высокую точность в различных задачах компьютерного зрения.
Архитектура YOLOv7#
YOLOv7 использует другой подход, представляя расширенную сеть агрегации эффективных слоёв (E-ELAN). Эта архитектура позволяет сети изучать более разнообразные признаки, не разрушая исходный путь градиента, что способствует лучшей сходимости. YOLOv7 также активно использует репараметризацию модели, в частности плановые репараметризованные свёртки, которые объединяют слои свёртки во время инференса, ускоряя выполнение без потери точности. Благодаря этому YOLOv7 особенно эффективна в таких задачах, как отслеживание нескольких объектов и сложные системы охранной сигнализации.
Анализ производительности#
При поиске баланса между скоростью, количеством параметров и точностью (mAP) модели показывают разные результаты в зависимости от конкретного варианта и целевого оборудования. Ниже приведено подробное сравнение их метрик.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Модель PP-YOLOE+x достигает немного более высокого значения mAP, однако варианты YOLOv7 демонстрируют очень сильное соотношение количества параметров и точности. Архитектура YOLOv7 остаётся популярным выбором для обработки на GPU, где оптимизация с помощью TensorRT обеспечивает исключительно низкую задержку.
Преимущества Ultralytics#
При обучении и развертывании этих моделей выбранный фреймворк так же важен, как и сама модель. Использование Ultralytics обеспечивает упрощённый пользовательский опыт благодаря унифицированному API на Python, который упрощает весь жизненный цикл машинного обучения.
- Хорошо поддерживаемая экосистема: модели Ultralytics YOLO используют постоянно обновляемую экосистему, подробную документацию и активное сообщество.
- Требования к памяти: Ultralytics активно оптимизирует загрузку данных и режимы обучения. Для обучения моделей Ultralytics YOLO обычно требуется гораздо меньше памяти CUDA по сравнению с тяжёлыми архитектурами на базе Transformer, что позволяет разработчикам использовать большие размеры пакетов на оборудовании потребительского класса.
- Эффективность обучения: благодаря надёжным стратегиям аугментации данных и встроенной настройке гиперпараметров Ultralytics обеспечивает быструю сходимость моделей с использованием готовых предварительно обученных весов.
Простая реализация API#
Обучение модели YOLOv7 с помощью Ultralytics занимает всего несколько строк кода, полностью абстрагируя сложные скрипты обучения:
from ultralytics import YOLO
# Load a pretrained YOLOv7 model
model = YOLO("yolov7.pt")
# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export to TensorRT for deployment
model.export(format="engine", device=0)Новый стандарт: знакомство с YOLO26#
Хотя PP-YOLOE+ и YOLOv7 стали важными этапами в развитии обнаружения объектов, ландшафт AI стремительно меняется. Для любого нового проекта в области компьютерного зрения мы настоятельно рекомендуем Ultralytics YOLO26. Выпущенная в январе 2026 года, YOLO26 представляет собой огромный шаг вперёд в области AI для периферийных устройств.
Почему YOLO26 превосходит более старые архитектуры:
- Сквозная архитектура без NMS: YOLO26 изначально работает по сквозному принципу. За счёт устранения постобработки подавления немаксимумов (NMS) модель обеспечивает предсказуемую детерминированную задержку инференса — прорыв, впервые продемонстрированный в YOLOv10.
- Удаление DFL: удаление Distribution Focal Loss упрощает процесс экспорта и значительно повышает совместимость с периферийными устройствами с низким энергопотреблением.
- До 43% более быстрый инференс на CPU: в сценариях без выделенных GPU, например с IoT-датчиками умного города, YOLO26 тщательно оптимизирована для эффективной работы непосредственно на CPU.
- Оптимизатор MuSGD: вдохновлённая передовыми методами обучения LLM, такими как Kimi K2 от Moonshot AI, YOLO26 использует гибрид SGD и Muon, обеспечивающий исключительно стабильное обучение и быструю сходимость.
- ProgLoss + STAL: эти улучшенные функции потерь обеспечивают заметный прирост качества обнаружения малых объектов, что особенно важно для таких сценариев, как аэрофотосъёмка с дронов и обнаружение производственных дефектов.
Идеальные варианты использования и сценарии развертывания#
Когда использовать PP-YOLOE+#
PP-YOLOE+ особенно хорошо подходит, если ты глубоко работаешь в экосистеме Baidu и PaddlePaddle. Если в целевой среде развертывания используется специализированное оборудование, адаптированное для моделей Paddle, например в некоторых азиатских производственных конвейерах, PP-YOLOE+ обеспечивает отличную точность и бесшовную интеграцию. Модель особенно эффективна для автоматизации промышленного производства.
Когда использовать YOLOv7#
YOLOv7 остаётся отличным выбором для высокопроизводительного инференса общего назначения, особенно при развертывании на оборудовании NVIDIA с использованием TensorRT. Интеграция с экосистемой PyTorch делает модель очень универсальной для академических исследований и пользовательских коммерческих конвейеров, например для управления толпами в реальном времени или сложных задач оценки позы, где принципиально важно сохранить структурную целостность сети.
Другие модели, которые стоит рассмотреть#
В зависимости от твоих конкретных потребностей тебе также может быть интересно сравнить эти архитектуры с YOLO11, обеспечивающей широкую гибкость для готовых к эксплуатации решений, или с RT-DETR, если проект требует особых преимуществ Vision Transformer по сравнению с традиционными свёрточными сетями.
Заключение#
И PP-YOLOE+, и YOLOv7 внесли значительный вклад в развитие обнаружения объектов в реальном времени. PP-YOLOE+ превосходит другие решения в средах, стандартизированных вокруг PaddlePaddle, а YOLOv7 предлагает впечатляющие гибкость и производительность благодаря экосистемам PyTorch и Ultralytics.
Однако по мере развития решений для компьютерного зрения использование современных инструментов становится необходимым. Осваивая Ultralytics Platform и архитектуры нового поколения, такие как YOLO26, разработчики могут поддерживать свои приложения на переднем крае по скорости, точности и удобству использования.