YOLOv7 и PP-YOLOE+#
Выбирая современные модели компьютерного зрения для производственных конвейеров, разработчики часто оценивают преимущества разных архитектур. Среди заметных моделей для обнаружения объектов — YOLOv7 и PP-YOLOE+. В этом руководстве подробно сравниваются их архитектуры, метрики производительности и оптимальные сценарии развертывания, чтобы ты мог принять взвешенное решение для своего следующего проекта в области компьютерного зрения.
Архитектурные инновации#
Чтобы понять, как эти модели будут вести себя при обучении и инференсе, важно разобраться в их ключевых структурных различиях.
Основные особенности архитектуры YOLOv7#
В YOLOv7 появилось несколько ключевых улучшений, призванных повысить точность без существенного увеличения затрат на инференс.
- Расширенные сети эффективной агрегации слоев (E-ELAN): Эта архитектура контролирует кратчайшие и длиннейшие пути градиента. Благодаря этому сеть учится распознавать более разнообразные признаки, а ее общая способность к обучению повышается без нарушения исходного пути градиента.
- Стратегии масштабирования моделей: YOLOv7 использует комплексное масштабирование моделей, одновременно корректируя глубину и ширину и объединяя слои конкатенацией, чтобы сохранять оптимальную структуру архитектуры при разных размерах модели.
- Обучаемый «набор бесплатных приемов»: Авторы встроили метод перепараметризованной свертки (RepConv) без тождественных связей, что значительно повышает скорость инференса, не снижая предсказательную способность модели.
Подробности о YOLOv7:
- Авторы: Chien-Yao Wang, Alexey Bochkovskiy и Hong-Yuan Mark Liao
- Организация: Институт информатики, Academia Sinica, Тайвань
- Дата: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
Основные особенности архитектуры PP-YOLOE+#
Разработанная Baidu в экосистеме PaddlePaddle, PP-YOLOE+ основана на предшественнице PP-YOLOv2 и уделяет особое внимание методам без якорей и улучшенным представлениям признаков.
- Архитектура без якорей: В отличие от подходов с якорями, такая архитектура упрощает голову предсказаний и сокращает число гиперпараметров, облегчая настройку модели для пользовательских наборов данных.
- Бэкбон CSPRepResNet: этот бэкбон использует остаточные связи и сети Cross Stage Partial, чтобы улучшить извлечение признаков и сохранить вычислительную эффективность.
- Обучение выравниванию задач (TAL): PP-YOLOE+ использует ET-head (эффективную голову, согласованную с задачами), чтобы лучше согласовать задачи классификации и локализации, устраняя распространённое узкое место одностадийных детекторов.
Подробности о PP-YOLOE+:
- Авторы: авторы PaddlePaddle
- Организация: Baidu
- Дата: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
Показатели производительности и результаты тестирования#
Выбор подходящей модели часто зависит от конкретных ограничений оборудования и требований к задержке. В таблице ниже показан компромисс между точностью (mAP), скоростью и сложностью модели.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Анализ результатов#
- Сценарии, требующие высокой точности: YOLOv7x показывает высокую производительность и достигает высокого mAP, что делает эту модель конкурентоспособной при решении сложных задач обнаружения. Хотя PP-YOLOE+x обеспечивает немного более высокий mAP, для этого требуется значительно больше параметров и FLOPs.
- Эффективность и скорость: уменьшенные варианты PP-YOLOE+ (t и s) обеспечивают крайне низкую задержку в TensorRT, поэтому хорошо подходят для развёртывания на периферийных устройствах со строгими ограничениями по аппаратным ресурсам.
- Оптимальный баланс: YOLOv7l обеспечивает убедительный баланс: более 51% mAP при времени инференса менее 7 мс на GPU T4. Это надёжный вариант для стандартных серверных приложений реального времени.
Преимущества Ultralytics#
И YOLOv7, и PP-YOLOE+ показывают высокие результаты в бенчмарках, но для успеха проекта не менее важны удобство разработки и поддержка экосистемы.
Удобство работы#
В моделях Ultralytics приоритет отдаётся простоте использования благодаря унифицированному API Python. В отличие от PP-YOLOE+, для которого нужно разбираться в экосистеме PaddlePaddle и её специальных файлах конфигурации, Ultralytics позволяет легко перейти от обучения к развёртыванию.
from ultralytics import YOLO
# Загрузи предварительно обученную модель YOLO26 (пакет Ultralytics не поддерживает обучение YOLOv7)
model = YOLO("yolo26n.pt")
# Обучи модель без лишних усилий
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Экспортируй модель для оптимизированного развёртывания
model.export(format="engine") # Экспорт в TensorRTЭффективное использование ресурсов#
Одно из главных преимуществ моделей Ultralytics YOLO — низкие требования к памяти как при обучении, так и при инференсе. Благодаря такой эффективности исследователи и разработчики могут использовать более крупные размеры пакетов на обычном пользовательском оборудовании и ускорять обучение по сравнению с более тяжёлыми моделями или сложными архитектурами Transformer, такими как RT-DETR.
Экосистема и универсальность#
Экосистема Ultralytics исключительно хорошо поддерживается: она регулярно обновляется, имеет подробную документацию и изначально поддерживает широкий спектр задач, помимо стандартного обнаружения объектов. В Ultralytics единый фреймворк поддерживает сегментацию экземпляров, оценку позы, классификацию и ориентированные ограничивающие рамки (OBB), обеспечивая непревзойдённую универсальность, которой часто не хватает конкурирующим моделям.
Будущее компьютерного зрения: YOLO26#
Компьютерное зрение быстро развивается, и новые архитектуры задают новые стандарты скорости и эффективности. Выпущенная в январе 2026 года Ultralytics YOLO26 стала вершиной этого развития и является настоятельно рекомендуемым выбором для всех новых проектов.
Ключевые новшества YOLO26:
- Сквозная архитектура без NMS: необязательная голова one-to-one в YOLO26 (
nms=False) пропускает этап постобработки Non-Maximum Suppression (NMS). Такой изначально сквозной подход значительно упрощает логику развёртывания и снижает вариативность задержки. Впервые этот прорыв был реализован в YOLOv10. - Непревзойдённая производительность на периферийных устройствах: благодаря удалению Distribution Focal Loss (DFL) YOLO26 обеспечивает до 43% более быстрый инференс на CPU, превосходя предыдущие поколения на IoT- и периферийных устройствах.
- Продвинутая динамика обучения: интеграция оптимизатора MuSGD, вдохновлённого инновациями в области LLM, такими как Kimi K2 от Moonshot AI, обеспечивает более стабильное обучение и быструю сходимость.
- Улучшенное обнаружение мелких объектов: усовершенствованные функции потерь, в частности ProgLoss + STAL, устраняют исторические проблемы распознавания мелких объектов, что важно для таких приложений, как аэрофотосъёмка.
Применение в реальных условиях#
Выбор между этими архитектурами часто зависит от конкретной среды развёртывания.
Когда выбирать PP-YOLOE+#
- Интеграция с PaddlePaddle: если твоя инфраструктура уже тесно интегрирована с экосистемой PaddlePaddle от Baidu, PP-YOLOE+ станет естественным выбором.
- Промышленный контроль в Азии: модель часто используют в азиатских промышленных центрах, где аппаратное и программное обеспечение заранее настроено для работы с инструментами Baidu.
Когда выбирать YOLOv7#
- Системы с ускорением на GPU: модель отлично работает на серверных GPU при решении задач, требующих высокой пропускной способности, например видеоаналитики.
- Интеграция с робототехникой: идеальный выбор для интеграции компьютерного зрения в робототехнику, позволяющий быстро принимать решения в динамичных условиях.
- Академические исследования: модель широко поддерживается и часто используется в исследованиях на PyTorch в качестве надёжной базовой модели.
Хотя старые модели важны с исторической точки зрения, переход на современные архитектуры, такие как YOLO26 или YOLO11, через платформу Ultralytics даёт доступ к новейшим оптимизациям, простым рабочим процессам обучения и самой широкой на сегодня поддержке множества задач.