YOLO11 и YOLOv7#
Сфера компьютерного зрения продолжает стремительно развиваться, а обнаружение объектов в реальном времени остается одним из ключевых направлений применения ИИ. Выбор подходящей архитектуры для проекта требует найти сложный баланс между скоростью, точностью и простотой развертывания. В этом руководстве мы подробно сравним две известные архитектуры: Ultralytics YOLO11 и YOLOv7.
Общие сведения о моделях и технические детали#
Обе модели оказали значительное влияние на сообщество глубокого обучения, но были созданы в рамках разных философий разработки и в разные эпохи.
Сведения о YOLO11:
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Документация: https://docs.ultralytics.com/models/yolo11
Подробности о YOLOv7:
- Авторы: Chien-Yao Wang, Alexey Bochkovskiy и Hong-Yuan Mark Liao
- Организация: Институт информационных наук, Academia Sinica, Тайвань
- Дата: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: https://github.com/WongKinYiu/yolov7
- Документация: https://docs.ultralytics.com/models/yolov7
Архитектурные различия#
При анализе внутренних механизмов видно, что оба детектора используют передовые концепции, однако их структурные основы различаются.
В YOLOv7 была представлена концепция сетей расширенной эффективной агрегации слоев (E-ELAN). Эта архитектура разработана для постоянного повышения способности сети к обучению без разрушения исходного градиентного пути — это важный прорыв, описанный в их научной статье. YOLOv7 активно использует структурную репараметризацию и надежную методологию «набора бесплатных улучшений» во время обучения, повышая общую точность на наборе данных COCO без увеличения затрат на инференс.
В отличие от нее, YOLO11 построена на высокооптимизированной архитектуре Ultralytics. В ней используется более совершенный конвейер извлечения признаков с меньшим количеством параметров, что снижает потребление памяти во время обучения. YOLO11 обеспечивает исключительно удачный баланс производительности, используя меньше вычислительных ресурсов (FLOPs) и одновременно не уступая более тяжелым моделям или превосходя их по точности обнаружения. Кроме того, YOLO11 изначально поддерживает более широкий спектр задач, что делает ее универсальным выбором для современных приложений компьютерного зрения.
Одно из заметных преимуществ моделей Ultralytics YOLO — меньшее потребление памяти во время обучения по сравнению с другими передовыми моделями, благодаря чему разработчики могут обучать мощные сети на оборудовании потребительского класса с PyTorch.
Сравнение производительности и метрик#
Чтобы точно оценить пригодность для реального применения, необходимо изучить такие метрики, как средняя точность (mAP), скорость инференса, количество параметров модели и вычислительная сложность (FLOPs). В таблице ниже показано сравнение масштабируемых вариантов YOLO11 с более крупными моделями YOLOv7.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Как видно, такая модель, как YOLO11x, достигает более высокого показателя 54.7 mAP по сравнению с 53.1 mAP у YOLOv7x, используя при этом значительно меньше параметров (56.9M против 71.3M). Это демонстрирует превосходную архитектурную эффективность YOLO11.
Эффективность обучения и удобство экосистемы#
Одно из ключевых различий между этими двумя архитектурами заключается в удобстве работы разработчика и окружающей экосистеме.
YOLOv7 — это прежде всего репозиторий академического исследования. Обучение моделей часто требует сложной настройки окружения, ручного управления зависимостями и использования длинных аргументов командной строки. Хотя модель поддерживает передовые эксперименты, адаптация кода репозитория YOLOv7 на GitHub для пользовательских производственных окружений может занять много времени.
YOLO11 полностью переосмысливает удобство использования. Она полностью интегрирована в платформу Ultralytics — комплексную и хорошо поддерживаемую экосистему, предлагающую удобные сквозные рабочие процессы. От разметки данных и локального обучения до развертывания — единый API Python и простой интерфейс командной строки упрощают весь процесс.
Сравнение кода#
Для обучения модели обнаружения объектов с YOLO11 требуется всего несколько строк кода, что значительно снижает порог входа:
from ultralytics import YOLO
# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model effortlessly using the unified API
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Quickly export to ONNX format
model.export(format="onnx")Для сравнения, типичная команда обучения YOLOv7 выглядит так и требует тщательной настройки путей, конфигурационных файлов и bash-скриптов:
python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'YOLO11 также отличается огромной универсальностью. Если для поддержки задач, выходящих за рамки обнаружения (например, оценки позы или сегментации), YOLOv7 требует полностью других кодовых баз или значительных модификаций, то YOLO11 решает задачи обнаружения объектов, сегментации экземпляров, классификации изображений, оценки позы и обнаружения ориентированных ограничивающих прямоугольников (OBB) в рамках единой цельной платформы.
Применение в реальных условиях и оптимальные сценарии использования#
Выбор между YOLOv7 и YOLO11 полностью зависит от масштаба проекта и ограничений развертывания.
Когда стоит рассмотреть YOLOv7:
- Сравнение устаревших моделей: академические исследователи, изучающие конструкции градиентных путей, могут использовать YOLOv7 в качестве базовой модели для оценки новых сверточных нейронных сетей.
- Существующие пользовательские конвейеры: команды с сильно кастомизированными конвейерами на C++ или CUDA, специально созданными вокруг уникальной логики декодирования ограничивающих прямоугольников YOLOv7.
Когда стоит выбрать YOLO11:
- Коммерческое производство: приложения для умной розничной торговли или диагностики в здравоохранении значительно выигрывают от поддерживаемой кодовой базы и высокой стабильности YOLO11.
- Среды с ограниченными ресурсами: компактность YOLO11n делает ее особенно подходящей для развертывания на мобильных и периферийных устройствах через ONNX.
- Мультитасковые проекты: если одному приложению нужно распознать человека, восстановить его скелет (позу) и сегментировать удерживаемый им объект, YOLO11 предоставляет единое решение.
Передовые технологии: переход к YOLO26#
Хотя YOLO11 остается исключительно надежным выбором, инновации в области искусственного интеллекта не прекращаются. Инженерам, начинающим новые проекты сегодня, настоятельно рекомендуется изучить Ultralytics YOLO26.
Выпущенная в январе 2026 года, YOLO26 представляет сквозную архитектуру без NMS, полностью устраняя узкие места по задержке, связанные с постобработкой подавления немаксимумов (NMS). Кроме того, YOLO26 использует революционный оптимизатор MuSGD, созданный под влиянием методик обучения LLM, чтобы обеспечить более быструю сходимость. Благодаря целевым улучшениям функции потерь с помощью ProgLoss + STAL и ускорению инференса на CPU до 43% за счет удаления DFL, YOLO26 специально оптимизирована для периферийных вычислений и представляет собой современную вершину развития ИИ для компьютерного зрения.
Пользователям, заинтересованным в специализированных альтернативных структурах, также стоит изучить основанные на Transformer модели RT-DETR или динамические модели с открытым словарем YOLO-World, которые могут дать хорошие результаты при различных развертываниях систем компьютерного зрения.