YOLO11 против YOLOv7#
Сфера computer vision продолжает стремительно развиваться, причем обнаружение объектов в реальном времени остается на переднем крае приложений искусственного интеллекта. Выбор правильной архитектуры для твоего проекта требует поиска сложного компромисса между скоростью, точностью и простотой развертывания. В этом руководстве мы предлагаем подробное техническое сравнение двух выдающихся архитектур: Ultralytics YOLO11 и YOLOv7.
История моделей и технические детали#
Обе модели оказали значительное влияние на сообщество глубокого обучения, но они основаны на разных философиях разработки и появились в разные эпохи.
Детали YOLO11:
Авторы: Гленн Джочер (Glenn Jocher) и Цзин Цю (Jing Qiu)
Организация: Ultralytics
Дата: 2024-09-27
GitHub: https://github.com/ultralytics/ultralytics
Документация: https://docs.ultralytics.com/models/yolo11/
Детали YOLOv7:
Авторы: Чиен-Яо Ван (Chien-Yao Wang), Алексей Бочковский и Хун-Юань Марк Ляо (Hong-Yuan Mark Liao)
Организация: Institute of Information Science, Academia Sinica, Taiwan
Дата: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: https://github.com/WongKinYiu/yolov7
Документация: https://docs.ultralytics.com/models/yolov7/
Архитектурные различия#
При анализе внутренних механизмов видно, что оба детектора используют передовые концепции, однако их структурные основы различаются.
В YOLOv7 была представлена концепция расширенных сетей агрегации эффективных слоев (Extended Efficient Layer Aggregation Networks, E-ELAN). Эта архитектура была разработана для непрерывного повышения обучаемости сети без разрушения исходного пути градиентов — важнейший прорыв, описанный в их исследовательской работе. YOLOv7 в значительной степени опирается на структурную репараметризацию и надежную методологию «набора бесплатных бонусов» (bag-of-freebies) во время обучения, повышая общую точность на наборе данных COCO без увеличения затрат на вывод.
В отличие от нее, YOLO11 построена на базе высокооптимизированной архитектуры Ultralytics. Она делает акцент на более усовершенствованном конвейере извлечения признаков с меньшим количеством параметров, что приводит к снижению потребления памяти при обучении. YOLO11 достигает исключительно благоприятного баланса производительности, задействуя меньше вычислительных ресурсов (FLOPs) при сопоставимой или превосходящей точности обнаружения по сравнению с более тяжелыми моделями. Кроме того, YOLO11 изначально поддерживает более широкое разнообразие задач, что делает ее универсальным выбором для современных приложений компьютерного зрения.
Одной из отличительных особенностей моделей Ultralytics YOLO являются их сниженные требования к памяти в процессе обучения по сравнению с другими современными моделями, что позволяет разработчикам обучать мощные сети на потребительском «железе» PyTorch.
Сравнение производительности и метрик#
Чтобы точно оценить жизнеспособность в реальных условиях, необходимо оценивать такие метрики, как mean Average Precision (mAP), скорость инференса, количество параметров модели и вычислительную сложность (FLOPs). В следующей таблице показано сравнение масштабируемых вариантов YOLO11 с более крупными моделями YOLOv7.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Как видишь, такая модель, как YOLO11x, достигает более высокого результата 54.7 mAP по сравнению с 53.1 mAP у YOLOv7x, при этом используя значительно меньше параметров (56.9M против 71.3M). Это подчеркивает превосходную архитектурную эффективность YOLO11.
Эффективность обучения и удобство экосистемы#
Одной из самых определяющих характеристик, разделяющих эти две архитектуры, является опыт разработчика и окружающая экосистема.
YOLOv7 по своей сути является академическим исследовательским репозиторием. Обучение моделей часто требует сложной настройки окружения, ручного управления зависимостями и использования длинных аргументов командной строки. Хотя она поддерживает передовые эксперименты, адаптация кода репозитория YOLOv7 на GitHub для кастомных продакшн-сред может занять много времени.
YOLO11 полностью переосмысляет простоту использования. Она полностью интегрирована в платформу Ultralytics — комплексную и поддерживаемую экосистему, предлагающую бесшовные сквозные рабочие процессы. От разметки данных и локального обучения до деплоя — единый Python API и простой интерфейс командной строки оптимизируют весь процесс.
Сравнение кода#
Обучение модели обнаружения объектов с помощью YOLO11 требует всего несколько строк кода, что значительно снижает порог входа:
from ultralytics import YOLO
# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model effortlessly using the unified API
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Quickly export to ONNX format
model.export(format="onnx")Для сравнения, типичная команда обучения YOLOv7 выглядит так, требуя тщательной настройки путей, файлов конфигурации и bash-скриптов:
python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'YOLO11 также обеспечивает огромную универсальность. В то время как YOLOv7 требует совершенно иных кодовых баз или серьезных модификаций для поддержки задач за пределами обнаружения (таких как оценка позы или сегментация), YOLO11 справляется с обнаружением объектов, сегментацией экземпляров, классификацией изображений, оценкой позы и обнаружением ориентированных ограничивающих рамки (OBB) с помощью единого связного фреймворка.
Реальные применения и идеальные сценарии использования#
Выбор между YOLOv7 и YOLO11 полностью зависит от масштаба проекта и ограничений при развертывании.
Когда стоит рассмотреть YOLOv7:
- Бенчмаркинг устаревших моделей: Академические исследователи, изучающие проектирование путей градиентов, могут использовать YOLOv7 в качестве отправной точки для оценки более новых сверточных нейронных сетей.
- Существующие кастомные пайплайны: Команды с глубоко кастомизированными пайплайнами на C++ или CUDA, созданными специально под уникальную логику декодирования ограничивающих рамок в YOLOv7.
Когда стоит выбрать YOLO11:
- Коммерческий продакшн: Приложения в сфере умного ритейла или диагностики в здравоохранении получают огромную выгоду от поддерживаемой кодовой базы и высокой стабильности YOLO11.
- Условия с ограниченными ресурсами: Легковесный вес модели YOLO11n делает ее исключительно подходящей для развертывания на мобильных и периферийных (edge) устройствах с помощью ONNX.
- Многозадачные проекты: Если одному приложению нужно идентифицировать человека, сопоставить его скелет (pose) и сегментировать объект, который он держит, YOLO11 предоставляет единое решение.
Передовой край: Движение вперед с YOLO26#
Хотя YOLO11 выступает в роли исключительно надежного выбора, инновации в области искусственного интеллекта не стоят на месте. Инженерам, начинающим новые проекты сегодня, настоятельно рекомендуется изучить Ultralytics YOLO26.
Выпущенная в январе 2026 года, YOLO26 представляет сквозной дизайн без NMS (NMS-Free), полностью устраняя узкие места задержки, связанные с постобработкой немаксимального подавления. Кроме того, YOLO26 включает революционный оптимизатор MuSGD, вдохновленный методологиями обучения языковых моделей, что обеспечивает более быструю сходимость. Благодаря целевым улучшениям потерь с помощью ProgLoss + STAL и ускорению вывода на CPU до 43% за счет удаления DFL, YOLO26 специально оптимизирована для периферийных вычислений и представляет собой текущую вершину зрения ИИ.
Пользователям, интересующимся специализированными альтернативными структурами, изучение RT-DETR на базе трансформеров или динамических моделей с открытым словарем YOLO-World также может принести полезные результаты для разнообразных внедрений компьютерного зрения.