YOLO11 и YOLOv6-3.0#
Область компьютерного зрения стремительно развивается, и выбор подходящей архитектуры модели — важное решение для специалистов по машинному обучению. YOLO11 и YOLOv6-3.0 — две важные вехи в развитии обнаружения объектов в реальном времени. Обе модели эффективно извлекают полезную информацию из визуальных данных, но создавались с разными основными целями и принципами проектирования.
В этом руководстве подробно анализируются и сравниваются архитектуры, метрики производительности и оптимальные сценарии развертывания моделей, чтобы помочь тебе принять взвешенное решение для следующего проекта в области ИИ.
Обзор моделей#
Прежде чем перейти к техническим бенчмаркам, полезно понять происхождение и основные задачи каждой модели.
Ultralytics YOLO11#
Созданная непосредственно в экосистеме Ultralytics, YOLO11 разработана для обеспечения удобного сквозного процесса разработки. В ней важны не только чистая скорость, но и универсальность для решения множества задач, простота использования и интеграция с современными конвейерами развертывания.
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2024-09-27
- GitHub: Репозиторий Ultralytics
- Документация: Документация YOLO11
Meituan YOLOv6-3.0#
YOLOv6-3.0 специально разработана для промышленных приложений, где доступны выделенные графические процессоры (GPU). Она тщательно оптимизирована для развертывания на TensorRT и максимальной пропускной способности в контролируемых средах.
- Авторы: Чуйи Ли, Лулу Ли, Ифэй Гэн, Хунлян Цзян, Мэн Чэн, Бо Чжан, Зайдань Кэ, Сяомин Сюй и Сянсян Чу
- Организация: Meituan
- Дата: 2023-01-13
- Arxiv: 2301.05586
- GitHub: Репозиторий Meituan YOLOv6
- Документация: Документация YOLOv6
Архитектурные различия#
Архитектура определяет, как модель обучается и масштабируется. В обеих платформах реализованы уникальные улучшения классической формулы YOLO.
YOLO11 развивает многолетние исследования и предлагает архитектуру с исключительно эффективным использованием параметров. В ней используются продвинутый backbone и универсальная голова, способная решать разнообразные задачи компьютерного зрения, например сегментацию экземпляров и оценку позы, без масштабных изменений структуры. Кроме того, YOLO11 требует исключительно мало памяти CUDA во время обучения, что отличает её от более крупных моделей на основе Transformer, таких как RT-DETR.
В свою очередь, в YOLOv6-3.0 используются двунаправленный модуль конкатенации (BiC) и стратегия обучения с поддержкой якорей (AAT). Эти механизмы предназначены для повышения точности локализации. Архитектура преимущественно разделена на компоненты и активно квантизирована для инференса моделей в INT8, что делает её хорошим вариантом для высокоскоростных производственных линий с устаревшими стеками GPU.
Если для проекта нужны быстрое прототипирование, поддержка разных задач (например, сегментации или классификации) и развертывание на различном оборудовании (CPU, Edge TPU, мобильные устройства), платформа Ultralytics обеспечит значительно более удобную работу для разработчика.
Производительность и метрики#
При оценке моделей важнее всего средняя точность (mAP) и скорость инференса. В следующей таблице сравнивается производительность YOLO11 и YOLOv6-3.0 для моделей разных масштабов. Лучшие метрики выделены полужирным.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
Как видно, YOLO11 стабильно обеспечивает более высокую точность (mAP) при значительно меньшем количестве параметров и FLOPs на соответствующих уровнях. Благодаря такой эффективности использования параметров снижается потребность в памяти как при обучении модели, так и при инференсе.
Преимущества Ultralytics#
Выбор модели зависит не только от чистых метрик, но и от всего жизненного цикла машинного обучения. Модели Ultralytics дают явное преимущество и разработчикам, и исследователям.
- Простота использования: API Python Ultralytics позволяет обучать, проверять и экспортировать модели всего несколькими строками кода. Настраивать сложные деревья зависимостей вручную не нужно.
- Хорошо поддерживаемая экосистема: Ultralytics предлагает единую экосистему, которая часто обновляется. Используя платформу Ultralytics, разработчики получают доступ к совместной разметке наборов данных, облачному обучению и удобному мониторингу моделей.
- Универсальность: В отличие от YOLOv6-3.0, которая предназначена главным образом для обнаружения объектов с ограничивающими рамками, YOLO11 изначально поддерживает классификацию изображений и ориентированные ограничивающие рамки (OBB), позволяя объединить технологический стек.
- Эффективность обучения: Благодаря современным оптимизациям и автоматическому формированию пакетов YOLO11 эффективно обучается на потребительском оборудовании, делая передовые технологии компьютерного зрения с ИИ доступнее.
Пример кода: обучение и инференс#
Работать с моделями Ultralytics очень просто. Ниже приведён полностью работоспособный пример обучения и запуска инференса с помощью пакета Ultralytics.
from ultralytics import YOLO
# Загрузка предварительно обученной облегчённой модели YOLO11
model = YOLO("yolo11s.pt")
# Эффективно обучи модель на наборе данных COCO8
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Запусти инференс на изображении из интернета
prediction = model("https://ultralytics.com/images/bus.jpg")
# Экспортируй модель в формат ONNX для простого развертывания
model.export(format="onnx")Оптимальные сценарии применения#
Зная сильные стороны каждой модели, ты сможешь выбрать подходящий инструмент для задачи.
Когда стоит выбрать YOLOv6-3.0: Если ты поддерживаешь устаревшую промышленную систему, построенную специально на конвейерах TensorRT 7.x/8.x, а всё оборудование состоит из выделенных GPU NVIDIA T4 или A100 для высокоскоростной автоматизации производства, YOLOv6 остаётся эффективным и подходящим решением.
Когда стоит выбрать YOLO11: Почти для всех современных приложений YOLO11 — лучший выбор. Разрабатываешь ли ты решения для умного производства, внедряешь ли периферийный ИИ на устройствах Raspberry Pi или решаешь несколько задач, например обнаруживаешь и сегментируешь медицинские изображения, YOLO11 обеспечит оптимальный баланс скорости, точности и гибкости развертывания.
Взгляд в будущее: передовая YOLO26#
YOLO11 — это огромный шаг вперёд, но Ultralytics продолжает расширять возможности компьютерного зрения. Новая серия моделей YOLO26, выпущенная в январе 2026 года, представляет собой самые передовые решения и рекомендуется для всех новых проектов.
YOLO26 предлагает несколько революционных функций, специально разработанных для современных задач развертывания:
- Сквозная архитектура без NMS: Развивая идеи, впервые реализованные в YOLOv10, YOLO26 предлагает встроенную сквозную голову (
nms=False), которая устраняет постобработку с подавлением немаксимумов (NMS), ускоряя и значительно упрощая конвейеры развертывания. - Удаление DFL: Удаление Distribution Focal Loss упрощает голову сети и значительно повышает совместимость YOLO26 с маломощными устройствами Интернета вещей (IoT) и периферийными устройствами.
- Оптимизатор MuSGD: Вдохновлённый инновациями в обучении больших языковых моделей (LLM), например Kimi K2 от Moonshot AI, YOLO26 использует гибридный оптимизатор Muon-SGD, обеспечивая беспрецедентную стабильность обучения и более быструю сходимость.
- Вывод на CPU до 43% быстрее: YOLO26 значительно оптимизирован для максимальной производительности CPU в приложениях, работающих без выделенных GPU-ускорителей.
- ProgLoss + STAL: Эти усовершенствованные функции потерь заметно повышают точность распознавания мелких объектов, что особенно важно для съёмки с дронов и воздушного наблюдения.
- Улучшения для отдельных задач: YOLO26 включает специализированные усовершенствования для всех задач, например многомасштабное прототипирование для сегментации и оценивание остаточного логарифмического правдоподобия (RLE) для оценки позы.
Если ты сегодня начинаешь новый проект в области компьютерного зрения, обучи модель YOLO26 на платформе Ultralytics: так ты заложишь в основу своего приложения самую эффективную, точную и перспективную архитектуру из доступных.
Если ты хочешь изучить обнаружение объектов с открытым словарём, ознакомься также с нашей документацией по YOLO-World.