YOLO11 и YOLOv6-3.0#
Область компьютерного зрения стремительно развивается, и выбор подходящей архитектуры модели — критически важное решение для специалистов по машинному обучению. Двумя значимыми вехами в развитии обнаружения объектов в реальном времени стали YOLO11 и YOLOv6-3.0. Хотя обе модели обладают впечатляющими возможностями для извлечения информации из визуальных данных, они создавались с разными основными целями и на основе разных принципов проектирования.
В этом руководстве представлен подробный технический анализ их архитектур, показателей производительности и оптимальных сценариев развертывания, который поможет тебе принять взвешенное решение для следующего проекта в области ИИ.
Обзор моделей#
Прежде чем перейти к техническим бенчмаркам, полезно разобраться в происхождении и основных особенностях каждой модели.
Ultralytics YOLO11#
Разработанная непосредственно в экосистеме Ultralytics, YOLO11 создана для удобной сквозной разработки. Она ориентирована не только на максимальную скорость, но и на универсальность в решении различных задач, простоту использования и интеграцию с современными конвейерами развертывания.
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2024-09-27
- GitHub: Репозиторий Ultralytics
- Документация: Документация по YOLO11
Meituan YOLOv6-3.0#
YOLOv6-3.0 специально адаптирована для промышленных приложений, где доступны выделенные графические процессоры (GPUs). Она активно оптимизируется для развертывания с использованием TensorRT, уделяя основное внимание максимальной пропускной способности в контролируемых средах.
- Авторы: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu и Xiangxiang Chu
- Организация: Meituan
- Дата: 2023-01-13
- Arxiv: 2301.05586
- GitHub: репозиторий Meituan YOLOv6
- Документация: документация YOLOv6
Архитектурные различия#
Архитектура лежит в основе того, как модель обучается и масштабируется. Оба фреймворка предлагают уникальные улучшения классической формулы YOLO.
YOLO11 опирается на многолетние исследования и предлагает архитектуру с исключительно эффективным использованием параметров. Она включает усовершенствованный backbone и обобщенную head, способную решать разнообразные задачи компьютерного зрения — например, сегментацию экземпляров и оценку позы, — без масштабной перестройки структуры. Кроме того, YOLO11 требует исключительно мало памяти CUDA во время обучения, что выгодно отличает ее от более громоздких моделей Transformer, таких как RT-DETR.
В свою очередь, YOLOv6-3.0 использует модуль двунаправленной конкатенации (BiC) и стратегию обучения с поддержкой anchor-боксов (AAT). Эти механизмы предназначены для повышения точности локализации. Архитектура в основном разделена на независимые компоненты и активно квантуется для поддержки вывода модели в формате INT8, что делает ее сильным кандидатом для высокоскоростных производственных линий на базе устаревших стеков GPU.
Если твоему проекту нужны быстрое прототипирование, поддержка различных задач (например, сегментации или классификации) и развертывание на разном оборудовании (CPU, Edge TPU, Mobile), фреймворк Ultralytics обеспечит значительно более удобный процесс разработки.
Производительность и метрики#
При оценке моделей решающее значение имеют средняя точность (mAP) и скорость вывода. В следующей таблице сравнивается производительность YOLO11 и YOLOv6-3.0 для моделей разных масштабов. Лучшие показатели выделены жирным шрифтом.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
Как показано, YOLO11 стабильно достигает более высокой точности (mAP), используя значительно меньше параметров и FLOPs на сопоставимых уровнях. Такая эффективность по числу параметров напрямую приводит к снижению требований к памяти как во время обучения модели, так и при выводе.
Преимущества Ultralytics#
Выбор модели — это не только сравнение отдельных показателей, но и оценка всего жизненного цикла машинного обучения. Модели Ultralytics дают разработчикам и исследователям заметное преимущество.
- Простота использования: API Ultralytics для Python позволяет обучать, проверять и экспортировать модели всего несколькими строками кода. Тебе не придется вручную настраивать сложные деревья зависимостей.
- Хорошо поддерживаемая экосистема: Ultralytics предоставляет единую экосистему, которая регулярно обновляется. Используя Ultralytics Platform, разработчики получают доступ к совместной разметке наборов данных, облачному обучению и удобному мониторингу моделей.
- Универсальность: В отличие от YOLOv6-3.0, которая в основном является детектором ограничивающих рамок, YOLO11 изначально поддерживает классификацию изображений и ориентированные ограничивающие рамки (OBB), позволяя объединить технологический стек.
- Эффективность обучения: Благодаря современным оптимизациям и автоматическому формированию батчей YOLO11 эффективно обучается на оборудовании потребительского класса, делая передовые технологии ИИ для компьютерного зрения доступнее.
Пример кода: обучение и вывод#
Работать с моделями Ultralytics очень просто. Ниже приведен полностью работоспособный пример, демонстрирующий обучение и выполнение вывода с использованием пакета Ultralytics.
from ultralytics import YOLO
# Load a pre-trained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model efficiently on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run inference on an image from the web
prediction = model("https://ultralytics.com/images/bus.jpg")
# Export the model to ONNX format for easy deployment
model.export(format="onnx")Идеальные сценарии использования#
Понимание сильных сторон каждой модели поможет тебе выбрать подходящий инструмент для конкретной задачи.
Когда выбирать YOLOv6-3.0: Если ты поддерживаешь устаревшую промышленную систему, специально построенную на конкретных конвейерах TensorRT 7.x/8.x, а все оборудование состоит из выделенных GPU NVIDIA T4 или A100 для высокоскоростной автоматизации производства, YOLOv6 остается жизнеспособным и функциональным решением.
Когда выбирать YOLO11: Для почти всех современных приложений YOLO11 — лучший выбор. Будь то разработка решений для умного производства, развертывание ИИ на периферии на устройствах Raspberry Pi или выполнение задач, включающих обнаружение и сегментацию медицинских изображений, YOLO11 обеспечивает оптимальный баланс скорости, точности и гибкости развертывания.
Взгляд в будущее: передовая YOLO26#
Хотя YOLO11 представляет собой огромный шаг вперед, Ultralytics продолжает расширять границы компьютерного зрения. Выпущенная в январе 2026 года новая серия моделей YOLO26 является абсолютным лидером по уровню технологий и рекомендованной моделью для всех новых проектов.
YOLO26 представляет несколько революционных возможностей, специально разработанных для современных задач развертывания:
- Сквозная архитектура без NMS: Развивая концепции, впервые примененные в YOLOv10, YOLO26 изначально построена как сквозная модель. Она полностью устраняет постобработку подавления немаксимумов (NMS), что приводит к более быстрым и значительно более простым конвейерам развертывания.
- Удаление DFL: Благодаря удалению Distribution Focal Loss YOLO26 упрощает head сети, значительно повышая совместимость с маломощными устройствами Интернета вещей (IoT) и периферийными устройствами.
- Оптимизатор MuSGD: Вдохновленная инновациями в обучении больших языковых моделей (LLM), например Kimi K2 от Moonshot AI, YOLO26 использует гибридный оптимизатор Muon-SGD, обеспечивающий непревзойденную стабильность обучения и более быструю сходимость.
- До 43% более быстрый вывод на CPU: Для приложений, работающих без выделенных GPU-ускорителей, YOLO26 существенно оптимизирована для максимальной пропускной способности CPU.
- ProgLoss + STAL: Эти усовершенствованные функции потерь заметно повышают качество распознавания небольших объектов, что критически важно для съемки с дронов и воздушного наблюдения.
- Улучшения для конкретных задач: YOLO26 включает специализированные улучшения для всех задач, такие как многомасштабное прототипирование для сегментации и оценка остаточного логарифмического правдоподобия (RLE) для оценки позы.
Если ты начинаешь новый проект в области компьютерного зрения сегодня, обучение модели YOLO26 с помощью Ultralytics Platform позволит построить приложение на самой эффективной, точной и рассчитанной на будущее архитектуре из доступных.
Разработчики, заинтересованные в обнаружении объектов с открытым словарем, также могут ознакомиться с нашей документацией по YOLO-World.