YOLOv10 против YOLO26#
В последние годы ландшафт компьютерного зрения претерпел значительные изменения: переход от сложных архитектур с тяжелой постобработкой к оптимизированным моделям полного цикла (end-to-end). Этот технический обзор посвящен двум важным этапам развития: академическому прорыву YOLOv10 и передовой, готовой к промышленному внедрению модели YOLO26. Изучив их архитектуры, методологии обучения и возможности развертывания в реальных условиях, ты сможешь принять взвешенное решение при создании своего следующего приложения в области ИИ для машинного зрения.
YOLOv10: Пионер в области end-to-end детекции объектов#
Авторы: Ao Wang, Hui Chen, Lihao Liu и др.
Организация: Tsinghua University
Дата: 2024-05-23
Ссылки: arXiv Paper | GitHub Repository
Выпущенная в середине 2024 года, модель YOLOv10 стала значительным шагом вперед в академических исследованиях компьютерного зрения, решив одну из самых упорных проблем в детекции объектов в реальном времени: Non-Maximum Suppression (NMS). Традиционные детекторы сильно зависели от NMS для фильтрации избыточных ограничивающих рамок, что добавляло переменную задержку во время инференса и усложняло развертывание на периферийных устройствах.
Команда из Университета Цинхуа представила стратегию согласованного двойного назначения для обучения без использования NMS. Это позволило модели точно предсказывать ограничивающие рамки без этапа постобработки, что напрямую улучшило задержку инференса и снизило порог входа для развертывания на аппаратных ускорителях. Несмотря на высокую эффективность для стандартных задач детекции, модель была сфокусирована преимущественно на предсказании рамок и не имела встроенной поддержки более сложных задач, таких как сегментация экземпляров или оценка позы.
YOLO26: Новый стандарт для Edge и Cloud Vision AI#
Авторы: Glenn Jocher и Jing Qiu
Организация: Ultralytics
Дата: 2026-01-14
Ссылки: Репозиторий на GitHub | Платформа Ultralytics
Опираясь на концепции работы без NMS, представленные ранее, недавно выпущенная YOLO26 олицетворяет вершину производительности и универсальности. Разработанная как для академических исследований, так и для промышленного применения, она обладает встроенным end-to-end дизайном без NMS, полностью исключая постобработку для более быстрого и простого развертывания на всех поддерживаемых аппаратных платформах.
YOLO26 предлагает ряд революционных архитектурных улучшений. Удаление Distribution Focal Loss (DFL) значительно упрощает процесс экспорта модели и повышает совместимость с маломощными периферийными устройствами. В сочетании с этими структурными изменениями YOLO26 обеспечивает до 43% более быстрый CPU-инференс, что делает её отличным выбором для IoT и робототехники, где GPU-ускорение может быть недоступно.
Более того, стабильность обучения и скорость сходимости были радикально улучшены благодаря использованию MuSGD Optimizer, гибрида SGD и Muon, вдохновленного методами обучения LLM. В сочетании с продвинутыми функциями потерь, такими как ProgLoss + STAL, YOLO26 демонстрирует заметные улучшения в распознавании мелких объектов. Она также включает специфические улучшения для разных задач, включая многомасштабное прототипирование для сегментации, Residual Log-Likelihood Estimation (RLE) для оценки позы и специализированную функцию потерь по углу для решения проблем с границами в детекции ориентированных ограничивающих рамок (OBB).
Для команд, стремящихся масштабировать свои рабочие процессы компьютерного зрения, Ultralytics Platform обеспечивает полную интеграцию с YOLO26, предлагая интуитивно понятную разметку данных, автоматизированное облачное обучение и варианты развертывания в один клик без необходимости создания сложной инфраструктуры MLOps.
Сравнение технической производительности#
При оценке этих моделей баланс между точностью, размером модели и скоростью инференса имеет критическое значение. В таблице ниже представлена производительность обеих семейств моделей в различных масштабах, оцененная на стандартном COCO dataset.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
Данные наглядно демонстрируют эволюционное преимущество новой архитектуры. YOLO26 достигает более высокого значения mAP (mean Average Precision) во всех весовых категориях, сохраняя при этом высокую конкурентоспособность по скорости инференса. Удаление DFL в YOLO26 напрямую способствует ее исключительной производительности CPU ONNX — метрике, в которой предыдущие поколения часто испытывали трудности.
Методологии обучения и экосистема#
Модель полезна ровно настолько, насколько хороша поддерживающая ее экосистема. Хотя YOLOv10 представляла собой отличную академическую реализацию на базе PyTorch, для задач, выходящих за рамки базового детектирования, она зачастую требует ручной настройки.
В отличие от нее, YOLO26 полностью интегрирована в хорошо поддерживаемую экосистему Ultralytics. Это гарантирует существенно меньшие требования к памяти в процессе обучения по сравнению с моделями на основе трансформеров, такими как RT-DETR, позволяя исследователям обучать современные сети на оборудовании потребительского уровня. Простота использования не имеет аналогов и предлагает единый API, который автоматически управляет аугментацией данных, подбором гиперпараметров и логированием.
Пример кода: Обучение YOLO26#
Для обучения универсальной и высокоточной модели требуется всего несколько строк кода на Python:
from ultralytics import YOLO
# Load the highly optimized YOLO26 small model
model = YOLO("yolo26s.pt")
# Train the model efficiently with automatic memory management
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
)
# Export natively to TensorRT without NMS complexities
model.export(format="engine")Реальные применения и варианты использования#
Выбор правильной архитектуры полностью зависит от ограничений при развертывании.
Высокоскоростные периферийные вычисления#
Для приложений, требующих быстрого развертывания на микроконтроллерах, в робототехнике или на старых мобильных устройствах, увеличение скорости CPU-инференса YOLO26 на 43% делает ее безальтернативным выбором. Ее архитектура без NMS и без DFL легко конвертируется в такие форматы, как OpenVINO и TensorRT, что идеально подходит для видеоаналитики в реальном времени в инфраструктуре умного города.
Продвинутое компьютерное зрение для многозадачных систем#
Хотя YOLOv10 превосходна в задаче чистого детектирования ограничивающих прямоугольников (bounding boxes), проекты, требующие глубокого визуального понимания, должны опираться на YOLO26. От instance segmentation в медицинской визуализации до прецизионной pose estimation в спортивной аналитике — YOLO26 предоставляет специализированные функции потерь, гарантирующие превосходную точность в самых разных областях.
Если твоему проекту требуется надежное детектирование по открытому словарю (open-vocabulary detection), рассмотри возможность использования YOLO-World. Для пользователей, поддерживающих устаревшие пайплайны, YOLO11 остается полностью поддерживаемой и мощной альтернативой в рамках фреймворка Ultralytics.
Сценарии использования и рекомендации#
Выбор между YOLOv10 и YOLO26 зависит от твоих конкретных требований к проекту, ограничений развертывания и предпочтений в выборе экосистемы.
Когда стоит выбрать YOLOv10#
YOLOv10 — отличный выбор для:
- Детекции в реальном времени без NMS: Приложения, которым полезна сквозная (end-to-end) детекция без использования Non-Maximum Suppression, что снижает сложность развертывания.
- Сбалансированного соотношения скорости и точности: Проекты, требующие оптимального баланса между скоростью вывода и точностью детекции для различных масштабов моделей.
- Приложения с постоянной задержкой: Сценарии развертывания, где предсказуемое время вывода критически важно, например, в robotics или автономных системах.
Когда стоит выбрать YOLO26#
YOLO26 рекомендуется для:
- Развертывания на периферии без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложности постобработки подавления немаксимумов.
- Среды только с CPU: устройств без выделенного GPU-ускорения, где до 43% более быстрый вывод на CPU у YOLO26 дает решающее преимущество.
- Обнаружение малых объектов: Сложные сценарии, такие как aerial drone imagery или анализ с помощью IoT-сенсоров, где ProgLoss и STAL значительно повышают точность для крошечных объектов.
Заключение#
Переход от YOLOv10 к YOLO26 подчеркивает важный сдвиг от академического подтверждения концепции к готовым к производству корпоративным решениям. Используя новаторский дизайн без NMS и дополняя его оптимизатором MuSGD, ProgLoss и улучшенной совместимостью с периферийными устройствами, YOLO26 устанавливает новый стандарт того, что возможно в компьютерном зрении в реальном времени. Для разработчиков, стремящихся достичь наилучшего баланса скорости, точности и удобства использования, YOLO26 является главной рекомендацией.