YOLO Vision 2026:

YOLOv10 и YOLOv9#

Эволюция компьютерного зрения в реальном времени отмечена непрерывными прорывами в скорости, точности и архитектурной эффективности. При оценке современных решений для следующего развертывания сравнение YOLOv10 и YOLOv9 позволяет получить интересное представление о двух различных подходах к решению узких мест глубокого обучения. В то время как YOLOv9 сосредоточена на максимизации потока градиентов во время обучения, YOLOv10 первой внедрила нативную сквозную архитектуру, полностью устраняющую традиционные препятствия постобработки.

В этом подробном руководстве анализируются архитектурные инновации, показатели производительности и оптимальные сценарии использования этих моделей, чтобы помочь разработчикам и исследователям выбрать оптимальную модель для конкретных задач компьютерного зрения.

YOLOv10: первопроходец сквозной архитектуры без NMS#

Разработанная для устранения узких мест по задержке в традиционных детекторах объектов, YOLOv10 представляет революционную сквозную архитектуру, которая нативно избавляет от необходимости в подавлении немаксимумов (NMS).

Технические детали и происхождение:

Подробнее о YOLOv10

Архитектура и преимущества#

Самый значительный вклад YOLOv10 в эту область — согласованная стратегия двойного назначения для обучения без NMS. Устранение NMS значительно снижает задержку вывода, особенно на периферийных устройствах, где постобработка может стать узким местом всего конвейера. Модель оптимизирует различные компоненты с точки зрения как эффективности, так и точности, обеспечивая впечатляющий компромисс между скоростью и количеством параметров. Например, вариант YOLOv10-S исключительно быстр, что делает его особенно подходящим для видеоаналитики на высокой скорости и навигации роботов в реальном времени.

Недостатки#

Несмотря на то что дизайн без NMS стал прорывом для обнаружения ограничивающих рамок, YOLOv10 в первую очередь оптимизирована как специализированный детектор объектов. Ей не хватает универсальности новых экосистем, которые изначально поддерживают сегментацию экземпляров или оценку позы. Кроме того, ранние реализации требовали тщательной обработки экспорта, чтобы такие операции, как cv2, были полностью оптимизированы и удалены из графа вывода.

Экспорт YOLOv10

При подготовке YOLOv10 к промышленной эксплуатации всегда экспортируй модель в оптимизированные форматы, такие как TensorRT или ONNX. Использование исходных весов PyTorch при развертывании может привести к более медленному, чем ожидалось, выводу из-за неоптимизированных операций графа.

YOLOv9: программируемая информация о градиентах#

До появления YOLOv10 модель YOLOv9 представила новые архитектурные концепции для решения проблемы информационного узкого места, свойственной глубоким нейронным сетям, что позволило чрезвычайно эффективно использовать параметры.

Технические детали и происхождение:

Узнай больше о YOLOv9

Архитектура и преимущества#

YOLOv9 представляет программируемую информацию о градиентах (PGI) вместе с обобщённой сетью эффективной агрегации слоёв (GELAN). PGI гарантирует, что важная информация о целях не теряется по мере прохождения данных через глубокие слои сети, обеспечивая надёжные градиенты для обновления весов. GELAN максимизирует эффективность параметров сети. Вместе эти инновации позволяют YOLOv9 достигать исключительно высокой средней точности (mAP) на датасете MS COCO, часто превосходя более тяжёлые модели при использовании меньшего количества FLOPs. Это выдающаяся модель для исследователей, сосредоточенных на максимизации теоретических показателей точности.

Недостатки#

Несмотря на высокую точность, YOLOv9 по-прежнему использует стандартную постобработку NMS. Это означает, что хотя операции нейронной сети выполняются быстро, финальная фильтрация ограничивающих рамок может приводить к переменной задержке в зависимости от плотности объектов в сцене. Кроме того, процесс обучения этой модели может требовать значительно больше памяти по сравнению с более поздними моделями, что предполагает наличие более мощных ресурсов GPU для дообучения на пользовательских датасетах.

Сравнение производительности#

В таблице ниже представлены основные показатели обеих моделей. Обрати внимание, что YOLOv10 обычно обеспечивает меньшую задержку через TensorRT, тогда как YOLOv9 приближается к верхним пределам точности в своей самой крупной конфигурации.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

Следующее поколение: почему YOLO26 — лучшая рекомендация#

Хотя YOLOv9 и YOLOv10 стали впечатляющими вехами, ландшафт машинного обучения быстро меняется. В современных производственных средах разработчики всё чаще полагаются на интегрированную экосистему Ultralytics Platform с активной поддержкой. По состоянию на 2026 год очевидная рекомендация как для исследований, так и для бизнеса — недавно выпущенная YOLO26.

YOLO26 развивает фундаментальные концепции предшественников благодаря упрощённому пользовательскому интерфейсу, простому API и значительно меньшим требованиям к памяти во время обучения по сравнению с громоздкими архитектурами на основе Transformer.

Ключевые инновации YOLO26#

  • Сквозной дизайн без NMS: Развивая достижения YOLOv10, YOLO26 изначально построена как сквозная модель и полностью устраняет постобработку NMS, обеспечивая более простое развертывание и высокодетерминированные профили задержки.
  • До 43% более быстрый вывод на CPU: Оптимизирована для периферийного ИИ сразу после установки, что делает её идеальным выбором для встраиваемых систем без выделенных GPU.
  • Оптимизатор MuSGD: Революционная комбинация SGD и Muon, вдохновлённая оптимизациями для больших языковых моделей, которая обеспечивает стабильный процесс обучения и исключительно быструю сходимость.
  • Удаление DFL: Удаление распределённой фокальной функции потерь упрощает процесс экспорта модели, значительно повышая совместимость со слабыми устройствами и различными фреймворками периферийного развертывания.
  • Улучшения для конкретных задач: В отличие от специализированных детекторов для одной задачи, YOLO26 — универсальная мощная модель. Она использует функцию потерь семантической сегментации для повышения точности на уровне пикселей, оценку остаточного логарифма правдоподобия (RLE) для безупречной оценки позы и специализированную функцию потерь угла для устранения проблем с границами OBB (ориентированной ограничивающей рамки).
Преимущества экосистемы Ultralytics

Выбор модели Ultralytics, такой как YOLO11 или YOLO26, обеспечивает непревзойдённое удобство использования. Ты получаешь доступ к активной разработке, процветающему сообществу и частым обновлениям, благодаря которым твои модели остаются совместимыми с новейшими движками вывода, такими как OpenVINO и CoreML.

Практическая реализация#

Обучать и развёртывать эти модели с использованием Python SDK просто. В следующем примере показано, как использовать высокоэффективные процессы обучения экосистемы Ultralytics, которая автоматически управляет планированием гиперпараметров и оптимальным распределением памяти.

from ultralytics import YOLO

# Load the recommended state-of-the-art model
model = YOLO("yolo26n.pt")  # Also compatible with 'yolov10n.pt' or 'yolov9c.pt'

# Train the model efficiently on a custom dataset
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0, batch=16)

# Run ultra-fast inference
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for simplified edge deployment
model.export(format="onnx")

Варианты применения и рекомендации#

Выбор между YOLOv10 и YOLOv9 зависит от конкретных требований проекта, ограничений развертывания и предпочтений в отношении экосистемы.

Когда выбирать YOLOv10#

YOLOv10 — подходящий выбор для:

  • Обнаружения объектов в реальном времени без NMS: приложений, которым полезно сквозное обнаружение без подавления немаксимумов, что снижает сложность развертывания.
  • Сбалансированного соотношения скорости и точности: проектов, требующих удачного баланса между скоростью инференса и точностью обнаружения для моделей разных размеров.
  • Приложений со стабильной задержкой: сценариев развертывания, где критически важны предсказуемые времена инференса, например в робототехнике или автономных системах.

Когда стоит выбрать YOLOv9#

YOLOv9 рекомендуется для:

  • Исследований информационного узкого места: академических проектов, изучающих архитектуры Programmable Gradient Information (PGI) и Generalized Efficient Layer Aggregation Network (GELAN).
  • Исследований оптимизации потока градиентов: работ, посвященных пониманию и устранению потери информации в слоях глубоких сетей во время обучения.
  • Сравнительного тестирования обнаружения с высокой точностью: сценариев, где высокие результаты YOLOv9 на тесте COCO нужны как эталон для архитектурных сравнений.

Когда выбирать Ultralytics (YOLO26)#

Для большинства новых проектов Ultralytics YOLO26 предлагает лучшее сочетание производительности и удобства для разработчиков:

  • Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
  • Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
  • Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.

Заключение#

И YOLOv9, и YOLOv10 обладают уникальными преимуществами. YOLOv9 демонстрирует максимальную эффективность использования параметров сети и теоретического потока градиентов, обеспечивая точность высшего уровня. В то же время YOLOv10 стала академическим первопроходцем в сквозном обнаружении ограничивающих рамок без штрафа по задержке, связанного с NMS.

Однако разработчикам, которые ищут идеальный баланс производительности, универсальности и удобства использования, крайне важно перейти на новейшие модели. Благодаря усовершенствованному оптимизатору MuSGD, функциональности ProgLoss + STAL для превосходного обнаружения небольших объектов и комплексной поддержке нескольких задач YOLO26 представляет собой безусловное передовое решение для любых реальных задач компьютерного зрения.

Участники

Комментарии