YOLOv9 и YOLO26#
За последние несколько лет область обнаружения объектов в реальном времени object detection значительно изменилась. Специалисты по машинному обучению развертывают модели на самых разных аппаратных платформах, поэтому выбор подходящей архитектуры имеет решающее значение. В этом подробном техническом руководстве мы сравниваем две важные вехи в области компьютерного зрения: YOLOv9, представленную в начале 2024 года и ориентированную на оптимизацию путей градиента, и Ultralytics YOLO26 — новейший передовой фреймворк, выпущенный в начале 2026 года и полностью переосмысливающий инференс на периферийных устройствах и стабильность обучения.
Краткий обзор: происхождение моделей и авторство#
Понимание происхождения моделей глубокого обучения помогает разобраться в причинах выбора их архитектуры и целевой аудитории.
YOLOv9#
YOLOv9 разработали Чиен-Яо Ванг и Хун-Юань Марк Ляо из Института информатики Academia Sinica на Тайване. Модель выпустили 21 февраля 2024 года. Основное внимание в ней уделено теоретическим концепциям глубокого обучения, в частности проблеме информационного бутылочного горлышка в глубоких сверточных нейронных сетях (CNN).
Ultralytics YOLO26#
YOLO26 разработали Гленн Джочер и Цзин Цю из Ultralytics. Модель выпустили 14 января 2026 года. Развивая огромный успех предшественников, таких как YOLO11 и YOLOv8, YOLO26 с самого начала проектировали с упором на готовность к промышленной эксплуатации, развертывание на периферийных устройствах и встроенную сквозную эффективность.
Хочешь обновить свой конвейер компьютерного зрения? С помощью платформы Ultralytics ты легко обучишь и развернешь модели YOLO26 в облаке без единой строчки кода.
Архитектурные инновации#
Обе модели предлагают революционные изменения в обработке визуальных данных нейронными сетями, но подходят к этой задаче по-разному.
Программируемая информация о градиентах в YOLOv9#
Главный вклад YOLOv9 в развитие области — внедрение программируемой информации о градиентах (PGI) и обобщенной эффективной сети агрегации слоев (GELAN). По мере углубления нейронные сети часто теряют информацию в процессе прямого распространения. PGI помогает градиентам, используемым для обновления весов при обратном распространении, оставаться точными и надежными. Благодаря этому архитектура GELAN обеспечивает высокую точность при меньшем числе параметров.
Однако YOLOv9 в значительной степени полагается на традиционное подавление немаксимумов (NMS) при постобработке, что может стать узким местом и увеличить задержку при инференсе в реальных условиях.
Архитектура YOLO26 с приоритетом периферийных устройств#
YOLO26 использует принципиально иной подход, оптимизируя весь конвейер — от обучения до развертывания в реальном времени. В основе модели лежит сквозная архитектура без NMS, впервые реализованная в YOLOv10, которая полностью устраняет необходимость в постобработке с помощью NMS. Это обеспечивает очень низкую задержку и высокую оптимизацию для периферийных устройств, таких как Raspberry Pi или NVIDIA Jetson.
Кроме того, YOLO26 полностью отказывается от Distribution Focal Loss (DFL). Это структурное изменение упрощает экспорт в ONNX и значительно улучшает совместимость с маломощными периферийными устройствами.
Для обучения YOLO26 использует новый оптимизатор MuSGD — гибрид стохастического градиентного спуска и Muon, вдохновленный методами обучения больших языковых моделей (LLM), разработанными для Kimi K2 компанией Moonshot AI. Это объединяет инновации в обучении больших языковых моделей (LLM) и компьютерное зрение, обеспечивая значительно более стабильное обучение и быстрое достижение сходимости.
Сравнение производительности и метрик#
При тестировании на широко используемом наборе данных COCO обе модели демонстрируют впечатляющие возможности, однако экосистема Ultralytics выделяется практической скоростью инференса и эффективностью использования параметров.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Анализ результатов#
- Скорость и эффективность: Благодаря архитектуре без NMS и упрощенным функциям потерь YOLO26 обеспечивает до 43% более быстрый инференс на CPU, чем устаревшие архитектуры. Модель YOLO26n выполняет инференс за рекордные 1,7 мс на GPU NVIDIA T4 с использованием TensorRT, что делает ее оптимальным выбором для видеопотоков в реальном времени.
- Точность: Модель YOLO26x достигает беспрецедентного показателя 57,5 mAP, превосходя самую крупную модель YOLOv9e при меньшей задержке.
- Требования к памяти: Модели Ultralytics известны своей эффективностью. По сравнению со сложными моделями компьютерного зрения на основе Transformer, YOLO26 требует значительно меньше памяти CUDA во время обучения модели и инференса. Благодаря этому разработчики могут использовать большие размеры пакетов на обычном потребительском оборудовании.
Экосистема, простота использования и универсальность#
Главное преимущество экосистемы Ultralytics — удобство работы. Исследователям, использующим кодовую базу YOLOv9 на GitHub, приходится разбираться со сложной настройкой окружения и писать скрипты вручную, тогда как YOLO26 полностью интегрирована в интуитивно понятный Python API Ultralytics.
Пример упрощенного API#
Чтобы обучить передовую модель YOLO26, достаточно написать несколько строк кода на Python:
from ultralytics import YOLO
# Загрузи новейшую встроенную сквозную модель YOLO26
model = YOLO("yolo26s.pt")
# Обучи модель; optimizer="auto" выбирает MuSGD для длительных запусков (>10k итераций)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Экспортируй модель напрямую в формат ONNX одной командой
model.export(format="onnx")Непревзойденная универсальность в решении задач#
В отличие от YOLOv9, ориентированной главным образом на стандартное обнаружение объектов, YOLO26 изначально поддерживает широкий спектр задач компьютерного зрения. В архитектуре предусмотрены специальные улучшения для разных сценариев применения:
- Сегментация экземпляров: Специализированная функция потерь для семантической сегментации и прототипы с несколькими масштабами обеспечивают точные маски на уровне пикселей.
- Оценка позы: Метод оценки логарифмического правдоподобия с остаточными связями (RLE) позволяет с высокой точностью отслеживать ключевые точки скелета.
- Ориентированные ограничивающие рамки (OBB): Специализированная функция потерь для угла разработана специально для устранения проблем с границами при обнаружении повернутых объектов на аэрофотоснимках.
- Классификация изображений: Надежная классификация целых изображений по стандартам ImageNet.
Все модели YOLO26 легко интегрируются с платформой Ultralytics, где доступны встроенная разметка наборов данных, активное обучение и готовые конвейеры развертывания.
Применение в реальных условиях#
Выбор между этими моделями часто зависит от среды, в которой их будут развертывать.
IoT и периферийная робототехника#
Для робототехники, автономных дронов и IoT-устройств для умного дома YOLO26 — бесспорный лидер. Интеграция ProgLoss + STAL заметно улучшает распознавание мелких объектов, что особенно важно для мониторинга сельскохозяйственных угодий с помощью дронов, летающих на большой высоте. В сочетании с инференсом на CPU, который выполняется на 43% быстрее, и архитектурой без NMS YOLO26 может стабильно работать на оборудовании без выделенных GPU.
Академические исследования и анализ градиентов#
YOLOv9 по-прежнему пользуется большим уважением в академической среде. Исследователям, изучающим теоретические границы распространения градиента или создающим пользовательские слои PyTorch на основе концепции PGI, кодовая база YOLOv9 послужит отличной основой для исследования теории глубокого обучения.
Высокоскоростные производственные конвейеры#
В промышленности, например при автоматическом обнаружении дефектов на высокоскоростных конвейерных лентах, молниеносная работа моделей YOLO26 с TensorRT помогает не пропускать кадры и максимально повышать пропускную способность систем контроля качества.
Сценарии использования и рекомендации#
Выбор между YOLOv9 и YOLO26 зависит от требований конкретного проекта, ограничений развертывания и предпочтений в отношении экосистемы.
Когда выбирать YOLOv9#
YOLOv9 — хороший выбор для:
- Исследование информационного узкого места: Академические проекты, изучающие архитектуры программируемой информации о градиентах (PGI) и обобщённой эффективной сети агрегации слоёв (GELAN).
- Исследования оптимизации потока градиентов: Работы, посвящённые изучению и устранению потери информации в глубоких слоях сети во время обучения.
- Сравнительное тестирование точного детектирования: Сценарии, в которых высокая результативность YOLOv9 на тестах COCO нужна в качестве ориентира для сравнения архитектур.
Когда выбирать YOLO26#
YOLO26 рекомендуется для:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Заключение#
Обе модели стали значительным шагом вперед для сообщества разработчиков открытого исходного кода. YOLOv9 предложила важные теоретические улучшения распространения градиента, которые будут вдохновлять на создание новых архитектур еще много лет. Однако разработчикам, стартапам и корпоративным командам, которым сегодня нужны оптимальные скорость, точность и простота развертывания, мы рекомендуем Ultralytics YOLO26.
YOLO26 обеспечивает инференс без NMS, предлагает мощный оптимизатор MuSGD и предоставляет непревзойденный набор инструментов для обнаружения объектов, сегментации и оценки позы. Поэтому твои проекты компьютерного зрения будут построены на самом надежном и перспективном фреймворке из доступных сегодня.