YOLO26 и YOLOv9#
Компьютерное зрение стремительно развивается: новые архитектуры постоянно расширяют границы скорости и точности. В этом техническом сравнении мы рассмотрим различия между YOLO26 и YOLOv9 — двумя влиятельными моделями для обнаружения объектов в реальном времени. У обеих моделей есть уникальные архитектурные решения, но для выбора подходящего инструмента для следующего проекта компьютерного зрения важно понимать компромиссы в производительности, возможности развертывания и требования к оборудованию.
YOLO26: мощная модель, оптимизированная для периферийных устройств#
Выпущенная в начале 2026 года, Ultralytics YOLO26 представляет собой скачок поколений в эффективности развертывания и стабильности обучения моделей. Изначально разработанная как сквозной фреймворк, она напрямую устраняет узкие места развертывания, которые исторически мешали периферийным AI-приложениям.
Сведения о модели:
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2026-01-14
- GitHub: Репозиторий Ultralytics
- Документация: Документация YOLO26
Архитектура и инновации#
YOLO26 кардинально перерабатывает конвейер постобработки, предлагая сквозную архитектуру без NMS. При запуске с дополнительной головой «один к одному» (nms=False) модель пропускает подавление немаксимумов (NMS), что значительно уменьшает вариативность задержки. Благодаря этому развертывание на мобильных и периферийных платформах становится намного проще, особенно при экспорте в такие фреймворки, как ONNX и Apple CoreML.
Кроме того, удаление Distribution Focal Loss (DFL) упрощает экспорт и повышает совместимость с микроконтроллерами с низким энергопотреблением. Для повышения стабильности обучения YOLO26 использует новый оптимизатор MuSGD — гибрид стохастического градиентного спуска (SGD) и Muon, вдохновлённый новыми подходами к обучению больших языковых моделей. Это обеспечивает более быструю сходимость и более надёжное извлечение признаков даже на сложных наборах данных.
Благодаря упрощению архитектуры и удалению DFL YOLO26 обеспечивает до 43% более быстрый инференс на CPU, что делает её идеальным выбором для периферийных устройств с ограниченными ресурсами, например Raspberry Pi или NVIDIA Jetson Nano.
Для обнаружения особенно сложных объектов, например на аэроснимках с дронов, YOLO26 использует обновлённые функции потерь ProgLoss + STAL. Они заметно повышают полноту обнаружения небольших объектов. Кроме того, модель включает улучшения для отдельных задач: многомасштабный прототип для сегментации экземпляров, оценку остаточного логарифма правдоподобия (RLE) для оценки позы и специализированную функцию потерь угла для обнаружения ориентированных ограничивающих рамок (OBB).
YOLOv9: программируемая информация о градиентах#
Представленная в начале 2024 года YOLOv9 принесла теоретические достижения в обработку потоков градиентов нейронными сетями во время обучения, уделяя особое внимание эффективности параметров и сохранению глубоких признаков.
Сведения о модели:
- Авторы: Chien-Yao Wang и Hong-Yuan Mark Liao
- Организация: Институт информатики, Academia Sinica, Тайвань
- Дата: 2024-02-21
- Arxiv: Статья о YOLOv9
- GitHub: Репозиторий YOLOv9
- Документация: Документация YOLOv9
Архитектура и сильные стороны#
В основе YOLOv9 лежат концепция программируемой информации о градиентах (PGI) и обобщённая эффективная сеть агрегации слоёв (GELAN). Эти концепции решают проблему информационного узкого места, часто наблюдаемую в глубоких нейронных сетях. Сохраняя важную информацию при прямом проходе, GELAN обеспечивает надёжность градиентов, используемых для обновления весов. Эта архитектура обеспечивает высокую точность и делает YOLOv9 отличным кандидатом для академических исследований теории нейронных сетей и оптимизации путей градиентов с использованием фреймворка PyTorch.
Ограничения#
Несмотря на отличную эффективность по числу параметров, YOLOv9 активно использует традиционную NMS для постобработки ограничивающих рамок, что может создавать вычислительные узкие места при инференсе на периферийных устройствах. Кроме того, официальный репозиторий в основном посвящён обнаружению объектов, поэтому для адаптации модели к специализированным задачам, таким как отслеживание или оценка позы, требуется значительная дополнительная инженерная работа.
Сравнение производительности#
При оценке этих моделей для реального развертывания важно найти баланс между точностью (mAP), скоростью инференса и расходом памяти. Модели Ultralytics известны низкими требованиями к памяти как во время обучения, так и во время инференса, и расходуют гораздо меньше памяти CUDA, чем альтернативы на основе Transformer, например RT-DETR.
Ниже приведено прямое сравнение производительности YOLO26 и YOLOv9 на наборе данных COCO. Лучшие значения в каждом столбце выделены полужирным.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
Примечание: показатели скорости YOLOv9 на CPU не приводятся, поскольку они сильно зависят от конфигурации NMS и обычно уступают нативной реализации YOLO26 без NMS.
Сценарии использования и рекомендации#
Выбор между YOLO26 и YOLOv9 зависит от требований конкретного проекта, ограничений развертывания и предпочтений в отношении экосистемы.
Когда выбирать YOLO26#
YOLO26 — отличный выбор для таких задач:
- Развертывание на периферийных устройствах без NMS: Приложения, которым необходим стабильный инференс с низкой задержкой без усложнения постобработки подавлением немаксимумов.
- Среды только с CPU: Устройства без выделенного ускорителя GPU, где до 43% более быстрый инференс YOLO26 на CPU даёт решающее преимущество.
- Обнаружение небольших объектов: Сложные сценарии, например съёмка с дронов или анализ данных IoT-датчиков, где ProgLoss и STAL заметно повышают точность обнаружения крошечных объектов.
Когда выбирать YOLOv9#
YOLOv9 рекомендуется для таких задач:
- Исследование информационного узкого места: Академические проекты, изучающие архитектуры программируемой информации о градиентах (PGI) и обобщённой эффективной сети агрегации слоёв (GELAN).
- Исследования оптимизации потока градиентов: Работы, посвящённые изучению и устранению потери информации в глубоких слоях сети во время обучения.
- Сравнительное тестирование точного детектирования: Сценарии, в которых высокая результативность YOLOv9 на тестах COCO нужна в качестве ориентира для сравнения архитектур.
Преимущества Ultralytics#
При выборе модели важно не только изучить результаты тестов точности: окружающая её программная экосистема определяет, насколько быстро ты перейдёшь от сбора данных к запуску в production.
Простота использования и экосистема#
Python API Ultralytics обеспечивает плавный переход от новичка к эксперту. Вместо клонирования сложных репозиториев или ручной настройки скриптов распределённого обучения разработчики могут установить пакет через pip и сразу приступить к обучению. Активно развиваемая экосистема Ultralytics гарантирует частые обновления, автоматическую интеграцию с ML-платформами, такими как Weights & Biases, и подробную документацию.
Универсальность для задач компьютерного зрения#
YOLOv9 — преимущественно движок для обнаружения объектов, а YOLO26 — универсальный инструмент компьютерного зрения. Используя единый синтаксис, ты можешь легко перейти от обнаружения объектов к попиксельной сегментации изображений или классификации целых изображений. Такая универсальность уменьшает технический долг, связанный с поддержкой нескольких разрозненных кодовых баз для разных задач компьютерного зрения.
Эффективное обучение и развертывание#
Эффективность обучения — один из краеугольных принципов Ultralytics. YOLO26 использует доступные предварительно обученные веса и расходует значительно меньше памяти, чем громоздкие визуальные Transformer-модели. После обучения встроенные конвейеры экспорта позволяют одним щелчком конвертировать модель в оптимизированные форматы, например TensorRT или LiteRT, упрощая переход к production.
Пример кода: начало работы с YOLO26#
Реализовать YOLO26 очень просто. В следующем фрагменте Python показано, как загрузить предварительно обученную модель, обучить её на пользовательских данных и запустить инференс с помощью API Ultralytics.
from ultralytics import YOLO
# Загружаем новейшую передовую нано-модель YOLO26
model = YOLO("yolo26n.pt")
# Обучаем модель на наборе данных COCO8 (при длительном обучении optimizer='auto' выбирает MuSGD)
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Используем GPU 0 или указываем 'cpu' для обучения на CPU
)
# Запускаем инференс без NMS на тестовом изображении
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Отображаем ограничивающие рамки и значения уверенности
predictions[0].show()Используя высокую скорость YOLO26, упрощённую архитектуру и надёжную экосистему, команды могут быстрее выводить на рынок передовые AI-приложения для компьютерного зрения и сталкиваться с меньшим количеством технических препятствий, чем когда-либо прежде.