YOLO26 против YOLOv9#
Ландшафт компьютерного зрения стремительно развивается: новые архитектуры постоянно расширяют границы скорости и точности. В этом техническом сравнении мы рассмотрим различия между YOLO26 и YOLOv9 — двумя весьма влиятельными моделями в области обнаружения объектов в реальном времени. Хотя обе модели предлагают уникальные архитектурные решения, для выбора подходящего инструмента для следующего проекта в области компьютерного зрения важно понимать компромиссы между их производительностью, возможностями развертывания и требованиями к оборудованию.
YOLO26: оптимизированная для периферийных устройств мощная модель#
Выпущенная в начале 2026 года, Ultralytics YOLO26 знаменует собой скачок поколений в эффективности развертывания и стабильности обучения моделей. Разработанная как изначально сквозная система, она напрямую устраняет узкие места развертывания, которые исторически осложняли применение ИИ на периферийных устройствах.
Сведения о модели:
- Авторы: Glenn Jocher и Jing Qiu
- Организация: Ultralytics
- Дата: 2026-01-14
- GitHub: Репозиторий Ultralytics
- Документация: Документация YOLO26
Архитектура и инновации#
YOLO26 полностью перерабатывает конвейер постобработки, внедряя сквозную архитектуру без NMS. Благодаря устранению необходимости в подавлении немаксимумов (NMS) модель обеспечивает значительно меньшую вариативность задержки. Это существенно упрощает развертывание на мобильных и периферийных платформах, особенно при экспорте в такие фреймворки, как ONNX и Apple CoreML.
Кроме того, отказ от Distribution Focal Loss (DFL) упрощает процесс экспорта и повышает совместимость с маломощными микроконтроллерами. Для повышения стабильности обучения YOLO26 интегрирует новый оптимизатор MuSGD — гибрид стохастического градиентного спуска (SGD) и Muon, созданный под влиянием инноваций в обучении больших языковых моделей. Это обеспечивает более быструю сходимость и более надежное извлечение признаков на сложных наборах данных.
Благодаря упрощению архитектуры и удалению DFL YOLO26 обеспечивает до 43% более быстрый вывод на CPU, что делает его идеальным выбором для периферийных устройств с ограниченными ресурсами, таких как Raspberry Pi или NVIDIA Jetson Nano.
Для обнаружения крайне сложных объектов в сценах, например на аэрофотоснимках с дронов, YOLO26 использует обновленные функции потерь ProgLoss + STAL. Они заметно повышают полноту обнаружения мелких объектов. Кроме того, модель предлагает улучшения для отдельных задач, включая multi-scale proto для сегментации экземпляров, Residual Log-Likelihood Estimation (RLE) для оценки позы и специализированную функцию потерь угла для обнаружения ориентированных ограничивающих прямоугольников (OBB).
YOLOv9: программируемая информация о градиентах#
Представленная в начале 2024 года, YOLOv9 привнесла теоретические усовершенствования в способ обработки потоков градиентов нейронными сетями на этапе обучения, уделяя особое внимание эффективности параметров и сохранению глубоких признаков.
Сведения о модели:
- Авторы: Chien-Yao Wang и Hong-Yuan Mark Liao
- Организация: Институт информационных наук Academia Sinica, Тайвань
- Дата: 2024-02-21
- Arxiv: Статья о YOLOv9
- GitHub: Репозиторий YOLOv9
- Документация: Документация YOLOv9
Архитектура и преимущества#
В основе YOLOv9 лежат концепции Programmable Gradient Information (PGI) и Generalized Efficient Layer Aggregation Network (GELAN). Эти концепции решают проблему информационного узкого места, часто наблюдаемую в глубоких нейронных сетях. Сохраняя важную информацию в процессе прямого распространения, GELAN обеспечивает надежность градиентов, используемых для обновления весов. Эта архитектура обеспечивает высокую точность и делает YOLOv9 сильным кандидатом для академических исследований теории нейронных сетей и оптимизации путей градиентов с использованием фреймворка PyTorch.
Ограничения#
Несмотря на отличную эффективность параметров, YOLOv9 в значительной степени полагается на традиционное NMS для постобработки ограничивающих прямоугольников, что может создавать вычислительные узкие места при выводе на периферийных устройствах. Кроме того, официальный репозиторий в основном ориентирован на обнаружение объектов, поэтому для адаптации под специализированные задачи, такие как отслеживание или оценка позы, требуется значительная доработка.
Сравнение производительности#
При оценке этих моделей для развертывания в реальных условиях критически важно сбалансировать точность (mAP), скорость вывода и использование памяти. Модели Ultralytics известны низкими требованиями к памяти как во время обучения, так и при выводе, и требуют гораздо меньше памяти CUDA, чем альтернативы на основе Transformer, такие как RT-DETR.
Ниже приведено прямое сравнение производительности YOLO26 и YOLOv9 на наборе данных COCO. Лучшие значения в каждом столбце выделены жирным шрифтом.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Примечание: показатели скорости CPU для YOLOv9 не приводятся, поскольку они сильно зависят от конфигурации NMS и обычно ниже, чем у собственной реализации YOLO26 без NMS.
Варианты применения и рекомендации#
Выбор между YOLO26 и YOLOv9 зависит от конкретных требований проекта, ограничений развертывания и предпочтений в отношении экосистемы.
Когда стоит выбрать YOLO26#
YOLO26 — подходящий выбор для:
- Развертывания на периферийных устройствах без NMS: приложений, требующих стабильного вывода с низкой задержкой без сложной постобработки с подавлением немаксимумов.
- Сред без GPU: устройств без выделенного ускорения GPU, где до 43% более быстрый вывод YOLO26 на CPU дает решающее преимущество.
- Обнаружения мелких объектов: сложных сценариев, таких как аэрофотосъемка с дронов или анализ данных IoT-сенсоров, где ProgLoss и STAL значительно повышают точность обнаружения крошечных объектов.
Когда стоит выбрать YOLOv9#
YOLOv9 рекомендуется для:
- Исследований информационного узкого места: академических проектов, изучающих архитектуры Programmable Gradient Information (PGI) и Generalized Efficient Layer Aggregation Network (GELAN).
- Исследований оптимизации потока градиентов: работ, посвященных пониманию и устранению потери информации в слоях глубоких сетей во время обучения.
- Сравнительного тестирования обнаружения с высокой точностью: сценариев, где высокие результаты YOLOv9 на тесте COCO нужны как эталон для архитектурных сравнений.
Преимущества Ultralytics#
Выбор модели — это нечто большее, чем изучение показателей точности: окружающая программная экосистема определяет, насколько быстро ты сможешь пройти путь от сбора данных до выпуска в продакшен.
Простота использования и экосистема#
Python API Ultralytics обеспечивает плавный путь от «нуля до героя». Вместо клонирования сложных репозиториев или ручной настройки скриптов распределенного обучения разработчики могут установить пакет через pip и сразу начать обучение. Экосистема Ultralytics, которую активно поддерживают, гарантирует частые обновления, автоматизированные интеграции с ML-платформами, такими как Weights & Biases, и обширную документацию.
Универсальность в задачах компьютерного зрения#
В то время как YOLOv9 в основном представляет собой движок обнаружения, YOLO26 — универсальный инструмент компьютерного зрения. Используя единый синтаксис, ты можешь легко перейти от обнаружения объектов к попиксельной сегментации изображений или классификации всего изображения. Такая универсальность снижает технический долг, связанный с поддержкой нескольких разрозненных кодовых баз для разных функций компьютерного зрения.
Эффективное обучение и развертывание#
Эффективность обучения — один из краеугольных камней философии Ultralytics. YOLO26 использует доступные предварительно обученные веса и отличается значительно меньшим потреблением памяти по сравнению с громоздкими Transformer-моделями компьютерного зрения. После обучения встроенные конвейеры экспорта позволяют одним щелчком преобразовать модель в оптимизированные форматы, такие как TensorRT или TensorFlow Lite, упрощая путь к продакшену.
Пример кода: начало работы с YOLO26#
Реализовать YOLO26 remarkably просто. Следующий фрагмент кода на Python показывает, как загрузить предварительно обученную модель, обучить ее на пользовательских данных и запустить вывод с использованием API Ultralytics.
from ultralytics import YOLO
# Load the latest state-of-the-art YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset utilizing the MuSGD optimizer
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Uses GPU 0, or use 'cpu' for CPU training
)
# Run an NMS-free inference on a sample image
predictions = model("https://ultralytics.com/images/bus.jpg")
# Display the bounding boxes and confidences
predictions[0].show()Используя скорость, упрощенную архитектуру и надежную экосистему YOLO26, команды могут быстрее выводить на рынок передовые приложения ИИ для компьютерного зрения и сталкиваться с меньшим количеством технических препятствий, чем когда-либо прежде.