Ultralytics YOLO27:

YOLOv9 и YOLOv10#

В области компьютерного зрения в реальном времени произошёл огромный прогресс, во многом благодаря исследователям, которые постоянно расширяют границы соотношения производительности и эффективности. При анализе эволюции передовых моделей компьютерного зрения YOLOv9 и YOLOv10 представляют собой два важнейших этапа. Выпущенные в начале 2024 года, обе модели предложили революционные архитектурные решения для давних проблем глубоких нейронных сетей — от информационных узких мест до задержки постобработки.

В этом подробном техническом сравнении рассматриваются их архитектуры, показатели производительности и оптимальные сценарии развёртывания, что поможет тебе разобраться в сложностях современных экосистем обнаружения объектов.

Происхождение моделей и архитектурные прорывы#

Понимание происхождения и теоретических основ этих моделей крайне важно для выбора подходящей архитектуры для твоего проекта в области компьютерного зрения.

YOLOv9: управление потоком информации#

Представленная 21 февраля 2024 года, YOLOv9 решает теоретическую проблему потери информации при прохождении данных через глубокие нейронные сети.

YOLOv9 представляет обобщённую эффективную сеть агрегации слоёв (GELAN), которая максимально эффективно использует параметры, объединяя сильные стороны CSPNet и ELAN. Кроме того, в ней применяется программируемая информация о градиентах (PGI) — механизм вспомогательного обучения, обеспечивающий сохранение критически важной пространственной информации в глубоких слоях. Благодаря этому YOLOv9 особенно хорошо подходит для задач, требующих высокой точности сохранения признаков, таких как анализ медицинских изображений или наблюдение за удалёнными объектами.

Узнай больше о YOLOv9

YOLOv10: эффективность в реальном времени от начала до конца#

Выпущенная вскоре после этого, 23 мая 2024 года, YOLOv10 переосмысливает конвейер развёртывания, устраняя одно из самых известных узких мест по задержке в обнаружении объектов: подавление немаксимумов (NMS).

YOLOv10 использует согласованные двойные назначения во время обучения, что позволяет создать нативную архитектуру без NMS. Это устраняет накладные расходы на постобработку во время вывода и значительно снижает задержку. В сочетании с целостной архитектурой модели, ориентированной на эффективность и точность, YOLOv10 обеспечивает выдающийся баланс: снижает вычислительные затраты (FLOPs), сохраняя конкурентоспособную точность, что делает её особенно привлекательной для приложений периферийных вычислений.

Подробнее о YOLOv10

Сравнение производительности и метрик#

При сравнении этих двух мощных моделей на стандартном наборе данных MS COCO проявляются заметные компромиссы между абсолютной точностью и задержкой вывода.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

Анализ данных#

  1. Задержка и точность: Модели YOLOv10 обычно обеспечивают более высокую скорость вывода. Например, YOLOv10s достигает 46,7% mAP всего за 2,66 мс на TensorRT, тогда как YOLOv9s требуется 3,54 мс для практически идентичного показателя mAP 46,8%.
  2. Максимальная точность: Для исследовательских сценариев, требующих максимальной точности обнаружения, YOLOv9e остаётся чрезвычайно сильным выбором, достигая впечатляющего показателя mAP 55,6%. Архитектура PGI обеспечивает надёжное извлечение малозаметных признаков.
  3. Эффективность: YOLOv10 превосходит другие модели по эффективности FLOPs. Это напрямую снижает энергопотребление — важнейший показатель для устройств с питанием от аккумулятора, на которых работают модели ИИ для компьютерного зрения.
Совет по развертыванию

Если ты развёртываешь модель на CPU или ресурсно-ограниченном периферийном оборудовании, например Raspberry Pi, архитектура YOLOv10 без NMS обычно обеспечивает более плавную работу конвейера за счёт устранения недетерминированных этапов постобработки.

Преимущество Ultralytics: обучение и экосистема#

Хотя архитектурные различия имеют большое значение, успех проекта во многом определяется окружающей программной экосистемой. YOLOv9 и YOLOv10 полностью интегрированы в экосистему Ultralytics, обеспечивая непревзойдённый опыт для разработчиков.

Простота использования и эффективность работы с памятью#

В отличие от сложных архитектур на основе Transformer, страдающих от огромного расхода памяти, модели Ultralytics YOLO разработаны для оптимального использования памяти GPU. Это позволяет исследователям использовать более крупные размеры пакетов на оборудовании потребительского класса, делая передовые технологии ИИ доступнее.

Унифицированный API Python скрывает сложности аугментации данных и настройки гиперпараметров. Ты можешь легко переключаться между архитектурами, просто изменив строку с путём к файлу весов.

from ultralytics import YOLO

# Load a YOLOv10 model (Easily swap to "yolov9c.pt" for YOLOv9)
model = YOLO("yolov10n.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)

# Validate the model's performance
metrics = model.val()

# Export the trained model to ONNX format for deployment
model.export(format="onnx")

Нужно ли тебе записывать метрики в MLflow или экспортировать модель в TensorRT для высокоскоростного развёртывания на оборудовании — платформа Ultralytics поддерживает это из коробки.

Идеальные сценарии использования#

Выбор между этими моделями зависит от ограничений твоего сценария развёртывания:

Стратегия на будущее: переход к YOLO26#

Хотя YOLOv8, YOLOv9 и YOLOv10 — отличные модели, разработчикам, создающим современные решения на основе ИИ, стоит обратить внимание на Ultralytics YOLO26, выпущенную в январе 2026 года.

YOLO26 представляет собой итоговый синтез предыдущих поколений, объединяя лучшие стороны точности YOLOv9 и эффективности YOLOv10.

Ключевые инновации YOLO26#

  • Сквозная архитектура без NMS: опираясь на основы, заложенные в YOLOv10, YOLO26 нативно устраняет постобработку NMS, упрощая развёртывание.
  • Оптимизатор MuSGD: гибрид SGD и Muon, который переносит передовые инновации обучения больших языковых моделей в компьютерное зрение, обеспечивая исключительно стабильную и быструю сходимость.
  • До 43% более быстрый вывод на CPU: специально оптимизирован для периферийных вычислений и устройств без выделенных GPU.
  • Удаление DFL: Distribution Focal Loss была удалена для упрощения экспорта модели и повышения совместимости с маломощными устройствами.
  • ProgLoss + STAL: эти улучшенные функции потерь заметно повышают качество распознавания малых объектов, не уступая возможностям YOLOv9 или превосходя их.

Для исследователей, оценивающих устаревшие архитектуры, RT-DETR и YOLO11 также являются хорошо документированными альтернативами в экосистеме Ultralytics. Однако для максимальной универсальности во всех задачах компьютерного зрения переход на YOLO26 в Ultralytics Platform гарантирует использование передовых возможностей ИИ для компьютерного зрения с открытым исходным кодом.

Комментарии