YOLOv9 против YOLOv10#
Ландшафт компьютерного зрения в реальном времени претерпел огромные изменения, в основном благодаря исследователям, которые постоянно расширяют границы производительности и эффективности. При анализе эволюции самых современных моделей зрения YOLOv9 и YOLOv10 представляют собой две важные вехи. Выпущенные в начале 2024 года, обе модели представили меняющие парадигму архитектурные решения для устранения давних проблем в глубоких нейронных сетях: от узких мест в передаче информации до задержек при постобработке.
Это исчерпывающее техническое сравнение исследует их архитектуры, показатели производительности и идеальные сценарии развертывания, помогая тебе разобраться со сложностями современных экосистем object detection.
Происхождение моделей и архитектурные прорывы#
Понимание происхождения и теоретических основ этих моделей имеет решающее значение для выбора правильной архитектуры под твой конкретный проект computer vision.
YOLOv9: освоение потока информации#
Представленная 21 февраля 2024 года, YOLOv9 решает теоретическую проблему потери информации при прохождении данных через глубокие нейронные сети.
- Авторы: Chien-Yao Wang и Hong-Yuan Mark Liao
- Организация: Institute of Information Science, Academia Sinica, Taiwan
- Ссылка: YOLOv9 arXiv Paper
- Репозиторий: YOLOv9 GitHub
YOLOv9 представляет Generalized Efficient Layer Aggregation Network (GELAN) — сеть, которая максимизирует использование параметров, объединяя сильные стороны CSPNet и ELAN. Кроме того, в ней используется Programmable Gradient Information (PGI) — вспомогательный механизм надзора, гарантирующий сохранение критически важной пространственной информации глубокими слоями. Это делает YOLOv9 исключительно мощной для задач, требующих высокой точности передачи признаков, таких как medical image analysis или удаленное видеонаблюдение.
YOLOv10: эффективность в реальном времени от начала до конца#
Выпущенная вскоре после этого, 23 мая 2024 года, YOLOv10 переосмысливает конвейер развертывания, устраняя одну из самых известных причин задержек при обнаружении объектов: подавление немаксимумов (NMS).
- Авторы: Ао Ван, Хуэй Чен, Лихао Лю и др.
- Организация: Tsinghua University
- Ссылка: YOLOv10 arXiv Paper
- Репозиторий: YOLOv10 GitHub
YOLOv10 использует согласованное двойное назначение (consistent dual assignments) во время обучения, обеспечивая изначально NMS-free design (дизайн без NMS). Это устраняет накладные расходы на постобработку при инференсе, радикально снижая задержку. В сочетании с целостным дизайном модели, ориентированным на эффективность и точность, YOLOv10 достигает выдающегося баланса, снижая вычислительные затраты (FLOPs) при сохранении конкурентоспособной точности, что делает ее крайне привлекательной для приложений edge computing.
Сравнение производительности и метрик#
При тестировании этих двух мощных решений на стандартном наборе данных MS COCO проявляются четкие компромиссы между чистой точностью и задержкой вывода.
| Модель | размер (пиксели) | mAPval 50-95 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (Б) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
Анализ данных#
- Задержка против точности: Модели YOLOv10, как правило, предлагают более высокую скорость вывода. Например, YOLOv10s достигает 46.7% mAP всего за 2.66 мс на TensorRT, по сравнению с YOLOv9s, которой требуется 3.54 мс для практически идентичного показателя 46.8% mAP.
- Точность высшего уровня: Для исследовательских сценариев, требующих максимальной точности обнаружения, YOLOv9e остается грозным выбором, достигая впечатляющих 55.6% mAP. Её архитектура PGI гарантирует надежное извлечение тонких признаков.
- Эффективность: YOLOv10 превосходит в FLOPs efficiency. Это напрямую трансформируется в меньшее энергопотребление, что является важнейшим показателем для работающих от батареи устройств, выполняющих vision AI models.
Если ты выполняешь развертывание на CPU или на аппаратном обеспечении с ограниченными ресурсами, таком как Raspberry Pi, архитектура YOLOv10 без NMS обычно обеспечит более плавный конвейер, устраняя недетерминированные шаги постобработки.
Преимущество Ultralytics: обучение и экосистема#
Хотя архитектурные различия имеют критическое значение, сопутствующая программная экосистема во многом определяет успех проекта. И YOLOv9, и YOLOv10 полностью интегрированы в Ultralytics ecosystem, обеспечивая непревзойденный опыт разработчика.
Простота использования и эффективность памяти#
В отличие от сложных архитектур на базе Transformer, страдающих от раздувания памяти, модели Ultralytics YOLO разработаны для оптимального использования GPU memory. Это позволяет исследователям использовать большие batch sizes на потребительском «железе», делая передовой ИИ доступным.
Унифицированный Python API скрывает сложности data augmentation и hyperparameter tuning. Ты можешь легко переключаться между архитектурами, просто изменяя строку файла весов.
from ultralytics import YOLO
# Load a YOLOv10 model (Easily swap to "yolov9c.pt" for YOLOv9)
model = YOLO("yolov10n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Validate the model's performance
metrics = model.val()
# Export the trained model to ONNX format for deployment
model.export(format="onnx")Независимо от того, нужно ли тебе логировать метрики в MLflow или выполнять экспорт в TensorRT для высокоскоростного развертывания на аппаратном обеспечении, платформа Ultralytics справляется с этим нативно.
Идеальные варианты использования#
Выбор между этими моделями зависит от ограничений твоего развертывания:
- Выбирай YOLOv9, если: Ты работаешь над задачами small object detection, такими как аэрофотосъемка с дронов или detecting small tumors, где сохранение признаков архитектурой GELAN обеспечивает наивысшую точность.
- Выбирай YOLOv10, если: Твоя главная цель — real-time inference на периферийных устройствах. Дизайн без NMS делает её идеальной для автономной робототехники, мониторинга дорожного движения в реальном времени и smart surveillance.
Взгляд в будущее: переход к YOLO26#
Хотя YOLOv8, YOLOv9 и YOLOv10 — отличные модели, разработчикам, желающим создавать современные ИИ-решения, стоит рассмотреть Ultralytics YOLO26, выпущенную в январе 2026 года.
YOLO26 представляет собой совершенный синтез предыдущих поколений, объединяя лучшие аспекты точности YOLOv9 и эффективности YOLOv10.
Ключевые инновации YOLO26#
- Сквозной дизайн без NMS: Опираясь на фундамент, заложенный в YOLOv10, YOLO26 изначально устраняет постобработку NMS для более простого развертывания.
- Оптимизатор MuSGD: Гибрид SGD и Muon, привносящий передовые инновации в обучение LLM в область компьютерного зрения для невероятно стабильной и быстрой сходимости.
- До 43% более быстрый вывод на CPU: Специально оптимизировано для периферийных вычислений и устройств без выделенных GPU.
- Удаление DFL: Distribution Focal Loss была удалена для упрощения model export и повышения совместимости с маломощными устройствами.
- ProgLoss + STAL: Эти улучшенные функции потерь привносят значительные улучшения в распознавание мелких объектов, соответствующие возможностям YOLOv9 или превосходящие их.
Для исследователей, оценивающих устаревшие архитектуры, RT-DETR и YOLO11 также являются хорошо задокументированными альтернативами в экосистеме Ultralytics. Однако для максимальной универсальности во всех задачах компьютерного зрения переход на YOLO26 на Ultralytics Platform гарантирует, что ты используешь вершину возможностей искусственного интеллекта в области зрения с открытым исходным кодом.