Ultralytics YOLO27:
Get Started

YOLOv9 и EfficientDet#

В сфере компьютерного зрения стремительно развиваются методы обнаружения объектов в реальном времени: исследователи постоянно повышают точность и эффективность моделей. Выбор оптимальной архитектуры — ключевой этап создания надежных систем компьютерного зрения. Среди самых обсуждаемых моделей — YOLOv9, усовершенствованная модель семейства YOLO, ориентированная на работу с градиентной информацией, и EfficientDet — масштабируемый фреймворк, разработанный Google.

В этом руководстве подробно сравниваются две архитектуры, рассматриваются принципы их работы, показатели производительности и оптимальные сценарии развертывания, чтобы помочь тебе принять обоснованное решение для следующего проекта в сфере ИИ.

История создания и технические характеристики моделей#

Понимание истории создания модели и принципов, лежащих в основе ее архитектуры, помогает разобраться в ее структуре и практическом применении.

YOLOv9: максимизация потока информации#

Разработанная для решения проблемы «информационного узкого места» в глубоком обучении, YOLOv9 использует новые методы, которые предотвращают потерю данных при прохождении через глубокие нейронные сети.

В YOLOv9 используется программируемая градиентная информация (PGI) — вспомогательный фреймворк супервизии, который надежно сохраняет градиентную информацию на глубоких слоях. Он сочетается с обобщенной эффективной сетью агрегации слоев (GELAN), которая повышает эффективность использования параметров, объединяя преимущества CSPNet и ELAN. Благодаря этому YOLOv9 обеспечивает высокую точность, оставаясь достаточно компактной для обработки данных в реальном времени на периферийных устройствах.

Подробнее о YOLOv9

EfficientDet: составное масштабирование и BiFPN#

Разработанная Google Brain модель EfficientDet использует систематическое масштабирование размеров сети, чтобы сбалансировать скорость и точность.

В основе EfficientDet лежит EfficientNet в сочетании с двунаправленной сетью пирамиды признаков (BiFPN). BiFPN упрощает и ускоряет слияние признаков разных масштабов. В архитектуре применяется метод составного масштабирования, который одновременно и равномерно изменяет разрешение, глубину и ширину базовой сети, сети признаков и сетей предсказания рамок и классов.

Подробнее об EfficientDet

Выбор подходящей платформы

Теоретические особенности архитектуры важны, но успех проекта часто определяется программной экосистемой. Ultralytics предлагает удобную работу с моделями и надежные инструменты развертывания, которые значительно сокращают время выхода на рынок по сравнению со сложными кодовыми базами, ориентированными на исследования.

Сравнение производительности и метрик#

При оценке производительности модели важно балансировать точность, задержку инференса и вычислительные затраты. В таблице ниже показаны компромиссы для моделей YOLOv9 и EfficientDet разных размеров.

Модельразмер
(пиксели)
mAPval
50-95
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Критический анализ метрик#

  1. Пороговые значения точности: YOLOv9e показывает наивысшую общую точность — впечатляющие 55,6% средней точности (mAP). Модель превосходит самую крупную EfficientDet-d7 (53,7%) и при этом работает быстрее в TensorRT.
  2. Скорость в реальном времени: YOLOv9t выполняет инференс всего за 2,3 мс на GPU T4 с использованием TensorRT, демонстрируя эффективность архитектуры GELAN при обработке высокоскоростных видеопотоков. EfficientDet-d0 работает быстро, но для этого приходится существенно жертвовать mAP.
  3. Вычислительная сложность: при увеличении коэффициента составного масштабирования у EfficientDet быстро растут количество параметров и FLOPs. Задержка варианта d7 достигает 128 мс, поэтому он примерно в 7,6 раза медленнее и при этом менее точен, чем YOLOv9e (16,77 мс). Это сильно ограничивает его применение в средах инференса в реальном времени.

Эффективность обучения и экосистема#

При выборе модели нужно учитывать экосистему разработчика. Экосистема Ultralytics дает непревзойденные преимущества в эффективности обучения, гибкости развертывания и универсальности.

Преимущества Ultralytics#

Модели, поддерживаемые фреймворком Ultralytics, включая YOLOv9, YOLOv8 и YOLO11, требуют при обучении значительно меньше памяти, чем модели на основе Transformer или старые архитектуры TensorFlow, такие как EfficientDet. Надежная серверная часть PyTorch обеспечивает быструю сходимость и стабильность.

Пример реализации#

Обучение продвинутой модели компьютерного зрения не должно требовать сотен строк шаблонного кода. Вот как просто начать обучение с помощью пакета Ultralytics для Python:

from ultralytics import YOLO

# Загрузи официальную модель Ultralytics (например, YOLO11 или YOLO26)
model = YOLO("yolo11n.pt")

# Обучи модель на собственном наборе данных средствами фреймворка
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Экспортируй обученную модель в формат ONNX для развёртывания
model.export(format="onnx")

Оптимальные сценарии использования и реальные приложения#

Различия в архитектуре этих моделей определяют сценарии, для которых они подходят.

Когда использовать EfficientDet: EfficientDet остается подходящим вариантом для устаревших систем, глубоко интегрированных в экосистему TensorFlow, где переход на PyTorch невозможен. Модель также представляет исторический интерес для исследований в области анализа медицинских изображений, в которых допустима медленная автономная обработка снимков высокого разрешения.

Когда использовать YOLOv9: YOLOv9 отлично подходит для сред, где нужно извлечь максимум точности из глубоких слоев, не допуская резкого роста количества параметров. Такие приложения, как сложные системы управления дорожным движением в умных городах и мониторинг больших скоплений людей, получают значительную пользу от способности PGI сохранять целостность признаков.

Задел на будущее: следующее поколение ИИ для компьютерного зрения#

YOLOv9 и EfficientDet — мощные модели, но разработчикам, которым нужен оптимальный баланс скорости периферийных вычислений, стабильности обучения и простоты развертывания, стоит обратить внимание на новейшие разработки.

Выпущенная в январе 2026 года, Ultralytics YOLO26 представляет собой передовую модель на сегодняшний день. Она превосходит предыдущие поколения, включая YOLO11 и YOLOv8, благодаря нескольким важным новшествам:

  • Сквозная архитектура без NMS: в YOLO26 предусмотрена необязательная голова модели с сопоставлением один к одному (nms=False), которая полностью пропускает подавление немаксимумов. Этот подход впервые появился в YOLOv10 и позволяет значительно ускорить и упростить развертывание модели.
  • Удаление DFL: удаление фокальной функции потерь распределения упрощает экспорт и повышает совместимость с периферийными устройствами и устройствами с низким энергопотреблением.
  • До 43% быстрее инференс на CPU: идеально оптимизирована для устройств IoT и сред без выделенных GPU.
  • Оптимизатор MuSGD: революционный гибрид SGD и Muon, вдохновленный новыми подходами к обучению LLM, обеспечивает быструю сходимость и невероятно стабильное обучение.
  • ProgLoss + STAL: продвинутые функции потерь значительно повышают точность обнаружения мелких объектов — это особенно важно при анализе аэрофотоснимков с дронов и в надежной робототехнике.

Используя комплексную платформу Ultralytics, команды могут легко управлять наборами данных, отслеживать эксперименты и развертывать модели, например YOLO26, на различных аппаратных платформах. Это помогает поддерживать актуальность и готовность к работе в production конвейеров компьютерного зрения.

Участники

Комментарии