Ultralytics YOLO27:

Датасет глубины Make3D#

Make3D — классический уличный бенчмарк для оценки глубины по одному изображению. Он содержит изображения сцен кампуса с соответствующей эталонной глубиной, полученной с помощью специального 3D-лазерного сканера, и широко используется для проверки способности к обобщению вне распределения данных.

Ключевые особенности#

  • Эталонная глубина, полученная с помощью специального 3D-лазерного сканера.
  • Охватывает реальные уличные сцены кампуса.
  • Диапазон глубины — примерно до 70 м.
  • Оценка выполняется на стандартном тестовом наборе из 134 изображений.
  • Классический бенчмарк для проверки обобщения вне распределения данных.

Роль в YOLO26-Depth#

Make3D — это бенчмарк оценки без обучения на примерах для семейства YOLO26-Depth; опубликованные модели не обучались на нём. Как набор уличных данных вне распределения, он является самым сложным бенчмарком для всех моделей, поэтому абсолютные значения delta1 в целом низкие, что ожидаемо для этого датасета.

При оценке используются многоштабное дополнение данных и дополнение с горизонтальным отражением во время тестирования (TTA), после чего перед вычислением метрик выполняется выравнивание масштаба между предсказанными картами глубины и эталонными картами глубины методом логарифмических наименьших квадратов.

Результаты#

В таблице ниже приведена точность delta1 (процент пикселей в пределах порога 1.25×; чем выше, тем лучше) на тестовом наборе Make3D в зависимости от размера модели.

Модельdelta1
YOLO26n-depth0.307
YOLO26s-depth0.311
YOLO26m-depth0.293
YOLO26l-depth0.297
YOLO26x-depth0.299

Оценка#

Make3D не поставляется с готовым YAML-файлом датасета. Оценка выполняется с помощью специального скрипта, который загружает изображения Make3D и эталонную глубину от лазерного сканера, применяет стандартную TTA и масштабное выравнивание методом наименьших квадратов в логарифмическом пространстве, а затем вычисляет метрики глубины.

Использование#

Make3D — внешний бенчмарк, поэтому модели обычно запускаются с predict на его изображениях. Полный список доступных аргументов приведён на странице предсказаний модели.

Пример предсказания
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")

Предварительно обученные модели#

Семейство моделей глубины YOLO26 оценивается без обучения на примерах на бенчмарке Make3D. Эти модели автоматически скачиваются из последнего релиза Ultralytics, например YOLO26x-depth из v8.4.0, и представлены в разных размерах (yolo26n/s/m/l/x-depth) для различных требований к точности и ресурсам.

Цитирование и благодарности#

Если ты используешь датасет Make3D в исследовательской или разработческой работе, пожалуйста, процитируй следующую статью:

Цитата
@article{saxena2009make3d,
      title={Make3D: Learning 3D Scene Structure from a Single Still Image},
      author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
      journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
      year={2009}
}

Мы хотели бы выразить признательность авторам за создание и поддержку этого ценного ресурса для сообщества компьютерного зрения.

Часто задаваемые вопросы#

  • Make3D — это нулевой (zero-shot), внераспределенческий (out-of-distribution) открытый бенчмарк из 134 изображений университетского кампуса с данными глубины, полученными с помощью лазерного сканера на расстоянии примерно до 70 м. Выпущенные модели YOLO26-Depth не обучены на Make3D, поэтому бенчмарк измеряет, насколько хорошо модели обобщаются на незнакомые открытые сцены.

  • Make3D является самым сложным из пяти оценочных бенчмарков для каждой модели, потому что сцены Make3D и статистика глубины сильно отличаются от обучающих данных. Абсолютные значения delta1 около 0.3 являются ожидаемыми для Make3D, и именно относительное сравнение между моделями имеет значение.

  • Нет. Make3D оценивается с помощью специального скрипта с использованием многомасштабной аугментации и аугментации отражением на этапе тестирования (test-time augmentation), а также выравнивания масштаба по логарифму наименьших квадратов. Чтобы запустить модель на изображениях Make3D, используй режим прогнозирования, как показано в разделе Использование.

Участники

Комментарии