Датасет глубины Make3D#
Make3D — классический уличный бенчмарк для оценки глубины по одному изображению. Он содержит изображения сцен кампуса с соответствующей эталонной глубиной, полученной с помощью специального 3D-лазерного сканера, и широко используется для проверки способности к обобщению вне распределения данных.
Ключевые особенности#
- Эталонная глубина, полученная с помощью специального 3D-лазерного сканера.
- Охватывает реальные уличные сцены кампуса.
- Диапазон глубины — примерно до 70 м.
- Оценка выполняется на стандартном тестовом наборе из 134 изображений.
- Классический бенчмарк для проверки обобщения вне распределения данных.
Роль в YOLO26-Depth#
Make3D — это бенчмарк оценки без обучения на примерах для семейства YOLO26-Depth; опубликованные модели не обучались на нём. Как набор уличных данных вне распределения, он является самым сложным бенчмарком для всех моделей, поэтому абсолютные значения delta1 в целом низкие, что ожидаемо для этого датасета.
При оценке используются многоштабное дополнение данных и дополнение с горизонтальным отражением во время тестирования (TTA), после чего перед вычислением метрик выполняется выравнивание масштаба между предсказанными картами глубины и эталонными картами глубины методом логарифмических наименьших квадратов.
Результаты#
В таблице ниже приведена точность delta1 (процент пикселей в пределах порога 1.25×; чем выше, тем лучше) на тестовом наборе Make3D в зависимости от размера модели.
| Модель | delta1 |
|---|---|
| YOLO26n-depth | 0.307 |
| YOLO26s-depth | 0.311 |
| YOLO26m-depth | 0.293 |
| YOLO26l-depth | 0.297 |
| YOLO26x-depth | 0.299 |
Оценка#
Make3D не поставляется с готовым YAML-файлом датасета. Оценка выполняется с помощью специального скрипта, который загружает изображения Make3D и эталонную глубину от лазерного сканера, применяет стандартную TTA и масштабное выравнивание методом наименьших квадратов в логарифмическом пространстве, а затем вычисляет метрики глубины.
Использование#
Make3D — внешний бенчмарк, поэтому модели обычно запускаются с predict на его изображениях. Полный список доступных аргументов приведён на странице предсказаний модели.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")Предварительно обученные модели#
Семейство моделей глубины YOLO26 оценивается без обучения на примерах на бенчмарке Make3D. Эти модели автоматически скачиваются из последнего релиза Ultralytics, например YOLO26x-depth из v8.4.0, и представлены в разных размерах (yolo26n/s/m/l/x-depth) для различных требований к точности и ресурсам.
Цитирование и благодарности#
Если ты используешь датасет Make3D в исследовательской или разработческой работе, пожалуйста, процитируй следующую статью:
@article{saxena2009make3d,
title={Make3D: Learning 3D Scene Structure from a Single Still Image},
author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
year={2009}
}Мы хотели бы выразить признательность авторам за создание и поддержку этого ценного ресурса для сообщества компьютерного зрения.
Часто задаваемые вопросы#
Make3D — это нулевой (zero-shot), внераспределенческий (out-of-distribution) открытый бенчмарк из 134 изображений университетского кампуса с данными глубины, полученными с помощью лазерного сканера на расстоянии примерно до 70 м. Выпущенные модели YOLO26-Depth не обучены на Make3D, поэтому бенчмарк измеряет, насколько хорошо модели обобщаются на незнакомые открытые сцены.
Make3D является самым сложным из пяти оценочных бенчмарков для каждой модели, потому что сцены Make3D и статистика глубины сильно отличаются от обучающих данных. Абсолютные значения delta1 около 0.3 являются ожидаемыми для Make3D, и именно относительное сравнение между моделями имеет значение.
Нет. Make3D оценивается с помощью специального скрипта с использованием многомасштабной аугментации и аугментации отражением на этапе тестирования (test-time augmentation), а также выравнивания масштаба по логарифму наименьших квадратов. Чтобы запустить модель на изображениях Make3D, используй режим прогнозирования, как показано в разделе Использование.