Segurança pronta para empresas: Em conformidade com ISO 27001 + SOC 2 Tipo I.

Link to this sectionConjunto de dados de profundidade TartanAir#

O TartanAir é um conjunto de dados sintético em grande escala gerado no simulador AirSim. Foi criado para superar os limites de SLAM visual e abrange uma ampla variedade de ambientes — cenas internas, externas, urbanas e naturais — juntamente com variações sazonais, climáticas e de iluminação, e condições desafiadoras.

Como o TartanAir é renderizado em simulação, ele fornece verdade terrestre (ground truth) de profundidade densa em todo esse conjunto diversificado de cenas, tornando-o uma fonte sólida de diversidade ambiental e geometria de longo alcance para treinar modelos monoculares de estimativa de profundidade.

Link to this sectionPrincipais recursos#

  • Dados sintéticos gerados no simulador AirSim.
  • Diversos ambientes internos e externos (urbanos, natureza) com variações sazonais, climáticas e de iluminação, além de condições desafiadoras.
  • Verdade terrestre (ground truth) de profundidade densa em todas as cenas.
  • Alcance de profundidade até ~80 m.
  • Contribui com 61.470 imagens (55.660 de treino / 5.810 de validação) para a mistura de treinamento de profundidade da Ultralytics.

Link to this sectionEstrutura do Dataset#

O conjunto de dados de profundidade TartanAir é dividido em dois subconjuntos:

  1. Train (Treino): 55.660 imagens com mapas de profundidade densos pareados para treinamento.
  2. Val (Validação): 5.810 imagens com mapas de profundidade densos pareados para validação durante o treinamento.

Cada imagem RGB é pareada com um mapa de profundidade .npy float32 armazenando distâncias por pixel em metros, seguindo o formato de dataset de profundidade Ultralytics.

Link to this sectionObter os Dados#

O TartanAir não possui download automático — os dados são distribuídos pelo AirLab da CMU (veja a página do conjunto de dados para os termos) e baixados com os scripts tartanair_tools:

git clone https://github.com/castacks/tartanair_tools && cd tartanair_tools
python download_training.py --output-dir ./data --rgb --depth --only-left --unzip

A profundidade já está armazenada como float32 .npy em metros (depth_left/*_left_depth.npy ao lado de image_left/*_left.png), portanto a conversão é apenas reorganizar e invalidar o céu (renderizado como distâncias extremas; a mistura lançada corta em 80 m para corresponder ao YAML do conjunto de dados). O TartanAir não inclui uma divisão de validação oficial — reserve um ou mais ambientes. Conversão de referência para o formato de conjunto de dados de profundidade da Ultralytics:

import shutil
from pathlib import Path

import numpy as np

VAL_ENVS = {"neighborhood"}  # environments held out for validation
src, dst = Path("data"), Path("datasets/depth-tartanair")
for depth_file in sorted(src.rglob("depth_left/*_left_depth.npy")):
    env, traj = depth_file.parts[-5], depth_file.parts[-3]
    out = "val" if env.lower() in VAL_ENVS else "train"
    (dst / f"images/{out}").mkdir(parents=True, exist_ok=True)
    (dst / f"depth/{out}").mkdir(parents=True, exist_ok=True)
    depth = np.load(depth_file)
    depth[depth > 80.0] = 0.0  # sky/extreme range → 0 = invalid
    frame = depth_file.name.replace("_depth.npy", "")  # e.g. 000000_left
    name = f"{env}_{traj}_{frame}"
    np.save(dst / f"depth/{out}/{name}.npy", depth)
    shutil.copy(depth_file.parents[1] / "image_left" / f"{frame}.png", dst / f"images/{out}/{name}.png")

Link to this sectionPapel no YOLO26-Depth#

O TartanAir é uma das fontes de treinamento na ampla mistura de múltiplos conjuntos de dados (~2,19M de imagens) usada para pré-treinar os modelos YOLO26-Depth da Ultralytics. Dentro desta mistura, o TartanAir contribui com diversidade ambiental sintética e geometria externa de longo alcance que complementam as fontes internas e do mundo real.

Não existe um benchmark independente do TartanAir nesta configuração. Em vez disso, os modelos resultantes são avaliados nos benchmarks padrão de profundidade monocular: NYU Depth V2, KITTI, Make3D, ETH3D e iBims-1.

Link to this sectionYAML do Dataset#

Um arquivo YAML (Yet Another Markup Language) é usado para definir a configuração do conjunto de dados. Ele contém informações sobre os caminhos, classes e outras informações relevantes do conjunto de dados. Para o TartanAir, o arquivo depth-tartanair.yaml define os caminhos e a classe única depth.

ultralytics/cfg/datasets/depth-tartanair.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# TartanAir dataset for monocular depth estimation — synthetic indoor + outdoor (AirSim), dense depth up to ~80 m
# Documentation: https://docs.ultralytics.com/datasets/depth/tartanair
# Example usage: yolo depth train data=depth-tartanair.yaml model=yolo26n-depth.pt
# No autodownload — obtain the source data (see docs) and arrange it as below.
# parent
# ├── ultralytics
# └── datasets
#     └── depth-tartanair
#         ├── images/{train,val}  # RGB images
#         └── depth/{train,val}   # paired *.npy, float32 meters (images/ -> depth/)

path: depth-tartanair # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 55660 images
val: images/val # val images (relative to 'path') 5810 images
max_depth: 80 # (m) maximum valid depth; GT beyond this is excluded from val metrics

nc: 1
names:
  0: depth

channels: 3

Link to this sectionUso#

Para treinar um modelo YOLO26n-Depth no conjunto de dados TartanAir com um tamanho de imagem de 640, você pode usar os seguintes trechos de código. Para uma lista abrangente de argumentos disponíveis, consulte a página de Treinamento do modelo.

Exemplo de Treinamento
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-depth.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="depth-tartanair.yaml", epochs=100, imgsz=640)

Link to this sectionModelos pré-treinados#

A família de profundidade YOLO26 (yolo26n-depth.pt, yolo26s-depth.pt, yolo26m-depth.pt, yolo26l-depth.pt, yolo26x-depth.pt) é baixada automaticamente a partir do lançamento v8.4.0 e é treinada na ampla mistura de múltiplos conjuntos de dados da qual o TartanAir faz parte.

Link to this sectionCitações e Agradecimentos#

Se você usar o conjunto de dados TartanAir em seu trabalho de pesquisa ou desenvolvimento, por favor, cite o seguinte artigo:

Citação
@inproceedings{wang2020tartanair,
      title={TartanAir: A Dataset to Push the Limits of Visual SLAM},
      author={Wenshan Wang and Delong Zhu and Xiangwei Wang and Yaoyu Hu and Yuheng Qiu and Chen Wang and Yafei Hu and Ashish Kapoor and Sebastian Scherer},
      booktitle={IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)},
      year={2020}
}

Gostaríamos de agradecer aos criadores do TartanAir por disponibilizarem este conjunto de dados sintético diversificado para a comunidade de visão computacional.

Contribuidores

Comentários