YOLO Vision 2026:

Resumen de datasets#

Ultralytics ofrece compatibilidad con varios conjuntos de datos para facilitar tareas de visión artificial como la detección, la segmentación de instancias, la segmentación semántica, la estimación de profundidad, la estimación de postura, la clasificación y el seguimiento de múltiples objetos. A continuación, se presenta una lista de los principales conjuntos de datos de Ultralytics, seguida de un resumen de cada tarea de visión artificial y sus respectivos conjuntos de datos.



Watch: Ultralytics Datasets Overview

Detección de objetos#

La detección de objetos mediante cuadro delimitador es una técnica de visión artificial que consiste en detectar y localizar objetos en una imagen dibujando un cuadro delimitador alrededor de cada objeto.

  • African-wildlife: Un conjunto de datos que incluye imágenes de fauna salvaje africana, como búfalos, elefantes, rinocerontes y cebras.
  • Argoverse: Un conjunto de datos que contiene datos de seguimiento 3D y previsión de movimiento de entornos urbanos con anotaciones detalladas.
  • Brain-tumor: Un conjunto de datos para detectar tumores cerebrales que incluye imágenes de resonancia magnética o tomografía computarizada con detalles sobre la presencia, ubicación y características del tumor.
  • COCO: Common Objects in Context (COCO) es un conjunto de datos a gran escala para la detección, segmentación y generación de subtítulos de objetos con 80 categorías de objetos.
  • COCO8: Un subconjunto más pequeño de las primeras 4 imágenes de COCO train y COCO val, adecuado para pruebas rápidas.
  • COCO8-Grayscale: Una versión en escala de grises de COCO8 creada convirtiendo RGB a escala de grises, útil para la evaluación de modelos de un solo canal.
  • COCO8-Multispectral: Una versión multiespectral de 10 canales de COCO8 creada interpolando longitudes de onda RGB, útil para la evaluación de modelos con conciencia espectral.
  • COCO128: Un subconjunto más pequeño de las primeras 128 imágenes de COCO train2017, adecuado para pruebas.
  • Construction-PPE: Un conjunto de datos de imágenes de obras de construcción anotadas con equipo de seguridad clave como cascos, chalecos, guantes, botas y gafas, junto con etiquetas para el equipo faltante, lo que apoya el desarrollo de modelos de IA para el cumplimiento normativo y la protección de los trabajadores.
  • Global Wheat 2020: Un conjunto de datos que contiene imágenes de espigas de trigo para el Global Wheat Challenge 2020.
  • HomeObjects-3K: Un conjunto de datos de escenas de interiores anotadas que incluye 12 artículos domésticos comunes, ideal para desarrollar y probar modelos de visión artificial en sistemas de hogares inteligentes, robótica y realidad aumentada.
  • KITTI New: Un conocido conjunto de datos de conducción autónoma que incluye entradas estéreo, LiDAR y GPS/IMU, utilizado para la detección de objetos 2D en diversas escenas viales.
  • LVIS: Un conjunto de datos a gran escala de detección de objetos, segmentación y generación de subtítulos con 1203 categorías de objetos.
  • Medical-pills: Un conjunto de datos que contiene imágenes etiquetadas de pastillas medicinales, diseñado para ayudar en tareas como el control de calidad farmacéutico, la clasificación y la garantía del cumplimiento de los estándares de la industria.
  • Objects365: Un conjunto de datos de alta calidad y gran escala para la detección de objetos con 365 categorías de objetos y más de 600K imágenes anotadas.
  • OpenImagesV7: Un conjunto de datos completo de Google con 1.7M de imágenes de entrenamiento y 42k imágenes de validación.
  • RF100: Una referencia diversa de detección de objetos con 100 conjuntos de datos que abarcan siete dominios de imágenes para una evaluación integral de modelos.
  • Signature: Un conjunto de datos con imágenes de varios documentos con firmas anotadas, que respalda la verificación de documentos y la investigación de detección de fraudes.
  • SKU-110K: Un conjunto de datos que presenta detección de objetos densos en entornos comerciales con más de 11.000 imágenes y 1,7 millones de cuadros delimitadores.
  • VisDrone: Un conjunto de datos que contiene datos de detección de objetos y seguimiento de múltiples objetos a partir de imágenes capturadas por drones con más de 10K imágenes y secuencias de video.
  • VOC: El conjunto de datos Pascal Visual Object Classes (VOC) para la detección y segmentación de objetos con 20 clases de objetos y más de 11K imágenes.
  • xView: Un conjunto de datos para la detección de objetos en imágenes aéreas con 60 categorías de objetos y más de 1 millón de objetos anotados.

Instance Segmentation#

La segmentación de instancias es una técnica de visión artificial que consiste en identificar y localizar objetos en una imagen a nivel de píxel. A diferencia de la segmentación semántica, que solo clasifica cada píxel, la segmentación de instancias distingue entre diferentes instancias de la misma clase.

  • Carparts-seg: Un conjunto de datos diseñado específicamente para identificar piezas de vehículos, que satisface las necesidades de diseño, fabricación e investigación. Sirve tanto para tareas de detección de objetos como de segmentación.
  • COCO: Un conjunto de datos a gran escala diseñado para tareas de detección de objetos, segmentación y generación de subtítulos con más de 200.000 imágenes etiquetadas.
  • COCO8-seg: Un conjunto de datos más pequeño para tareas de segmentación de instancias, que contiene un subconjunto de 8 imágenes de COCO con anotaciones de segmentación.
  • COCO128-seg: Un conjunto de datos más pequeño para tareas de segmentación de instancias, que contiene un subconjunto de 128 imágenes de COCO con anotaciones de segmentación.
  • Crack-seg: Un conjunto de datos creado específicamente para detectar grietas en carreteras y paredes, aplicable tanto para tareas de detección de objetos como de segmentación.
  • Package-seg: Un conjunto de datos adaptado para identificar paquetes en almacenes o entornos industriales, adecuado para aplicaciones tanto de detección de objetos como de segmentación.

Semantic Segmentation#

La segmentación semántica asigna una etiqueta de clase a cada píxel en una imagen, produciendo mapas de escenas densos para aplicaciones como la conducción autónoma, el análisis de escenas y el mapeo de cobertura terrestre.

  • Cityscapes: Conjunto de datos de segmentación semántica de escenas urbanas callejeras con 19 clases de entrenamiento.
  • Cityscapes8: Un subconjunto compacto de Cityscapes de 8 imágenes para comprobaciones rápidas de canalizaciones de segmentación semántica.
  • ADE20K: Conjunto de datos de análisis de escenas con 150 clases semánticas.

Depth Estimation#

La estimación de profundidad monocular predice un mapa de profundidad por píxel en metros a partir de una única imagen RGB, permitiendo la reconstrucción de escenas 3D, navegación de robots y aplicaciones de AR/VR.

  • NYU Depth V2: Referencia estándar de profundidad en interiores capturada con un Microsoft Kinect v1.
  • KITTI: Escenas del mundo real de conducción autónoma en exteriores con profundidad Velodyne LiDAR.
  • Depth8: Un subconjunto compacto de SUN RGB-D de 8 imágenes para comprobaciones rápidas de canalizaciones.

Pose Estimation#

La estimación de poses es una técnica utilizada para determinar la pose de un objeto en relación con la cámara o el sistema de coordenadas del mundo. Esto implica identificar puntos clave o articulaciones en los objetos, particularmente en humanos o animales.

  • COCO: Un conjunto de datos a gran escala con anotaciones de posturas humanas diseñado para tareas de estimación de posturas.
  • COCO8-pose: Un conjunto de datos más pequeño para tareas de estimación de posturas, que contiene un subconjunto de 8 imágenes de COCO con anotaciones de posturas humanas.
  • Dog-pose: Un conjunto de datos completo que incluye aproximadamente 8500 imágenes centradas en perros, anotadas con 24 puntos clave por perro, adaptado para tareas de estimación de posturas.
  • Hand-Keypoints: Un conjunto de datos conciso que incluye más de 26.000 imágenes centradas en manos humanas, anotadas con 21 puntos clave por mano, diseñado para tareas de estimación de posturas.
  • Tiger-pose: Un conjunto de datos compacto que consta de 263 imágenes centradas en tigres, anotadas con 12 puntos clave por tigre para tareas de estimación de posturas.

Classification#

La clasificación de imágenes es una tarea de visión artificial que consiste en clasificar una imagen en una o más clases o categorías predefinidas según su contenido visual.

  • Caltech 101: Un conjunto de datos que contiene imágenes de 101 categorías de objetos para tareas de clasificación de imágenes.
  • Caltech 256: Una versión extendida de Caltech 101 con 256 categorías de objetos e imágenes más desafiantes.
  • CIFAR-10: Un conjunto de datos de 60.000 imágenes en color de 32x32 en 10 clases, con 6000 imágenes por clase.
  • CIFAR-100: Una versión extendida de CIFAR-10 con 100 categorías de objetos y 600 imágenes por clase.
  • Fashion-MNIST: Un conjunto de datos que consta de 70.000 imágenes en escala de grises de 10 categorías de moda para tareas de clasificación de imágenes.
  • ImageNet: Un conjunto de datos a gran escala para la detección de objetos y la clasificación de imágenes con más de 14 millones de imágenes y 20.000 categorías.
  • ImageNet-10: Un subconjunto más pequeño de ImageNet con 10 categorías para una experimentación y pruebas más rápidas.
  • Imagenette: Un subconjunto más pequeño de ImageNet que contiene 10 clases fácilmente distinguibles para un entrenamiento y pruebas más rápidos.
  • Imagewoof: Un subconjunto más desafiante de ImageNet que contiene 10 categorías de razas de perros para tareas de clasificación de imágenes.
  • MNIST: Un conjunto de datos de 70.000 imágenes en escala de grises de dígitos escritos a mano para tareas de clasificación de imágenes.
  • MNIST160: Las primeras 8 imágenes de cada dígito (0-9) de las divisiones de entrenamiento y prueba de MNIST. El conjunto de datos contiene 160 imágenes en total.

Cajas Delimitadoras Orientadas (OBB)#

Los Bounding boxes orientados (OBB) son un método en visión artificial para detectar objetos inclinados en imágenes mediante cajas delimitadoras rotadas, aplicadas a menudo a imágenes aéreas y satelitales. A diferencia de los bounding boxes tradicionales, los OBB pueden ajustarse mejor a objetos con diversas orientaciones.

  • DOTA-v2: Un popular conjunto de datos de imágenes aéreas OBB con 1,7 millones de instancias y 11.268 imágenes.
  • DOTA8: Un subconjunto más pequeño de las primeras 8 imágenes del conjunto de división DOTAv1, 4 para entrenamiento y 4 para validación, adecuado para pruebas rápidas.
  • DOTA128: Un subconjunto de 128 imágenes del conjunto de datos DOTA con 128 imágenes para entrenamiento y validación, que ofrece un buen equilibrio entre tamaño y diversidad para probar modelos OBB.

Seguimiento de Múltiples Objetos#

El seguimiento de múltiples objetos es una técnica de visión artificial que implica detectar y rastrear múltiples objetos a lo largo del tiempo en una secuencia de vídeo. Esta tarea amplía la detección de objetos manteniendo identidades consistentes de los objetos a través de los fotogramas.

  • Argoverse: Un conjunto de datos que contiene datos de seguimiento 3D y previsión de movimiento de entornos urbanos con ricas anotaciones para tareas de seguimiento de múltiples objetos.
  • VisDrone: Un conjunto de datos que contiene datos de detección de objetos y seguimiento de múltiples objetos a partir de imágenes capturadas por drones con más de 10K imágenes y secuencias de video.

Contribuye con nuevos datasets#

Contribuir con un nuevo dataset implica varios pasos para asegurar que se alinee bien con la infraestructura existente. A continuación, se detallan los pasos necesarios:



Watch: How to Contribute to Ultralytics Datasets

Pasos para contribuir con un nuevo dataset#

  1. Recopila imágenes: Reúne las imágenes que pertenecen al dataset. Pueden provenir de varias fuentes, como bases de datos públicas o tu propia colección.

  2. Anota imágenes: Anota estas imágenes con bounding boxes, segmentos o puntos clave, dependiendo de la tarea.

  3. Exportar anotaciones: Convierte estas anotaciones al formato de archivo YOLO *.txt que admite Ultralytics.

  4. Organizar el conjunto de datos: Organiza tu conjunto de datos en la estructura de carpetas correcta. Debes tener los directorios de nivel superior images/ y labels/, y dentro de cada uno, un subdirectorio train/ y val/.

    dataset/
    ├── images/
    │   ├── train/
    │   └── val/
    └── labels/
        ├── train/
        └── val/
  5. Crear un archivo data.yaml: En el directorio raíz de tu conjunto de datos, crea un archivo data.yaml que describa el conjunto de datos, las clases y otra información necesaria.

  6. Optimiza imágenes (opcional): Si deseas reducir el tamaño del dataset para un procesamiento más eficiente, puedes optimizar las imágenes utilizando el siguiente código. Esto no es obligatorio, pero se recomienda para tamaños de dataset más pequeños y velocidades de descarga más rápidas.

  7. Comprime el dataset: Comprime toda la carpeta del dataset en un archivo zip.

  8. Documentar y PR: Crea una página de documentación que describa tu conjunto de datos y cómo encaja en el marco existente. Después de eso, envía una solicitud de extracción (PR). Consulta las Pautas de contribución de Ultralytics para obtener más detalles sobre cómo enviar un PR.

Ejemplo de código para optimizar y comprimir un dataset#

Optimiza y comprime un dataset
   from pathlib import Path

   from ultralytics.data.utils import compress_one_image
   from ultralytics.utils.downloads import zip_directory

   # Define dataset directory
   path = Path("path/to/dataset")

   # Optimize images in dataset (optional)
   for f in path.rglob("*.jpg"):
       compress_one_image(f)

   # Zip dataset into 'path/to/dataset.zip'
   zip_directory(path)

Siguiendo estos pasos, puedes contribuir con un nuevo dataset que se integre bien con la estructura existente de Ultralytics.

FAQ#

  • Ultralytics admite una gran variedad de conjuntos de datos para la detección de objetos, que incluyen:

    • COCO: Un conjunto de datos a gran escala para la detección de objetos, segmentación y generación de subtítulos con 80 categorías de objetos.
    • LVIS: Un extenso conjunto de datos con 1203 categorías de objetos, diseñado para una detección de objetos y segmentación más detalladas.
    • Argoverse: Un conjunto de datos que contiene datos de seguimiento 3D y previsión de movimiento de entornos urbanos con anotaciones detalladas.
    • VisDrone: Un conjunto de datos con datos de detección de objetos y seguimiento de múltiples objetos a partir de imágenes capturadas por drones.
    • SKU-110K: Incluye detección de objetos densos en entornos comerciales con más de 11.000 imágenes.

    Estos conjuntos de datos facilitan el entrenamiento de modelos robustos de Ultralytics YOLO para diversas aplicaciones de detección de objetos.

  • Contribuir con un nuevo dataset implica varios pasos:

    1. Recopila imágenes: Reúne imágenes de bases de datos públicas o colecciones personales.
    2. Anota imágenes: Aplica bounding boxes, segmentos o puntos clave, según la tarea.
    3. Exportar anotaciones: Convierte las anotaciones al formato YOLO *.txt.
    4. Organizar el conjunto de datos: Utiliza la estructura de carpetas con los directorios train/ y val/, cada uno de los cuales contiene los subdirectorios images/ y labels/.
    5. Crear un archivo data.yaml: Incluye descripciones del conjunto de datos, clases y otra información relevante.
    6. Optimiza imágenes (opcional): Reduce el tamaño del dataset para mayor eficiencia.
    7. Comprime el dataset: Comprime el dataset en un archivo zip.
    8. Documentar y PR: Describir tu conjunto de datos y envía una solicitud de extracción siguiendo las Pautas de contribución de Ultralytics.

    Visita Contribuir con nuevos conjuntos de datos para obtener una guía completa.

  • Ultralytics Platform ofrece potentes funciones para la gestión y el análisis de conjuntos de datos, que incluyen:

    • Gestión integral de datasets: Sube, organiza y gestiona tus datasets en un solo lugar.
    • Integración inmediata para el entrenamiento: Usa datasets subidos directamente para el entrenamiento de modelos sin necesidad de configuración adicional.
    • Herramientas de visualización: Explora y visualiza las imágenes y anotaciones de tu dataset.
    • Análisis de datasets: Obtén información sobre la distribución y las características de tu dataset.

    La plataforma agiliza la transición de la gestión de conjuntos de datos al entrenamiento de modelos, haciendo que todo el proceso sea más eficiente. Obtén más información sobre los Conjuntos de datos de Ultralytics Platform.

  • Los modelos Ultralytics YOLO ofrecen varias características únicas para tareas de visión artificial:

    • Rendimiento en tiempo real: Capacidades de inferencia y entrenamiento de alta velocidad para aplicaciones sensibles al tiempo.
    • Versatilidad: Soporte para tareas de detección, segmentación de instancias, segmentación semántica, estimación de profundidad, clasificación y estimación de pose en un marco unificado.
    • Modelos preentrenados: Acceso a modelos preentrenados de alto rendimiento para diversas aplicaciones, reduciendo el tiempo de entrenamiento.
    • Amplio apoyo de la comunidad: Comunidad activa y documentación exhaustiva para la resolución de problemas y el desarrollo.
    • Fácil integración: API sencilla para integrar con proyectos y flujos de trabajo existentes.

    Descubre más sobre los modelos YOLO en la página de Modelos de Ultralytics.

  • Para optimizar y comprimir un dataset usando las herramientas de Ultralytics, sigue este código de ejemplo:

    Optimiza y comprime un dataset
    from pathlib import Path
    
    from ultralytics.data.utils import compress_one_image
    from ultralytics.utils.downloads import zip_directory
    
    # Define dataset directory
    path = Path("path/to/dataset")
    
    # Optimize images in dataset (optional)
    for f in path.rglob("*.jpg"):
        compress_one_image(f)
    
    # Zip dataset into 'path/to/dataset.zip'
    zip_directory(path)

    Este proceso ayuda a reducir el tamaño del conjunto de datos para un almacenamiento más eficiente y velocidades de descarga más rápidas. Obtén más información sobre cómo optimizar y comprimir un conjunto de datos en ZIP.

Comentarios