Ultralytics YOLO27:

Ultralytics YOLO27#

YOLO27 llegará próximamente

Los modelos YOLO27 están en la fase final de I+D y su lanzamiento está previsto para más adelante este año. Los modelos aún no están disponibles y no se ha fijado una fecha de lanzamiento. Esta página ofrece un avance de los próximos modelos; las funciones y las métricas de referencia pueden cambiar antes del lanzamiento. Los ejemplos de código que aparecen a continuación están pensados para usarse cuando se publiquen los modelos y haya compatibilidad con el paquete, y no funcionarán con el paquete público actual. Por ahora, no se publicarán los pesos, las configuraciones ni el código de implementación de los modelos. Únete a la lista de espera de YOLO27 para ser de las primeras personas en enterarte de su lanzamiento.

Resumen#

Ultralytics YOLO27 es una familia de modelos de visión en tiempo real cuyos modelos de detección usan dos diseños complementarios: una arquitectura CNN optimizada para los modelos compactos N y S, y una arquitectura basada en consultas y sin NMS para los modelos más grandes M y L. Ambos diseños se implementan mediante la misma interfaz. De forma predeterminada, los modelos de detección N y S usan el cabezal uno-a-muchos con NMS; usa nms=False para seleccionar su cabezal sin NMS.

YOLO27 es la próxima familia de modelos de la serie YOLO de Ultralytics y sucede a YOLO26. Está disponible en cuatro tamaños —N, S, M y L— y admite detección de objetos, segmentación de instancias, segmentación semántica, estimación de profundidad, clasificación, estimación de pose y detección de objetos orientados. La división en dos diseños se aplica a la detección; las demás tareas usan la arquitectura CNN.

En sus cuatro escalas de detección, YOLO27 alcanza 42.3-60.4 mAP en COCO con una latencia de 0.62-2.32 ms en una NVIDIA RTX PRO 6000; YOLO27l llega hasta 61.2 mAP con una entrada mayor de 800 píxeles. YOLO27l es el primer modelo de Ultralytics que supera los 60 mAP en COCO, mientras que YOLO27n/s mejora la precisión de YOLO26n/s prácticamente a la misma velocidad.

Inicio rápido (tras el lanzamiento)
from ultralytics import YOLO

model = YOLO("yolo27n.pt")  # carga un modelo YOLO27n preentrenado
results = model("path/to/bus.jpg")  # ejecuta la inferencia

Características principales#

  • Detección a dos escalas Los detectores estándar predicen objetos en tres mapas de características: fino, medio y grueso. YOLO27 N y S prescinden del mapa medio y predicen solo en un mapa fino (para objetos pequeños) y uno grueso (para objetos grandes); una escala fija aplicada a las características fusionadas mantiene equilibradas las dos escalas. Esto elimina gran parte del cálculo del cabezal de detección, lo que acelera los modelos y mantiene la misma fiabilidad de entrenamiento que el diseño completo de tres escalas.

  • Mejor detección de objetos pequeños Se amplía la etapa inicial de características de alta resolución para capturar más detalles. Junto con el mapa de predicción fino que se conserva, esto mejora la localización y la regresión de objetos pequeños, la categoría más difícil para los modelos compactos.

  • Supervisión de alineación del primer plano Durante el entrenamiento, una rama ligera adicional aprende a distinguir entre «objeto» y «fondo» en cada ubicación. Está diseñada para reducir la diferencia entre la supervisión más densa uno-a-muchos usada durante el entrenamiento y el cabezal uno-a-uno que genera las predicciones finales: reduce esa diferencia de precisión de 0.9/0.8 mAP en YOLO26n/s a solo 0.4 mAP en YOLO27n/s, de modo que el cabezal uno-a-uno implementado conserva casi toda la precisión obtenida durante el entrenamiento. La rama solo se usa durante el entrenamiento y se elimina para la inferencia y la exportación, por lo que no tiene ningún coste durante la implementación.

  • Detección basada en consultas sin NMS Los modelos más grandes sustituyen la predicción densa por un decodificador Transformer que refina un conjunto fijo de consultas de objetos y genera directamente las detecciones finales, sin necesidad de aplicar la supresión no máxima como posprocesamiento. YOLO27m combina este decodificador con la probada red troncal convolucional de estilo YOLO26, mientras que YOLO27l conserva el mismo cuello FPN/PAN y lo combina con una red troncal UltraViT, que usa autoatención en su etapa más profunda para captar el contexto global.

  • Una interfaz sencilla Ambas arquitecturas se usan mediante la misma interfaz de Python YOLO. El flujo de trabajo adecuado de entrenamiento, validación, predicción y exportación se selecciona automáticamente según el modelo, por lo que el código escrito para una escala de YOLO27 funciona sin cambios con las demás.

¿Qué YOLO27 debería usar?#

Estas recomendaciones sirven para elegir un modelo cuando se publique YOLO27. Para los proyectos actuales, usa YOLO26.

  • YOLO27n / YOLO27s — dispositivos perimetrales, drones y vídeo en tiempo real: son los modelos más rápidos de la familia y mejoran la detección de objetos pequeños gracias al diseño de dos escalas. Consulta NVIDIA Jetson y Raspberry Pi para obtener información sobre la implementación en dispositivos concretos.
  • YOLO27m — el equilibrio ideal entre precisión y velocidad en GPU: mejora la precisión de YOLO26m con una latencia comparable, por lo que es la opción predeterminada para la implementación en GPU en producción.
  • YOLO27l — aplicaciones donde la precisión es fundamental: es el primer modelo de Ultralytics que supera los 60 mAP en COCO, alcanza 61.2 mAP con un tamaño de entrada mayor y mantiene la velocidad en tiempo real en GPU.

Para comparar con otras familias, consulta todos los modelos de Ultralytics. Para medir el equilibrio entre precisión y velocidad en tu propio hardware, en lugar de en el nuestro, consulta el modo Benchmark.


Tareas y modos compatibles#

La tabla siguiente muestra una vista previa de las tareas y los modos que se prevé admitir en las cuatro escalas de modelos YOLO27. Las marcas de verificación indican la compatibilidad prevista para el lanzamiento, no la disponibilidad pública actual; ninguno de los archivos de modelo indicados se ha publicado.

ModeloNombres de archivoTareaEntrenamientoValidaciónInferenceExportar
YOLO27yolo27n.pt yolo27s.pt yolo27m.pt yolo27l.ptDetección✅✅✅✅
YOLO27-segyolo27n-seg.pt yolo27s-seg.pt yolo27m-seg.pt yolo27l-seg.ptSegmentación de instancias✅✅✅✅
YOLO27-semyolo27n-sem.pt yolo27s-sem.pt yolo27m-sem.pt yolo27l-sem.ptSegmentación semántica✅✅✅✅
YOLO27-depthyolo27n-depth.pt yolo27s-depth.pt yolo27m-depth.pt yolo27l-depth.ptEstimación de profundidad✅✅✅✅
YOLO27-clsyolo27n-cls.pt yolo27s-cls.pt yolo27m-cls.pt yolo27l-cls.ptClasificación✅✅✅✅
YOLO27-poseyolo27n-pose.pt yolo27s-pose.pt yolo27m-pose.pt yolo27l-pose.ptPose/Puntos clave✅✅✅✅
YOLO27-obbyolo27n-obb.pt yolo27s-obb.pt yolo27m-obb.pt yolo27l-obb.ptDetección orientada✅✅✅✅

Los modelos YOLO27 de detección, segmentación, pose y OBB también son compatibles con el modo Track, que se ejecuta sobre predict para el seguimiento de varios objetos entre fotogramas de vídeo.

Dos arquitecturas

La detección de YOLO27 usa dos diseños con una misma interfaz: las escalas N y S usan la arquitectura CNN optimizada, mientras que las escalas M y L usan la arquitectura basada en consultas y sin NMS. Las demás tareas usan la arquitectura CNN.


Métricas de rendimiento#

La precisión de detección se mide en el conjunto de validación de COCO. Consulta Métricas de rendimiento de YOLO para ver explicaciones de mAP, precisión y exhaustividad. La velocidad de inferencia se mide en una NVIDIA RTX PRO 6000 (TensorRT 11, FP16) para GPU y en un AMD EPYC 9655 (ONNX Runtime, FP32) para CPU. Tras el lanzamiento, se podrán reproducir las cifras de precisión con yolo val model=yolo27n.pt data=coco.yaml.

Resultados preliminares

Estos resultados de investigación pueden cambiar durante la fase final de I+D. Los pesos públicos y las instrucciones para reproducir los resultados se publicarán junto con el lanzamiento.

Rendimiento

Consulta la documentación de detección para ver ejemplos de uso de estos modelos entrenados con COCO, que incluyen 80 clases preentrenadas. La tabla usa una entrada de 640 píxeles; el resumen también muestra YOLO27l con 800 píxeles.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
RTX PRO 6000 TensorRT11
(ms)
parámetros
(M)
FLOPs
(B)
YOLO27n64042.316.1 ± 1.60.62 ± 0.003.07.2
YOLO27s64049.633.2 ± 0.10.79 ± 0.0011.828.2
YOLO27m64055.867.2 ± 0.31.39 ± 0.0022.865.0
YOLO27l64060.4149.6 ± 1.42.32 ± 0.0072.3165.3

Los valores de parámetros y FLOPs corresponden al modelo fusionado tras plegar Conv/BatchNorm y eliminar la rama de detección no utilizada. Para la detección, las mediciones de velocidad seleccionan el cabezal sin NMS con nms=False; la precisión de N/S depende del cabezal seleccionado. Los puntos de control preentrenados conservan la arquitectura completa de entrenamiento y pueden mostrar recuentos más altos.


Ejemplos de uso#

Esta sección incluye ejemplos sencillos de entrenamiento e inferencia con YOLO27. Para consultar la documentación completa sobre estos y otros modos, consulta las páginas de documentación de Predicción, Entrenamiento, Validación y Exportación. Para trabajar con conjuntos de datos personalizados, consulta Consejos para obtener los mejores resultados de entrenamiento y la Guía de ajuste de hiperparámetros.

Ten en cuenta que el siguiente ejemplo corresponde a los modelos de detección de YOLO27 para la detección de objetos. Para consultar otras tareas compatibles, consulta la documentación de segmentación y clasificación.

Entrenamiento e inferencia (tras el lanzamiento)

Puedes pasar modelos preentrenados de PyTorch *.pt, así como archivos de configuración *.yaml, a la clase YOLO() para crear una instancia del modelo en Python:

from ultralytics import YOLO

# Carga un modelo YOLO27n preentrenado con COCO
model = YOLO("yolo27n.pt")

# Ejecuta la inferencia con el modelo YOLO27n en la imagen 'bus.jpg'
results = model("path/to/bus.jpg")

# Entrena el modelo con el conjunto de datos de ejemplo COCO8 durante 100 épocas
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

Preguntas frecuentes#

    • Detección a dos escalas (N/S): elimina el mapa de predicción intermedio para acelerar el cabezal sin perder una precisión competitiva
    • Mejor detección de objetos pequeños (N/S): una etapa inicial de características más amplia mejora la localización de objetos pequeños
    • Supervisión de alineación del primer plano (N/S): reduce la diferencia de precisión entre uno-a-muchos y uno-a-uno de 0,9/0,8 mAP en YOLO26n/s a 0,4 mAP en YOLO27n/s, sin coste de inferencia
    • Detección sin NMS basada en consultas (M/L): un decodificador Transformer genera directamente las detecciones finales
    • Una única interfaz sencilla: ambas arquitecturas se ejecutan con la misma clase YOLO
  • Todavía no: YOLO27 no se ha lanzado. Sigue usando YOLO26 en tus proyectos actuales. Los resultados preliminares muestran una mayor precisión en todos los tamaños de modelo, y YOLO27l supera los 60 mAP en COCO. Antes de migrar, evalúa los modelos finales publicados con tu carga de trabajo.

  • Tras el lanzamiento, YOLO27 está diseñado para usar la misma clase YOLO y la misma API de entrenamiento/validación/predicción/exportación que YOLO26: el modelo selecciona automáticamente el pipeline adecuado (CNN o basado en consultas). Cuando estén disponibles la compatibilidad con YOLO27 y sus pesos, el cambio previsto para seleccionar el modelo consiste en sustituir yolo26n.pt por yolo27n.pt.

  • La mayoría de los detectores predicen a partir de tres mapas de características con distintas resoluciones. YOLO27 N y S conservan el mapa de alta resolución del que dependen los objetos pequeños y el mapa de baja resolución que necesitan los objetos grandes, y omiten el intermedio. Esto reduce una parte considerable del cálculo del cabezal de detección, mientras que las mejoras de entrenamiento mencionadas mantienen una relación competitiva entre precisión y latencia.

  • YOLO27l es el primer modelo de Ultralytics que supera los 60 mAP en COCO: alcanza 60,4 mAP con una entrada de 640 píxeles (2,3 ms en una NVIDIA RTX PRO 6000) y 61,2 mAP con una entrada de 800 píxeles (2,9 ms). Combina la arquitectura troncal UltraViT, la fusión de características a varias escalas y un detector basado en consultas que genera directamente las detecciones finales, sin NMS.

  • YOLO27 se encuentra en la fase final de I+D y se prevé su lanzamiento para más adelante este año. Todavía no se ha fijado una fecha. Los pesos del modelo y el código de implementación aún no están disponibles públicamente.

  • Cuando se lance YOLO27, consulta la guía de inicio rápido para instalar o actualizar el paquete ultralytics y, a continuación, carga un modelo como se muestra a continuación. Este ejemplo es para usarlo después del lanzamiento:

    from ultralytics import YOLO
    
    # Carga un modelo nano YOLO27 preentrenado
    model = YOLO("yolo27n.pt")
    
    # Ejecuta la inferencia en una imagen
    results = model("image.jpg")

    Consulta los ejemplos de uso para ver ejemplos de entrenamiento e inferencia, o las guías de validación y exportación para esos modos.

Comentarios