Ultralytics YOLO27:

YOLOv8 frente a RTDETRv2#

El panorama de la visión artificial evoluciona constantemente, con nuevas arquitecturas que amplían los límites de lo posible en la detección de objetos en tiempo real. Dos modelos destacados que han suscitado un gran interés son Ultralytics YOLOv8 y RTDETRv2 de Baidu. Esta guía ofrece una comparación técnica exhaustiva entre estos dos potentes modelos y analiza sus arquitecturas, métricas de rendimiento y escenarios de implementación ideales.

Descripción general de YOLOv8#

Ultralytics YOLOv8 representa un hito importante en la familia de modelos YOLO (solo miras una vez). Se basa en años de investigación fundamental para ofrecer una velocidad, precisión y facilidad de uso excepcionales en una amplia variedad de tareas.

Características principales:

Arquitectura y puntos fuertes#

YOLOv8 introduce una arquitectura optimizada que mejora tanto la extracción de características como la regresión de cuadros delimitadores. Es un detector sin anchors, lo que simplifica la cabeza de predicción y reduce el número de ajustes de hiperparámetros necesarios durante el entrenamiento. Esta arquitectura garantiza un excelente equilibrio de rendimiento entre la velocidad de inferencia y la precisión media promedio (mAP), por lo que resulta especialmente adecuada para implementaciones reales tanto en dispositivos edge como en servidores en la nube.

Además, YOLOv8 necesita muchos menos recursos de memoria durante el entrenamiento que las arquitecturas basadas en transformadores. Esto permite a los desarrolladores entrenar modelos en GPU de consumo estándar sin encontrarse con errores de memoria insuficiente.

Versatilidad#

Una de las principales fortalezas de YOLOv8 es su versatilidad nativa. Mientras que muchos modelos se centran exclusivamente en los cuadros delimitadores, YOLOv8 ofrece compatibilidad integrada con la detección de objetos, la segmentación de instancias, la clasificación de imágenes, la estimación de pose y la detección mediante cuadros delimitadores orientados (OBB).

Descripción general de RTDETRv2#

RTDETRv2 (Transformer de detección en tiempo real, versión 2) se basa en el RT-DETR original y pretende llevar los potentes mecanismos de atención de los Vision Transformers a las aplicaciones de detección de objetos en tiempo real.

Características principales:

Arquitectura y puntos fuertes#

RTDETRv2 utiliza una arquitectura híbrida que combina una red neuronal convolucional (CNN) como backbone con una estructura de codificador-decodificador basada en transformadores. Esto permite al modelo capturar relaciones espaciales complejas y el contexto global mediante mecanismos de autoatención. Al utilizar un conjunto de estrategias de entrenamiento de "ventajas gratuitas", RTDETRv2 logra puntuaciones de mAP competitivas en conjuntos de datos de referencia estándar como el conjunto de datos COCO.

Puntos débiles#

A pesar de su elevada precisión, la naturaleza basada en transformadores de RTDETRv2 introduce un mayor consumo de memoria y tiempos de entrenamiento más lentos en comparación con las arquitecturas CNN puras. Los transformadores requieren intrínsecamente más VRAM, lo que dificulta su entrenamiento en hardware con recursos limitados. Además, aunque RTDETRv2 ofrece un gran rendimiento en detección, carece de la versatilidad multitarea —como pose y segmentación— inherente al ecosistema de Ultralytics.

Aprende más sobre RTDETRv2

Comparación de rendimiento#

Al evaluar modelos para producción, el equilibrio entre el tamaño del modelo, la velocidad de inferencia y la precisión es fundamental. La tabla siguiente ofrece una comparación directa de las variantes de YOLOv8 y RTDETRv2.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Hardware y métricas

Las velocidades se midieron utilizando una instancia de Amazon EC2 P4d. La inferencia en CPU utilizó ONNX, mientras que las velocidades en GPU se probaron con TensorRT.

Casos de uso y recomendaciones#

La elección entre YOLOv8 y RT-DETR depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.

Cuándo elegir YOLOv8#

YOLOv8 es una buena opción para:

  • Implementación multitarea versátil: Proyectos que requieren un modelo probado para detección, segmentación, clasificación y estimación de pose dentro del ecosistema de Ultralytics.
  • Sistemas de producción consolidados: Entornos de producción existentes ya creados sobre la arquitectura YOLOv8, con canalizaciones de implementación estables y bien probadas.
  • Amplio respaldo de la comunidad y el ecosistema: Aplicaciones que se benefician de los numerosos tutoriales de YOLOv8, integraciones de terceros y recursos activos de la comunidad.

Cuándo elegir RT-DETR#

RT-DETR se recomienda para:

  • Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
  • Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
  • Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

La ventaja de Ultralytics#

Elegir un modelo va más allá de las métricas en bruto; el ecosistema de software que lo rodea es crucial para la productividad de los desarrolladores. El ecosistema de Ultralytics es conocido por su facilidad de uso y proporciona una API de Python unificada que simplifica todo el ciclo de vida del aprendizaje automático.

Desde la gestión de conjuntos de datos hasta el entrenamiento distribuido, Ultralytics abstrae el complejo código repetitivo. Los desarrolladores se benefician de pesos preentrenados disponibles y de una integración fluida con plataformas como Hugging Face y herramientas de monitorización. Este ecosistema bien mantenido garantiza un desarrollo activo, actualizaciones frecuentes y un sólido apoyo de la comunidad.

Además, la eficiencia del entrenamiento es una característica distintiva de los modelos YOLO de Ultralytics. Están altamente optimizados para converger rápidamente y ocupar menos memoria durante el proceso de entrenamiento, lo que acelera considerablemente los ciclos de experimentación en comparación con detectores basados en transformadores como RTDETRv2.

De cara al futuro: el potencial de YOLO26#

Aunque YOLOv8 sigue siendo un modelo muy potente, los desarrolladores que busquen la tecnología más avanzada deberían considerar actualizarse al esperado YOLO26, lanzado en enero de 2026. YOLO26 redefine el estado del arte con varias innovaciones revolucionarias:

  • Diseño de extremo a extremo sin NMS: YOLO26 elimina el posprocesamiento de supresión no máxima (NMS), lo que da lugar a flujos de trabajo de implementación más rápidos y deterministas.
  • Eliminación de DFL: La eliminación de la pérdida focal de distribución simplifica el modelo para mejorar su compatibilidad con dispositivos edge y de bajo consumo.
  • Optimizador MuSGD: Al integrar innovaciones del entrenamiento de LLM, el optimizador MuSGD garantiza ejecuciones de entrenamiento más estables y una convergencia más rápida.
  • Hasta un 43 % más de velocidad en la inferencia en CPU: Altamente optimizado para entornos sin GPU dedicadas.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, algo fundamental para las imágenes aéreas y la robótica.

Otras alternativas modernas que merece la pena explorar dentro de la gama de Ultralytics son YOLO11, que ofrece un rendimiento sólido para proyectos heredados, aunque se recomienda YOLO26 para todas las implementaciones nuevas.

Ejemplo de código: entrenamiento e inferencia#

La sencillez de la API de Ultralytics permite cargar, entrenar e implementar modelos con solo unas pocas líneas de código Python. Asegúrate de tener PyTorch instalado antes de ejecutar el ejemplo siguiente.

from ultralytics import YOLO

# Load a pretrained YOLOv8 small model
model = YOLO("yolov8s.pt")

# Train the model on your custom dataset
# Memory efficient training allows for larger batch sizes
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)

# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")

# Display the results
results[0].show()

# Export seamlessly for edge deployment
export_path = model.export(format="onnx")
Listo para la implementación

Ultralytics admite exportaciones con un solo clic a numerosos formatos, incluidos ONNX, TensorRT y CoreML, lo que simplifica las opciones de implementación de modelos en distintas arquitecturas de hardware.

Conclusión#

Tanto YOLOv8 como RTDETRv2 ofrecen capacidades muy útiles para la detección de objetos en tiempo real. RTDETRv2 demuestra la potencia de los transformadores para capturar el contexto global, por lo que resulta adecuado para tareas complejas de razonamiento espacial en las que la velocidad de inferencia y la sobrecarga de memoria no son las principales limitaciones.

Sin embargo, para los desarrolladores que priorizan un equilibrio excepcional entre velocidad, precisión y eficiencia de recursos, los modelos YOLO de Ultralytics siguen siendo la opción superior. La naturaleza ligera de YOLOv8, combinada con su facilidad de uso incomparable, su versatilidad en múltiples tareas de visión y un próspero ecosistema de código abierto, lo convierte en la solución de referencia para entornos de producción escalables. Para quienes buscan el máximo rendimiento en edge, el recién lanzado YOLO26 ofrece una eficiencia sin NMS inigualable que sigue liderando el sector.

Comentarios