Ultralytics YOLO27:

YOLOv5 frente a YOLO11#

Al elegir la arquitectura de visión por computador adecuada para un proyecto nuevo, es crucial comprender la evolución de los modelos más avanzados. La progresión desde las primeras arquitecturas hasta los marcos unificados modernos pone de manifiesto avances significativos tanto en la eficiencia algorítmica como en la experiencia del desarrollador. Esta guía ofrece una comparación técnica exhaustiva entre dos modelos emblemáticos desarrollados por Ultralytics: el pionero YOLOv5 y el altamente perfeccionado YOLO11.

Introducción a los modelos#

Ambas arquitecturas representan hitos significativos en el campo de la detección de objetos en tiempo real y ofrecen ventajas distintas según tu entorno de implementación y los requisitos de compatibilidad con sistemas heredados.

YOLOv5: el caballo de batalla del sector#

Lanzado en el verano de 2020, YOLOv5 se convirtió rápidamente en un estándar del sector gracias a su implementación nativa en PyTorch, que redujo drásticamente la barrera de entrada para el entrenamiento y la implementación. Se alejó de los complejos marcos C de Darknet de sus predecesores y ofreció un enfoque basado en Python para crear modelos.

YOLOv5 estableció una sólida base de facilidad de uso e introdujo potentes metodologías de entrenamiento, como la ampliación avanzada de datos mediante mosaicos y el anclaje automático. Sigue siendo muy popular entre los investigadores que desarrollan sobre una base de código bien documentada y ampliamente probada.

YOLO11: el marco unificado de visión#

A partir de años de comentarios y de investigación arquitectónica, YOLO11 se presentó como parte de un marco unificado capaz de gestionar de forma nativa múltiples tareas de visión. Diseñado desde cero para ofrecer la máxima versatilidad y eficiencia, va más allá de los simples cuadros delimitadores.

YOLO11 ofrece una experiencia de usuario optimizada mediante el paquete de Python ultralytics, con una API sencilla que unifica la detección de objetos, la segmentación de instancias, la clasificación, la estimación de poses y los cuadros delimitadores orientados (OBB). Logra un equilibrio muy favorable entre velocidad y precisión, por lo que resulta ideal para diversos escenarios de implementación en el mundo real.

Plataforma integrada

Ambos modelos se benefician del ecosistema bien mantenido que proporciona la Ultralytics Platform. Este entorno integrado simplifica la anotación de conjuntos de datos, el entrenamiento en la nube y la exportación de modelos para distintos destinos de hardware.

Comparación de rendimiento y métricas#

Una comparación directa de estos modelos muestra cómo las mejoras arquitectónicas se traducen en ganancias de rendimiento tangibles. La tabla siguiente ilustra la precisión media promedio (mAP) evaluada en el conjunto de datos COCO, junto con las velocidades de inferencia en CPU y GPU y el número de parámetros.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

Análisis de los resultados#

Las métricas ponen de manifiesto un claro salto en el equilibrio de rendimiento logrado por YOLO11. Por ejemplo, el modelo YOLO11n (nano) alcanza un 39,5 % de mAP frente al 28,0 % de YOLOv5n, al tiempo que reduce el tiempo de inferencia en CPU cuando se exporta mediante ONNX. Además, YOLO11 mantiene unos requisitos de memoria durante el entrenamiento considerablemente inferiores a los de los modelos basados en Transformer de gran tamaño, lo que facilita enormemente su implementación en hardware de consumo y dispositivos periféricos.

Diferencias arquitectónicas#

Las mejoras de rendimiento de YOLO11 se deben a varias evoluciones arquitectónicas clave. Mientras que YOLOv5 utilizaba un backbone CSPNet estándar con módulos C3, YOLO11 introdujo bloques de extracción de características más eficientes, como C2f y posteriormente C3k2, que optimizan el flujo de gradientes y reducen la sobrecarga computacional.

YOLO11 también incorpora una head muy perfeccionada. En lugar del diseño basado en anclajes de los modelos anteriores, las arquitecturas más recientes de Ultralytics adoptan un enfoque sin anclajes. Esto reduce el número de predicciones de cuadros, optimiza la canalización de posprocesamiento y mejora la capacidad del modelo para generalizar en distintas escalas y proporciones de aspecto. Además, estos modelos ofrecen una eficiencia de entrenamiento superior y pesos preentrenados disponibles que aceleran la convergencia de los conjuntos de datos ajustados.

Implementación y ejemplos de código#

Una de las características más destacadas del ecosistema de Ultralytics es su sencillez. Aunque YOLOv5 popularizó el uso de torch.hub para realizar inferencias rápidas, YOLO11 va un paso más allá con el paquete unificado de Python ultralytics.

Entrenamiento con YOLO11#

Cargar, entrenar y validar un modelo requiere muy poco código auxiliar. La API gestiona sin problemas el ajuste de hiperparámetros y la gestión de modelos.

from ultralytics import YOLO

# Load a pretrained YOLO11 model
model = YOLO("yolo11s.pt")

# Train on a custom dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run fast inference and display results
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

# Easily export the model to TensorRT for hardware acceleration
model.export(format="engine")

Inferencia heredada con YOLOv5#

Si mantienes una canalización antigua, YOLOv5 se integra directamente con el mecanismo de carga nativo de PyTorch, por lo que incorporarlo a los scripts de inferencia existentes resulta muy sencillo.

import torch

# Load a custom or pretrained YOLOv5 model from PyTorch Hub
model = torch.hub.load("ultralytics/yolov5", "yolov5s")

# Perform inference on an image URL
results = model("https://ultralytics.com/images/zidane.jpg")

# Print prediction details to the console
results.print()
Flexibilidad de despliegue

Ambos modelos admiten numerosos formatos de exportación. Tanto si te diriges a una NVIDIA Jetson mediante TensorRT como a una aplicación de iOS mediante CoreML, el proceso de implementación está ampliamente documentado y cuenta con el respaldo de la comunidad.

Casos de uso ideales#

La elección entre estos modelos depende en gran medida de la etapa del ciclo de vida de tu proyecto y de tus requisitos específicos.

Cuándo elegir YOLOv5#

  • Mantenimiento de bases de código heredadas: Si tu entorno de producción está muy personalizado en torno a la estructura del repositorio de YOLOv5 o a técnicas específicas de evolución de hiperparámetros.
  • Líneas base académicas: Cuando publiques investigaciones que requieran realizar comparaciones directas con estándares de visión por computador establecidos entre 2020 y 2022.

Cuándo elegir YOLO11#

  • Proyectos multitarea: Cuando tu aplicación requiera una combinación de tareas, como la estimación de poses y la segmentación de instancias, mediante una única API unificada.
  • Implementaciones en dispositivos periféricos: Para escenarios de computación en el borde en los que sea fundamental obtener el máximo mAP posible con un presupuesto computacional determinado (FLOPs).
  • Soluciones comerciales de IA: Ideal para aplicaciones empresariales en los sectores minorista y de seguridad, aprovechando el sólido soporte de la Ultralytics Platform.

La próxima generación: Ultralytics YOLO26#

Aunque YOLO11 representa un equilibrio fantástico entre velocidad y precisión, el campo de la inteligencia artificial evoluciona rápidamente. Para los desarrolladores que comiencen hoy nuevos proyectos, recomendamos encarecidamente explorar el estándar más reciente en IA de visión: Ultralytics YOLO26.

Lanzado en enero de 2026, YOLO26 introduce avances transformadores diseñados específicamente para las necesidades modernas de implementación:

  • Diseño de extremo a extremo sin NMS: Basándose en conceptos pioneros de YOLOv10, YOLO26 funciona de forma nativa de extremo a extremo. Elimina la necesidad del posprocesamiento de supresión no máxima (NMS), lo que simplifica considerablemente las canalizaciones de implementación y reduce la latencia.
  • Optimizador MuSGD: Inspirado en las innovaciones del entrenamiento de LLM de modelos como Kimi K2 de Moonshot AI, este híbrido de SGD y Muon garantiza un entrenamiento sumamente estable y una convergencia mucho más rápida.
  • Velocidad de CPU sin precedentes: Al eliminar la función de pérdida focal de distribución (DFL), YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, lo que lo convierte en la mejor opción para dispositivos periféricos y entornos sin GPU dedicadas.
  • Funciones de pérdida avanzadas: La integración de ProgLoss y STAL ofrece mejoras notables en el reconocimiento de objetos pequeños, algo fundamental para el análisis mediante drones, el IoT y la robótica.
  • Mejoras específicas para cada tarea: Introduce optimizaciones especializadas, como la estimación de log-verosimilitud residual (RLE) para poses y una función de pérdida de ángulo especializada para cuadros delimitadores orientados, lo que garantiza un rendimiento superior en todas las tareas de visión por computador.

Si te interesan arquitecturas especializadas más allá de la detección de objetos estándar, también puedes explorar modelos como RT-DETR para la detección basada en Transformer, o YOLO-World para el seguimiento y la detección con vocabulario abierto. Adoptar estas herramientas bien mantenidas y altamente optimizadas garantiza que tus canalizaciones de visión por computador sigan siendo eficientes, escalables y vanguardistas.

Comentarios