YOLO Vision 2026:

YOLOv5 frente a YOLO11#

Al elegir la arquitectura de visión artificial adecuada para un proyecto nuevo, es fundamental comprender la evolución de los modelos de última generación. La progresión desde arquitecturas anteriores hacia marcos de trabajo modernos y unificados resalta saltos significativos tanto en la eficiencia algorítmica como en la experiencia del desarrollador. Esta guía ofrece una comparación técnica detallada entre dos modelos emblemáticos desarrollados por Ultralytics: el pionero YOLOv5 y el altamente refinado YOLO11.

Introducción a los modelos#

Ambas arquitecturas representan hitos importantes en el campo de la detección de objetos en tiempo real, ofreciendo ventajas distintas dependiendo de tu entorno de despliegue y requisitos heredados.

YOLOv5: El caballo de batalla del sector#

Lanzado en el verano de 2020, YOLOv5 se convirtió rápidamente en un estándar de la industria debido a su implementación nativa en PyTorch, lo que redujo drásticamente la barrera de entrada para el entrenamiento y el despliegue. Se alejó de los complejos marcos Darknet C de sus predecesores, ofreciendo un enfoque pitónico para la construcción de modelos.

YOLOv5 estableció una base sólida en cuanto a facilidad de uso e introdujo poderosas metodologías de entrenamiento, incluyendo la avanzada aumentación de datos tipo mosaico y el auto-anclaje (auto-anchoring). Sigue siendo increíblemente popular entre los investigadores que construyen sobre una base de código bien documentada y ampliamente probada.

Más información sobre YOLOv5

YOLO11: El marco de trabajo de visión unificado#

Basándose en años de comentarios e investigación arquitectónica, YOLO11 se introdujo como parte de un marco de trabajo unificado capaz de gestionar múltiples tareas de visión de forma nativa. Más allá de las simples cajas delimitadoras (bounding boxes), fue diseñado desde cero para lograr la máxima versatilidad y eficiencia.

YOLO11 ofrece una experiencia de usuario optimizada a través del paquete de Python ultralytics, presumiendo de una API sencilla que unifica la detección de objetos, la segmentación de instancias, la clasificación, la estimación de poses y las cajas delimitadoras orientadas (OBB). Logra una relación muy favorable entre velocidad y precisión, lo que lo hace ideal para diversos escenarios de despliegue en el mundo real.

Más información sobre YOLO11

Plataforma integrada

Ambos modelos se benefician del ecosistema bien mantenido proporcionado por la Ultralytics Platform. Este entorno integrado simplifica la anotación de conjuntos de datos, el entrenamiento en la nube y la exportación de modelos en varios destinos de hardware.

Comparación de rendimiento y métricas#

Una comparación directa de estos modelos revela cómo los refinamientos arquitectónicos se traducen en mejoras tangibles de rendimiento. La tabla siguiente ilustra la precisión media media (mAP) evaluada en el COCO dataset, junto con las velocidades de inferencia en CPU y GPU y el recuento de parámetros.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

Análisis de los resultados#

Las métricas destacan un salto claro en el equilibrio de rendimiento logrado por YOLO11. Por ejemplo, el modelo YOLO11n (nano) alcanza un mAP del 39,5 % en comparación con el 28,0 % de YOLOv5n, mientras reduce simultáneamente el tiempo de inferencia en CPU cuando se exporta mediante ONNX. Además, YOLO11 mantiene unos requisitos de memoria notablemente más bajos durante el entrenamiento en comparación con los pesados modelos basados en Transformer, lo que lo hace muy accesible para su despliegue en hardware de consumo y dispositivos de borde.

Diferencias arquitectónicas#

Las mejoras de rendimiento en YOLO11 provienen de varias evoluciones arquitectónicas clave. Mientras que YOLOv5 utilizaba una estructura base (backbone) CSPNet estándar con módulos C3, YOLO11 introdujo bloques de extracción de características más eficientes como C2f y, posteriormente, C3k2, los cuales optimizan el flujo de gradiente y reducen la sobrecarga computacional.

YOLO11 también cuenta con una cabeza fuertemente refinada. Alejándose del diseño basado en anclajes de los modelos más antiguos, las nuevas arquitecturas de Ultralytics adoptan un enfoque sin anclajes. Esto reduce el número de predicciones de cajas, agilizando el flujo de trabajo de postprocesamiento y mejorando la capacidad del modelo para generalizar a través de diferentes escalas y relaciones de aspecto. Adicionalmente, estos modelos presumen de una superior eficiencia de entrenamiento y pesos preentrenados fácilmente disponibles que aceleran la convergencia de los conjuntos de datos afinados.

Implementación y ejemplos de código#

Una de las características más destacadas del ecosistema de Ultralytics es su simplicidad. Mientras que YOLOv5 popularizó el uso de torch.hub para inferencias rápidas, YOLO11 lleva esto un paso más allá con el unificado paquete de Python ultralytics.

Entrenamiento con YOLO11#

Cargar, entrenar y validar un modelo requiere un código repetitivo mínimo. La API gestiona el ajuste de hiperparámetros y la gestión de modelos sin problemas.

from ultralytics import YOLO

# Load a pretrained YOLO11 model
model = YOLO("yolo11s.pt")

# Train on a custom dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run fast inference and display results
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

# Easily export the model to TensorRT for hardware acceleration
model.export(format="engine")

Inferencia heredada con YOLOv5#

Si mantienes una canalización (pipeline) antigua, YOLOv5 se integra directamente con el mecanismo de carga nativo de PyTorch, haciendo que sea trivial insertarlo en guiones de inferencia existentes.

import torch

# Load a custom or pretrained YOLOv5 model from PyTorch Hub
model = torch.hub.load("ultralytics/yolov5", "yolov5s")

# Perform inference on an image URL
results = model("https://ultralytics.com/images/zidane.jpg")

# Print prediction details to the console
results.print()
Flexibilidad de despliegue

Ambos modelos admiten amplios formatos de exportación. Ya sea que estés apuntando a una NVIDIA Jetson usando TensorRT o a una aplicación de iOS usando CoreML, el proceso de despliegue está exhaustivamente documentado y respaldado por la comunidad.

Casos de uso ideales#

Elegir entre estos modelos depende en gran medida de la etapa del ciclo de vida de tu proyecto y de tus requisitos específicos.

Cuándo elegir YOLOv5#

  • Mantenimiento de bases de código heredadas: Si tu entorno de producción está fuertemente personalizado en torno a la estructura del repositorio de YOLOv5 o a técnicas específicas de evolución de hiperparámetros.
  • Bases de referencia académicas: Cuando publiques investigaciones que requieran evaluaciones comparativas directas frente a estándares de visión artificial establecidos entre 2020 y 2022.

Cuándo elegir YOLO11#

  • Proyectos multitarea: Cuando tu aplicación requiere una combinación de tareas como la estimación de poses y la segmentación de instancias utilizando una sola API unificada.
  • Despliegues en el borde: Para escenarios de computación en el borde donde exprimir el mAP máximo para un presupuesto computacional dado (FLOPs) es crítico.
  • Soluciones de IA comerciales: Ideal para aplicaciones empresariales en comercio minorista y seguridad, aprovechando el sólido soporte de la Ultralytics Platform.

La próxima generación: Ultralytics YOLO26#

Aunque YOLO11 representa un equilibrio fantástico entre velocidad y precisión, el campo de la inteligencia artificial evoluciona rápidamente. Para los desarrolladores que comienzan nuevos proyectos hoy, recomendamos encarecidamente explorar el estándar más reciente en visión artificial: Ultralytics YOLO26.

Lanzado en enero de 2026, YOLO26 introduce avances que cambian el paradigma y están diseñados específicamente para las necesidades de despliegue modernas:

  • Diseño de extremo a extremo sin NMS: Construido sobre conceptos pioneros en YOLOv10, YOLO26 es nativamente de extremo a extremo (end-to-end). Elimina la necesidad de posprocesamiento de supresión no máxima (NMS), simplificando significativamente las canalizaciones de despliegue y reduciendo la latencia.
  • Optimizador MuSGD: Inspirado en innovaciones de entrenamiento de LLM de modelos como Kimi K2 de Moonshot AI, este híbrido de SGD y Muon garantiza un entrenamiento increíblemente estable y una convergencia dramáticamente más rápida.
  • Velocidad de CPU sin precedentes: Al eliminar la pérdida focal de distribución (DFL), YOLO26 logra una inferencia en CPU hasta 43% más rápida, convirtiéndolo en la mejor opción absoluta para dispositivos de borde y entornos sin GPUs dedicadas.
  • Funciones de pérdida avanzadas: La integración de ProgLoss y STAL produce mejoras notables en el reconocimiento de objetos pequeños, lo cual es crítico para el análisis mediante drones, IoT y robótica.
  • Mejoras específicas para tareas: Introduce optimizaciones especializadas, tales como la Estimación de Log-Verosimilitud Residual (RLE) para Pose y una pérdida de ángulo especializada para cajas delimitadoras orientadas, asegurando un rendimiento superior en todas las tareas de visión artificial.

Más información sobre YOLO26

Para usuarios interesados en arquitecturas especializadas más allá de la detección de objetos estándar, también puedes explorar modelos como RT-DETR para detección basada en Transformer, o YOLO-World para seguimiento y detección de vocabulario abierto. Adoptar estas herramientas bien mantenidas y altamente optimizadas garantiza que tus canalizaciones de visión por ordenador sigan siendo eficientes, escalables y vayan un paso por delante.

Comentarios