Ultralytics YOLO27:

YOLOv5 frente a PP-YOLOE+#

Elegir la arquitectura de red neuronal adecuada es esencial para cualquier proyecto moderno de visión por computador. Cuando desarrolladores e investigadores evalúan modelos para la detección de objetos en tiempo real, la decisión suele reducirse a encontrar el equilibrio entre precisión, velocidad de inferencia y facilidad de despliegue. Esta comparación técnica examina YOLOv5 y PP-YOLOE+, explorando sus arquitecturas, métricas de rendimiento y metodologías de entrenamiento para ayudarte a seleccionar la solución óptima para tu aplicación.

Comprender las arquitecturas#

Ambos modelos han tenido un impacto significativo en el panorama de la IA aplicada a la visión, pero abordan los retos de la detección de objetos mediante metodologías estructurales y dependencias de framework diferentes.

Ultralytics YOLOv5: el estándar del sector#

Lanzado a mediados de 2020, Ultralytics YOLOv5 revolucionó la accesibilidad de los modelos de visión de vanguardia. Al ser la primera implementación nativa en PyTorch de la familia YOLO, redujo drásticamente la barrera de entrada para desarrolladores de Python e ingenieros de ML de todo el mundo.

Detalles de YOLOv5:

YOLOv5 utiliza una arquitectura base CSPDarknet modificada, que captura eficazmente representaciones de características enriquecidas al tiempo que mantiene un número reducido de parámetros. Introdujo cajas de anclaje con aprendizaje automático, calculando automáticamente las dimensiones óptimas de los anclajes para conjuntos de datos personalizados antes incluso de que comience el entrenamiento. Además, su integración del aumento de datos mediante mosaico mejora significativamente la capacidad del modelo para detectar objetos pequeños y generalizar en contextos espaciales complejos.

Una de las mayores fortalezas de YOLOv5 es su increíble versatilidad. A diferencia de los detectores de objetos estándar, la familia YOLOv5 admite sin problemas la clasificación de imágenes, la segmentación de instancias y la detección mediante cajas delimitadoras dentro de una API unificada. Su arquitectura altamente optimizada también se traduce en un uso de memoria considerablemente menor durante el entrenamiento y la inferencia en comparación con las redes basadas en Transformer de gran tamaño.

PP-YOLOE+: el competidor basado en PaddlePaddle#

Introducido aproximadamente dos años después, PP-YOLOE+ se basa en los cimientos de las iteraciones anteriores de PP-YOLO. Desarrollado para mostrar las capacidades del framework de aprendizaje profundo de Baidu, incorpora varios refinamientos arquitectónicos para aumentar la precisión media promedio.

Detalles de PP-YOLOE+:

PP-YOLOE+ se basa en un paradigma sin anclajes y utiliza una arquitectura base CSPRepResNet. Incorpora una potente técnica de aprendizaje de alineación de tareas y una cabeza eficiente alineada con la tarea para mejorar la precisión. Aunque PP-YOLOE+ logra puntuaciones de precisión impresionantes, su principal debilidad reside en su estricta dependencia del framework PaddlePaddle. Esto suele introducir una curva de aprendizaje pronunciada y fricciones con el ecosistema para los equipos de investigación y las empresas que ya han invertido profundamente en entornos de PyTorch o TensorFlow.

Más información sobre PP-YOLOE+

Rendimiento y benchmarks#

Al evaluar estos modelos para producción, es fundamental comprender las ventajas y desventajas entre precisión, velocidad de inferencia y número de parámetros. La tabla siguiente resume las principales métricas de rendimiento en distintas variantes de tamaño.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Aunque PP-YOLOE+ alcanza altos niveles de precisión, YOLOv5 demuestra sistemáticamente una eficiencia superior en el uso de parámetros y una inferencia más rápida en hardware limitado. Para despliegues en el edge donde la memoria escasea, YOLOv5n ofrece una velocidad inigualable y un tamaño extremadamente reducido.

Eficiencia de memoria

Los modelos de Ultralytics están diseñados específicamente para lograr un entrenamiento eficiente. En comparación con los Transformer de visión de gran tamaño, como RT-DETR, YOLOv5 utiliza mucha menos memoria de CUDA, lo que te permite entrenar con tamaños de lote mayores o en hardware de consumo.

La ventaja de Ultralytics: ecosistema y facilidad de uso#

El verdadero valor de una arquitectura de aprendizaje automático va más allá de las cifras brutas; abarca toda la experiencia del desarrollador. La plataforma de Ultralytics y sus correspondientes herramientas de código abierto ofrecen un ecosistema muy depurado y bien mantenido que acelera drásticamente los ciclos de desarrollo.

  • Facilidad de uso: Ultralytics abstrae el código repetitivo complejo. Puedes entrenar, validar y probar modelos mediante una intuitiva API de Python o la CLI.
  • Flexibilidad de despliegue: Exportar modelos es increíblemente sencillo. Con un solo comando, puedes convertir los pesos de tu YOLOv5 entrenado a formatos como ONNX, TensorRT u OpenVINO, garantizando una amplia compatibilidad en entornos edge y en la nube.
  • Comunidad activa: La comunidad dinámica garantiza actualizaciones frecuentes, documentación extensa y soluciones sólidas para los retos habituales de la visión por computador.

En cambio, PP-YOLOE+ depende en gran medida de archivos de configuración complejos específicos de PaddleDetection, lo que puede ralentizar la creación rápida de prototipos y complicar la integración en los pipelines modernos de MLOps.

Implementaciones prácticas y ejemplos de código#

Empezar a utilizar Ultralytics es extraordinariamente sencillo. Aquí tienes un ejemplo completo y ejecutable de cómo cargar un modelo YOLOv5 preentrenado, entrenarlo con un conjunto de datos personalizado y exportar los resultados:

from ultralytics import YOLO

# Load a pretrained YOLOv5 small model
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset for 50 epochs
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference on a sample image
predict_results = model("https://ultralytics.com/images/bus.jpg")

# Export the optimized model to ONNX format
path = model.export(format="onnx")

Casos de uso y recomendaciones#

Elegir entre YOLOv5 y PP-YOLOE+ depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias de ecosistema.

Cuándo elegir YOLOv5#

YOLOv5 es una buena opción para:

  • Sistemas de producción probados: Implementaciones existentes en las que se valoran la larga trayectoria de estabilidad de YOLOv5, su amplia documentación y el enorme apoyo de la comunidad.
  • Entrenamiento con recursos limitados: Entornos con recursos de GPU limitados en los que resultan ventajosos el eficiente flujo de entrenamiento de YOLOv5 y sus menores requisitos de memoria.
  • Amplia compatibilidad con formatos de exportación: Proyectos que requieren implementarse en muchos formatos, incluidos ONNX, TensorRT, CoreML y TFLite.

Cuándo elegir PP-YOLOE+#

PP-YOLOE+ se recomienda para:

  • Integración con el ecosistema de PaddlePaddle: Organizaciones con infraestructura existente basada en el framework y las herramientas de PaddlePaddle de Baidu.
  • Implementación edge con Paddle Lite: Implementación en hardware con kernels de inferencia altamente optimizados específicamente para Paddle Lite o el motor de inferencia de Paddle.
  • Detección en servidor de alta precisión: Escenarios que priorizan la máxima precisión de detección en servidores GPU potentes donde la dependencia del framework no supone un problema.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

Modelos de vanguardia alternativos que puedes considerar#

Aunque YOLOv5 es un estándar sólido y probado, el campo de la visión por computador avanza rápidamente. Para los equipos que comienzan proyectos nuevos, recomendamos encarecidamente explorar nuestras arquitecturas más recientes.

Ultralytics YOLO26#

Lanzado en enero de 2026, YOLO26 representa la cima absoluta de nuestra investigación. Ofrece mejoras enormes tanto en precisión como en velocidad. Entre sus principales innovaciones se incluyen:

  • Diseño integral sin NMS: Basándose en conceptos de YOLOv10, YOLO26 elimina de forma nativa el postprocesamiento de supresión no máxima (NMS), reduciendo la latencia y simplificando la lógica de despliegue.
  • Eliminación de DFL: Al eliminar Distribution Focal Loss, YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, lo que lo hace increíblemente potente para dispositivos edge de bajo consumo.
  • Optimizador MuSGD: Inspirado en técnicas avanzadas de entrenamiento de LLM, este híbrido de SGD y Muon garantiza ejecuciones de entrenamiento excepcionalmente estables y una convergencia más rápida.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas ofrecen mejoras notables en el reconocimiento de objetos pequeños, algo crucial para las imágenes captadas por drones y la agricultura inteligente.

Además, puedes considerar YOLO11, que ofrece un rendimiento excelente y sirve como puente muy fiable entre los sistemas heredados y las capacidades más vanguardistas de YOLO26.

Casos de uso reales#

La elección entre YOLOv5 y PP-YOLOE+ depende en última instancia de tu entorno de despliegue y de las limitaciones de tu proyecto.

Aplicaciones ideales de YOLOv5: Los requisitos de recursos mínimos y la increíble facilidad de uso de YOLOv5 lo convierten en la opción principal para la IA en el borde. Destaca en aplicaciones que requieren altas frecuencias de cuadro en hardware limitado, como la robótica en tiempo real, la integración de aplicaciones móviles y los sistemas de supervisión de tráfico con múltiples cámaras. Su capacidad para gestionar la segmentación de instancias y la clasificación de imágenes dentro del mismo marco de trabajo lo hace altamente adaptable.

Aplicaciones ideales de PP-YOLOE+: PP-YOLOE+ es más adecuado para situaciones en las que se prioriza la máxima precisión absoluta en imágenes estáticas frente a las limitaciones del procesamiento en tiempo real. Tiene un uso especializado en pipelines de inspección industrial, especialmente en sectores manufactureros asiáticos que cuentan con stacks tecnológicos consolidados y muy invertidos en el ecosistema de Baidu y PaddlePaddle.

En resumen, aunque PP-YOLOE+ ofrece sólidos resultados de precisión, los modelos YOLO de Ultralytics proporcionan una combinación inigualable de equilibrio de rendimiento, despliegue fluido y diseño orientado a desarrolladores que impulsa proyectos de visión por computador exitosos desde el concepto hasta la producción.

Colaboradores

Comentarios