YOLO Vision 2026:

YOLOX frente a PP-YOLOE+#

Al diseñar una canalización de computer vision robusta, seleccionar el modelo de detección de objetos adecuado es una decisión fundamental. El panorama de los detectores de objetos en tiempo real es muy competitivo, con numerosas arquitecturas que se esfuerzan por ofrecer el equilibrio definitivo entre la velocidad de inferencia y la precisión de detección. En esta comparación técnica, evaluaremos dos modelos destacados: YOLOX y PP-YOLOE+. Al examinar sus diseños arquitectónicos, metodologías de entrenamiento y métricas de rendimiento, nuestro objetivo es proporcionar a los desarrolladores e investigadores los conocimientos necesarios para elegir la herramienta adecuada para sus entornos de despliegue.

Innovaciones arquitectónicas y diseño#

Ambos modelos se diseñaron para abordar puntos críticos específicos en iteraciones anteriores de YOLO, pero adoptan enfoques fundamentalmente diferentes para resolver el compromiso entre velocidad y precisión.

YOLOX: Tendiendo un puente entre la investigación y la industria#

Desarrollado por Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun en Megvii, YOLOX se lanzó el 18 de julio de 2021. Marcó un cambio significativo en la familia YOLO al adoptar por completo un diseño sin anclajes (anchor-free). Puedes explorar la investigación fundamental en su Arxiv paper oficial y el código fuente original en el YOLOX GitHub repository.

YOLOX integra una cabeza desacoplada, separando las tareas de clasificación y regresión, lo que mejora significativamente la velocidad de convergencia durante el entrenamiento. Además, introdujo estrategias avanzadas de asignación de etiquetas como SimOTA para asignar dinámicamente muestras positivas. Esto hace que el modelo sea altamente eficiente, especialmente en entornos de edge AI donde los recursos computacionales son estrictamente limitados.

Más información sobre YOLOX

PP-YOLOE+: Detección industrial de alto rendimiento#

Presentado por los autores de PaddlePaddle en Baidu el 2 de abril de 2022, PP-YOLOE+ representa una evolución altamente optimizada de la serie PP-YOLO. Detallado en su Arxiv publication, PP-YOLOE+ está profundamente integrado en el ecosistema de Baidu y requiere el framework PaddlePaddle. Las configuraciones del modelo se pueden encontrar en el PaddleDetection GitHub repository.

PP-YOLOE+ se basa en un potente esqueleto (backbone) CSPRepResNet y utiliza una cabeza eficiente alineada con tareas (ET-head) junto con Task Alignment Learning (TAL). Esta arquitectura logra un mean Average Precision (mAP) sobresaliente en el COCO dataset, lo que la convierte en una opción formidable para la detección de defectos industriales y el procesamiento pesado en el lado del servidor donde se prioriza la precisión sobre las dependencias mínimas.

Aprende más sobre PP-YOLOE+

Benchmarks de rendimiento#

Comprender cómo funcionan estos modelos en diferentes escalas es esencial para el despliegue. La tabla siguiente describe métricas clave, incluyendo el mAP y las velocidades de inferencia al exportar a TensorRT.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
Consideraciones de despliegue

Mientras que PP-YOLOE+x logra la mayor precisión absoluta, YOLOX ofrece variantes extremadamente ligeras (Nano y Tiny) que son altamente adecuadas para microcontroladores de baja potencia y hardware móvil antiguo.

Casos de uso y recomendaciones#

Elegir entre YOLOX y PP-YOLOE+ depende de los requisitos específicos de tu proyecto, las restricciones de despliegue y tus preferencias de ecosistema.

Cuándo elegir YOLOX#

YOLOX es una opción sólida para:

  • Investigación en detección sin anclas: Investigación académica que utiliza la arquitectura limpia y sin anclas de YOLOX como base para experimentar con nuevas cabeceras de detección o funciones de pérdida.
  • Dispositivos de borde ultraligeros: Despliegue en microcontroladores o hardware móvil antiguo donde la huella extremadamente pequeña de la variante YOLOX-Nano (0.91M de parámetros) es crítica.
  • Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que investigan estrategias de asignación de etiquetas basadas en transporte óptimo y su impacto en la convergencia del entrenamiento.

Cuándo elegir PP-YOLOE+#

Se recomienda PP-YOLOE+ para:

  • Integración con el Ecosistema PaddlePaddle: Organizaciones con infraestructura existente construida sobre el marco y las herramientas de Baidu's PaddlePaddle.
  • Despliegue en el borde con Paddle Lite: Desplegar en hardware con kernels de inferencia altamente optimizados específicamente para el motor de inferencia Paddle Lite o Paddle.
  • Detección de alta precisión en el lado del servidor: Escenarios que priorizan la máxima precisión de detección en potentes servidores GPU donde la dependencia del marco de trabajo no es una preocupación.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia de desarrollo:

  • Implementación en el borde sin NMS: Aplicaciones que requieren una inferencia consistente y de baja latencia sin la complejidad del posprocesamiento de supresión de no máximos.
  • Entornos solo de CPU: Dispositivos sin aceleración de GPU dedicada, donde la inferencia en CPU hasta un 43% más rápida de YOLO26 proporciona una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios desafiantes como la aerial drone imagery o el análisis con sensores IoT donde ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

La ventaja de Ultralytics: Presentamos YOLO26#

Aunque tanto YOLOX como PP-YOLOE+ ofrecen ventajas distintas, la rápida evolución de la IA exige herramientas que combinen una precisión de vanguardia con una facilidad de uso inigualable. Aquí es donde los modelos de Ultralytics, específicamente el recién lanzado Ultralytics YOLO26, superan a los repositorios de investigación heredados.

Lanzado en enero de 2026, YOLO26 establece un nuevo estándar para la object detection moderna y más allá, ofreciendo una experiencia de desarrollador que simplemente no tiene rival en los frameworks de la competencia.

Por qué los desarrolladores eligen YOLO26#

  1. Diseño de extremo a extremo sin NMS: Basándose en los conceptos iniciados en YOLOv10, YOLO26 es nativamente de extremo a extremo (end-to-end). Al eliminar por completo el postprocesamiento de supresión de no máximos (NMS), garantiza una latencia muy constante y simplifica drásticamente las canalizaciones de exportación para entornos perimetrales.
  2. Optimización de próxima generación: La estabilidad del entrenamiento está revolucionada por el MuSGD Optimizer, un híbrido de SGD y Muon (inspirado en metodologías de LLM como Kimi K2 de Moonshot AI). Esto garantiza una convergencia más rápida. Además, YOLO26 utiliza ProgLoss + STAL para mejorar drásticamente el reconocimiento de objetos pequeños, una característica crucial para aplicaciones que involucran aerial imagery y robótica.
  3. Eficiencia de hardware inigualable: Al eliminar Distribution Focal Loss (DFL), YOLO26 reduce drásticamente los requisitos de memoria. Cuenta con una inferencia de CPU hasta un 43% más rápida, lo que la convierte en la opción definitiva para dispositivos que carecen de aceleración de GPU dedicada.
  4. Versatilidad extrema: A diferencia de PP-YOLOE+, que se centra estrictamente en la detección, YOLO26 ofrece soporte unificado en numerosas tareas. Incorpora una pérdida de segmentación semántica especializada para instance segmentation, estimación de verosimilitud logarítmica residual (RLE) para una precisa pose estimation, y mecanismos avanzados de pérdida de ángulo para Oriented Bounding Boxes (OBB).

Más información sobre YOLO26

Integración perfecta en el ecosistema#

Ultralytics elimina la frustración de las instalaciones complejas de frameworks. Utilizando la API unificada de Python o la intuitiva Ultralytics Platform, puedes entrenar, validar y exportar modelos con solo unas pocas líneas de código.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 small model
model = YOLO("yolo26s.pt")

# Train on a custom dataset with minimal CUDA memory overhead
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Effortlessly run inference
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX natively, fully benefiting from the NMS-free architecture
model.export(format="onnx")

Para los usuarios que evalúan otras arquitecturas robustas dentro del ecosistema de Ultralytics, YOLO11 sigue siendo una opción muy fiable para despliegues heredados, mientras que el RT-DETR basado en Transformer proporciona excelentes capacidades para quienes buscan soluciones basadas en atención.

Resumen#

Elegir entre YOLOX y PP-YOLOE+ a menudo se reduce a las restricciones principales de tu framework, ya sea que prefieras la flexibilidad basada en PyTorch o la integración profunda con PaddlePaddle de Baidu. Sin embargo, para las organizaciones que buscan preparar su infraestructura de IA para el futuro, Ultralytics YOLO26 ofrece una alternativa muy superior. Con su revolucionario diseño sin NMS, su huella de memoria ligera y su completa versatilidad de tareas, YOLO26 permite a los equipos construir aplicaciones de visión por ordenador más rápidas, inteligentes y eficientes con una facilidad sin precedentes.

Comentarios