Comparación entre YOLOX y PP-YOLOE+#
Al diseñar una canalización sólida de visión artificial, seleccionar el modelo de detección de objetos adecuado es una decisión fundamental. El panorama de los detectores de objetos en tiempo real es muy competitivo, con numerosas arquitecturas que buscan ofrecer el equilibrio óptimo entre velocidad de inferencia y precisión de detección. En esta comparación técnica, evaluaremos dos modelos destacados: YOLOX y PP-YOLOE+. Al examinar sus diseños arquitectónicos, metodologías de entrenamiento y métricas de rendimiento, nuestro objetivo es proporcionar a desarrolladores e investigadores la información necesaria para elegir la herramienta adecuada para sus entornos de despliegue.
Innovaciones arquitectónicas y diseño#
Ambos modelos se diseñaron para abordar problemas específicos de las primeras iteraciones de YOLO, pero adoptan enfoques fundamentalmente distintos para resolver el compromiso entre velocidad y precisión.
YOLOX: conectando la investigación y la industria#
Desarrollado por Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun en Megvii, YOLOX se publicó el 18 de julio de 2021. Supuso un cambio significativo en la familia YOLO al adoptar plenamente un diseño sin anclajes. Puedes consultar la investigación fundamental en su artículo de Arxiv oficial y el código fuente original en el repositorio de YOLOX en GitHub.
YOLOX integra una cabeza desacoplada que separa las tareas de clasificación y regresión, lo que mejora significativamente la velocidad de convergencia durante el entrenamiento. Además, introdujo estrategias avanzadas de asignación de etiquetas, como SimOTA, para asignar dinámicamente las muestras positivas. Esto hace que el modelo sea muy eficiente, especialmente en entornos de IA en el edge, donde los recursos computacionales están muy limitados.
PP-YOLOE+: detección industrial de alto rendimiento#
Presentado por los autores de PaddlePaddle en Baidu el 2 de abril de 2022, PP-YOLOE+ representa una evolución altamente optimizada de la serie PP-YOLO. Detallado en su publicación de Arxiv, PP-YOLOE+ está profundamente integrado en el ecosistema de Baidu y requiere el framework PaddlePaddle. Las configuraciones del modelo se encuentran en el repositorio de PaddleDetection en GitHub.
PP-YOLOE+ se basa en un potente backbone CSPRepResNet y utiliza una cabeza de alineación eficiente de tareas (ET-head) junto con el aprendizaje de alineación de tareas (TAL). Esta arquitectura logra una precisión media promedio (mAP) excepcional en el conjunto de datos COCO, lo que la convierte en una opción formidable para la detección de defectos industriales y el procesamiento intensivo en servidores, donde la precisión tiene prioridad sobre unas dependencias mínimas.
Más información sobre PP-YOLOE+
Pruebas de rendimiento#
Comprender el rendimiento de estos modelos a distintas escalas es esencial para el despliegue. La tabla siguiente resume métricas clave, incluidos mAP y las velocidades de inferencia al exportarlos a TensorRT.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Aunque PP-YOLOE+x alcanza la mayor precisión absoluta, YOLOX ofrece variantes extremadamente ligeras (Nano y Tiny) muy adecuadas para microcontroladores de bajo consumo y hardware móvil antiguo.
Casos de uso y recomendaciones#
La elección entre YOLOX y PP-YOLOE+ depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias en cuanto al ecosistema.
Cuándo elegir YOLOX#
YOLOX es una buena opción para:
- Investigación sobre detección sin anchors: Investigación académica que utiliza la arquitectura limpia y sin anchors de YOLOX como línea base para experimentar con nuevas cabezas de detección o funciones de pérdida.
- Dispositivos edge ultraligeros: Implementaciones en microcontroladores o hardware móvil antiguo donde sea fundamental el tamaño extremadamente reducido de la variante YOLOX-Nano (0.91M de parámetros).
- Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.
Cuándo elegir PP-YOLOE+#
PP-YOLOE+ se recomienda para:
- Integración con el ecosistema de PaddlePaddle: Organizaciones con infraestructura existente basada en el framework y las herramientas de PaddlePaddle de Baidu.
- Implementación edge con Paddle Lite: Implementación en hardware con kernels de inferencia altamente optimizados específicamente para Paddle Lite o el motor de inferencia de Paddle.
- Detección en servidor de alta precisión: Escenarios que priorizan la máxima precisión de detección en servidores GPU potentes donde la dependencia del framework no supone un problema.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
La ventaja de Ultralytics: presentamos YOLO26#
Aunque YOLOX y PP-YOLOE+ ofrecen ventajas diferenciadas, la rápida evolución de la IA exige herramientas que combinen una precisión puntera con una facilidad de uso inigualable. Aquí es donde los modelos de Ultralytics, concretamente el recientemente publicado Ultralytics YOLO26, superan a los repositorios de investigación antiguos.
Publicado en enero de 2026, YOLO26 establece un nuevo estándar para la detección de objetos moderna y mucho más, al ofrecer una experiencia de desarrollo que los frameworks de la competencia sencillamente no pueden igualar.
Por qué los desarrolladores eligen YOLO26#
- Diseño de extremo a extremo sin NMS: Basándose en conceptos pioneros de YOLOv10, YOLO26 es nativo de extremo a extremo. Al eliminar por completo el posprocesamiento de supresión no máxima (NMS), garantiza una latencia muy uniforme y simplifica enormemente las canalizaciones de exportación para entornos edge.
- Optimización de nueva generación: La estabilidad del entrenamiento se transforma gracias al optimizador MuSGD, una combinación híbrida de SGD y Muon (inspirada en metodologías de LLM como Kimi K2 de Moonshot AI). Esto garantiza una convergencia más rápida. Además, YOLO26 utiliza ProgLoss + STAL para mejorar drásticamente el reconocimiento de objetos pequeños, una función crucial para aplicaciones que utilizan imágenes aéreas y robótica.
- Eficiencia de hardware inigualable: Al eliminar Distribution Focal Loss (DFL), YOLO26 reduce drásticamente los requisitos de memoria. Ofrece hasta un 43 % más de velocidad de inferencia en CPU, lo que lo convierte en la opción definitiva para dispositivos sin aceleración GPU dedicada.
- Versatilidad extrema: A diferencia de PP-YOLOE+, que se centra estrictamente en la detección, YOLO26 ofrece compatibilidad unificada con numerosas tareas. Incorpora una pérdida especializada de segmentación semántica para la segmentación de instancias, Residual Log-Likelihood Estimation (RLE) para una estimación de pose precisa y mecanismos avanzados de pérdida angular para cajas delimitadoras orientadas (OBB).
Integración fluida con el ecosistema#
Ultralytics elimina la frustración que provocan las instalaciones complejas de frameworks. Con la API unificada de Python o la intuitiva Ultralytics Platform, puedes entrenar, validar y exportar modelos con solo unas pocas líneas de código.
from ultralytics import YOLO
# Load the cutting-edge YOLO26 small model
model = YOLO("yolo26s.pt")
# Train on a custom dataset with minimal CUDA memory overhead
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Effortlessly run inference
predictions = model("https://ultralytics.com/images/bus.jpg")
# Export to ONNX natively, fully benefiting from the NMS-free architecture
model.export(format="onnx")Para quienes evalúan otras arquitecturas sólidas dentro del ecosistema de Ultralytics, YOLO11 sigue siendo una opción muy fiable para despliegues antiguos, mientras que el RT-DETR basado en Transformer ofrece excelentes capacidades para quienes buscan soluciones basadas en mecanismos de atención.
Resumen#
La elección entre YOLOX y PP-YOLOE+ suele depender de las limitaciones de tu framework principal: si prefieres la flexibilidad basada en PyTorch o una integración profunda con PaddlePaddle de Baidu. Sin embargo, para las organizaciones que buscan preparar su infraestructura de IA para el futuro, Ultralytics YOLO26 ofrece una alternativa muy superior. Con su revolucionario diseño sin NMS, su reducido consumo de memoria y su completa versatilidad de tareas, YOLO26 permite a los equipos crear aplicaciones de visión artificial más rápidas, inteligentes y eficientes con una facilidad sin precedentes.