YOLO11 frente a PP-YOLOE+#
Seleccionar la arquitectura de red neuronal óptima es fundamental al implementar aplicaciones de visión por ordenador en producción. En esta comparación técnica, examinamos dos modelos destacados del ámbito de la detección de objetos en tiempo real: Ultralytics YOLO11 y PP-YOLOE+ de Baidu. Ambas arquitecturas ofrecen un rendimiento sólido, pero abordan los retos de la precisión, la velocidad de inferencia y el ecosistema para desarrolladores de formas bastante diferentes.
A continuación se muestra un gráfico interactivo que presenta los límites de rendimiento de estos modelos para ayudarte a identificar la opción más adecuada según las limitaciones de tu hardware.
Orígenes de los modelos y evolución técnica#
Comprender los orígenes y las filosofías de diseño de estos modelos proporciona un contexto valioso sobre sus respectivos puntos fuertes y casos de uso ideales.
Detalles de YOLO11#
Desarrollado por Ultralytics, YOLO11 representa una iteración muy refinada de la serie YOLO, que prioriza el equilibrio entre una inferencia de alta velocidad, una eficiencia extrema en el uso de parámetros y una facilidad de uso inigualable. Es ampliamente reconocido por sus capacidades unificadas multitarea y su API de Python fácil de usar para desarrolladores.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: Documentación de YOLO11
Detalles de PP-YOLOE+#
PP-YOLOE+ es una versión evolucionada de PP-YOLOv2, creada sobre el framework PaddlePaddle. Introduce cambios arquitectónicos como el backbone CSPRepResNet y el aprendizaje de alineación de tareas (TAL) para ampliar los límites de la precisión, especialmente en GPU de gama alta.
- Autores: autores de PaddlePaddle
- Organización: Baidu
- Fecha: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Documentación: documentación de configuración de PP-YOLOE+
Más información sobre PP-YOLOE+
Diferencias arquitectónicas#
Los diseños arquitectónicos fundamentales de YOLO11 y PP-YOLOE+ reflejan sus distintas prioridades en el ámbito de la visión por ordenador.
YOLO11 se basa en un backbone altamente optimizado y una cabeza de detección sin anchors. Utiliza bloques C3k2 y Spatial Pyramid Pooling - Fast (SPPF) para captar características a varias escalas con una sobrecarga computacional mínima. Este diseño resulta muy ventajoso para reducir la latencia de inferencia en dispositivos con recursos limitados, como las NPU de borde y las CPU móviles. Además, YOLO11 está diseñado de forma nativa para el aprendizaje multitarea y admite segmentación de instancias, estimación de poses y detección de cajas delimitadoras orientadas (OBB) directamente desde el principio.
PP-YOLOE+ introduce la espina dorsal CSPRepResNet y una cabeza alineada con tareas eficiente (ET-head). Utiliza intensamente técnicas de reparametrización para aumentar la capacidad de representación durante el entrenamiento mientras consolida esos parámetros en convoluciones estándar para la inferencia. Aunque esto produce una impresionante precisión media (mAP), los modelos resultantes tienden a ser más pesados en cuanto a parámetros y consumo de memoria, lo que los hace más adecuados para su implementación en GPU de servidores robustas en lugar de en dispositivos de borde ligeros.
Si tu proyecto necesita ampliar su alcance más allá de las cajas delimitadoras estándar, Ultralytics YOLO11 ofrece compatibilidad nativa con la segmentación, la estimación de poses y la clasificación dentro de la misma API, lo que reduce drásticamente la carga de desarrollo frente a la integración de varios repositorios independientes.
Rendimiento y benchmarks#
Al evaluar el rendimiento, analizamos la precisión (mAP), la velocidad de inferencia en distintos tipos de hardware y la eficiencia del modelo (parámetros y FLOPs). La tabla siguiente destaca las métricas comparativas, con los valores más eficientes o de mayor rendimiento en negrita.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Análisis#
YOLO11 demuestra una clara ventaja en el equilibrio de rendimiento y la eficiencia de parámetros. Por ejemplo, YOLO11m logra un mAP superior (51.5) que PP-YOLOE+m (49.8), utilizando al mismo tiempo menos parámetros (20.1M frente a 23.43M) y alcanzando velocidades de inferencia significativamente mayores en TensorRT (4.7 ms frente a 5.56 ms). La naturaleza ligera de los modelos YOLO11 se traduce inherentemente en menores requisitos de memoria tanto durante el entrenamiento del modelo como durante su implementación.
Ecosistema de entrenamiento y facilidad de uso#
El verdadero valor de un modelo suele residir en la facilidad con la que los desarrolladores pueden entrenarlo con datasets personalizados de visión por ordenador e implementarlo en producción.
La ventaja de Ultralytics#
Ultralytics prioriza una experiencia de desarrollo optimizada. El entrenamiento de YOLO11 se gestiona mediante una API de Python sencilla o la CLI, que abstrae el código repetitivo complejo. La plataforma Ultralytics mejora aún más este proceso al ofrecer entrenamiento sin código, gestión automatizada de datasets y exportaciones con un solo clic a formatos como ONNX, CoreML y TensorRT.
Además, los modelos YOLO son altamente eficientes en el uso de memoria durante el entrenamiento, lo que evita los enormes costos generales de VRAM típicos de las arquitecturas basadas en transformadores o de los modelos pesados reparametrizados, lo que permite el entrenamiento en hardware de nivel de consumidor.
from ultralytics import YOLO
# Load a pretrained YOLO11 model
model = YOLO("yolo11n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()Ecosistema de PP-YOLOE+#
PP-YOLOE+ funciona dentro del ecosistema PaddleDetection. Aunque este framework es potente y está profundamente integrado con las soluciones industriales de Baidu, requiere que los desarrolladores adopten el framework específico de deep learning PaddlePaddle. Esto puede suponer una curva de aprendizaje más pronunciada para los equipos que ya han estandarizado PyTorch. Además, exportar modelos PP-YOLOE+ a formatos universales estándar para dispositivos de borde puede requerir pasos de conversión adicionales en comparación con las canalizaciones de exportación nativas disponibles en los flujos de trabajo de Ultralytics.
Casos de uso ideales#
La elección entre estos modelos depende de tu entorno de implementación específico.
- Elige YOLO11 para un desarrollo ágil, la computación en el borde y las aplicaciones móviles. Su alta velocidad de inferencia, su bajo consumo de memoria y sus amplias capacidades de exportación lo hacen ideal para tareas como la gestión de inventario minorista en tiempo real con CPU estándar, el análisis de imágenes aéreas tomadas con drones y las canalizaciones multitarea complejas.
- Elige PP-YOLOE+ si toda tu canalización de producción ya depende en gran medida del ecosistema PaddlePaddle o si implementas el modelo en servidores de inferencia dedicados de gama alta donde las limitaciones de memoria y la compatibilidad de hardware (fuera del hardware optimizado de Paddle) no sean factores prioritarios.
La próxima generación: presentamos YOLO26#
Aunque YOLO11 sigue siendo increíblemente potente, el campo de la IA avanza rápido. Para disfrutar de lo más avanzado en detección de objetos, Ultralytics ha presentado el nuevo YOLO26. Lanzado en enero de 2026, YOLO26 se basa en los logros de sus predecesores para ofrecer una eficiencia y una precisión sin precedentes.
Principales innovaciones de YOLO26:
- Diseño de extremo a extremo sin NMS: YOLO26 elimina de forma nativa el posprocesamiento de supresión no máxima (NMS). Esto acelera significativamente la inferencia y simplifica la lógica de implementación, un salto arquitectónico que se introdujo por primera vez en YOLOv10.
- Hasta un 43 % más de velocidad de inferencia en CPU: optimizado específicamente para dispositivos de borde sin GPU, para garantizar un rendimiento en tiempo real en hardware de menor consumo.
- Optimizador MuSGD: inspirado en la estabilidad del entrenamiento de los LLM, esta combinación de SGD y Muon garantiza una convergencia más rápida y un entrenamiento más estable.
- ProgLoss + STAL: las funciones de pérdida mejoradas aumentan drásticamente el reconocimiento de objetos pequeños, algo fundamental para las aplicaciones con drones y la videovigilancia de seguridad.
- Eliminación de DFL: eliminar Distribution Focal Loss simplifica la exportación de modelos y mejora drásticamente la compatibilidad con una amplia variedad de dispositivos de borde.
Para los proyectos nuevos que prioricen la velocidad, una exportación fluida y la máxima precisión, recomendamos encarecidamente aprovechar las capacidades de YOLO26 mediante la plataforma Ultralytics.
Si estás evaluando otras arquitecturas, también puede interesarte comparar YOLO11 con RT-DETR o explorar cómo se comporta el ya conocido YOLOv8 en los benchmarks modernos.