YOLO11 frente a YOLOv9#
El panorama de la visión por ordenador evoluciona constantemente, con nuevas arquitecturas que amplían los límites de lo posible en la detección de objetos en tiempo real. Dos hitos importantes en este recorrido son Ultralytics YOLO11 y YOLOv9. Aunque ambos modelos ofrecen un rendimiento excepcional, representan enfoques diferentes para resolver los retos fundamentales de la inferencia y el entrenamiento del aprendizaje profundo.
Esta guía ofrece una comparación técnica exhaustiva entre YOLO11 y YOLOv9, analizando sus arquitecturas, métricas de rendimiento y escenarios de implementación ideales para ayudarte a elegir el modelo adecuado para tu próximo proyecto de inteligencia artificial.
Descripción general de los modelos#
Ultralytics YOLO11#
YOLO11 es un modelo muy optimizado y versátil, diseñado para entornos de nivel de producción. Equilibra una precisión de vanguardia con los requisitos prácticos de la computación perimetral y la implementación a gran escala.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: https://docs.ultralytics.com/models/yolo11
YOLOv9#
YOLOv9 es una potente contribución académica que introduce conceptos novedosos para mitigar la pérdida de información en las redes neuronales profundas, con un fuerte enfoque en los avances teóricos de la extracción de características.
- Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwán
- Fecha: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: https://github.com/WongKinYiu/yolov9
- Documentación: https://docs.ultralytics.com/models/yolov9
Innovaciones arquitectónicas#
YOLOv9: Información de gradiente programable#
YOLOv9 aborda el problema del "cuello de botella de la información", en el que los datos se pierden al pasar por capas sucesivas de una red profunda. Para resolverlo, los autores introdujeron la Información de Gradiente Programable (PGI) y la Red Generalizada de Agregación Eficiente de Capas (GELAN). PGI garantiza que los gradientes utilizados para actualizar los pesos durante la retropropagación contengan toda la información, lo que da lugar a representaciones de características muy precisas. La arquitectura GELAN maximiza la eficiencia de los parámetros, lo que permite a YOLOv9 alcanzar una gran precisión con una estructura relativamente ligera.
YOLO11: ecosistema y eficiencia#
Mientras que YOLOv9 se centra en el flujo de gradientes, YOLO11 está diseñado para ofrecer robustez y versatilidad en situaciones reales. Refina la arquitectura YOLO fundamental para reducir drásticamente los requisitos de memoria de CUDA durante el entrenamiento en comparación con alternativas basadas principalmente en Transformer. Además, YOLO11 no es solo un detector de objetos; admite de forma nativa la segmentación de instancias, la clasificación de imágenes, la estimación de poses y las cajas delimitadoras orientadas (OBB).
Una de las mayores fortalezas de YOLO11 es su integración con la Ultralytics Platform, que abstrae las complejidades de la carga de datos, el aumento de datos y el entrenamiento distribuido en una API unificada.
Comparación de rendimiento#
Al seleccionar un modelo para producción, es fundamental evaluar el equilibrio entre la precisión media promedio (mAP), la velocidad de inferencia y el número de parámetros.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Como se observa en la tabla, YOLOv9e alcanza la mayor precisión general, por lo que es excelente para la evaluación comparativa académica. Sin embargo, YOLO11 ofrece una relación velocidad-precisión superior en todos los ámbitos. Por ejemplo, YOLO11m alcanza 51.5 mAP en 4.7 ms (TensorRT), superando en velocidad al YOLOv9m de tamaño similar.
Metodologías de entrenamiento y ecosistema#
La experiencia de desarrollo difiere significativamente entre ambos frameworks.
Entrenamiento de YOLOv9#
Entrenar YOLOv9 suele requerir interactuar con código de investigación muy personalizado, gestionar versiones específicas de las dependencias y utilizar argumentos complejos de la línea de comandos. Aunque es potente, puede resultar intimidante en entornos empresariales dinámicos.
Entrenamiento de YOLO11#
YOLO11 aprovecha la API de Python de Ultralytics, bien mantenida, para ofrecer una experiencia fluida de "cero a experto". Sus eficientes procesos de entrenamiento cuentan con pesos preentrenados disponibles de inmediato y un excelente soporte de la comunidad.
from ultralytics import YOLO
# Load a pre-trained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train on a custom dataset with built-in augmentations
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export to ONNX format for deployment
model.export(format="onnx")Con solo tres líneas de Python, los desarrolladores pueden cargar un modelo, iniciar el entrenamiento con valores predeterminados optimizados de los hiperparámetros y exportar la arquitectura entrenada a frameworks como ONNX o TensorRT para su implementación en el perímetro.
Aplicaciones en el mundo real#
Cuándo elegir YOLOv9#
YOLOv9 es una opción fantástica para investigadores que quieran explorar arquitecturas de aprendizaje profundo. Su framework PGI lo convierte en un candidato ideal para el análisis minorista de alta velocidad, donde se requiere una precisión extrema en conjuntos de datos densos y la complejidad de la implementación es secundaria frente al rendimiento algorítmico.
Cuándo elegir YOLO11#
YOLO11 es la herramienta definitiva para producción. Sus capacidades optimizadas de detección de objetos lo hacen perfecto para la gestión del tráfico en ciudades inteligentes y dispositivos perimetrales como Raspberry Pi o NVIDIA Jetson. Además, su versatilidad en varias tareas permite que una única canalización de desarrollo gestione la segmentación en fabricación y la estimación de poses en el análisis deportivo.
La vanguardia: llega YOLO26#
Aunque YOLO11 y YOLOv9 son extraordinarios, el campo de la inteligencia artificial evoluciona rápidamente. Para los desarrolladores que comiencen nuevos proyectos hoy, Ultralytics recomienda encarecidamente YOLO26 (publicado en enero de 2026), que amplía aún más los límites de la visión por ordenador.
YOLO26 combina lo mejor de las innovaciones recientes en una solución potente lista para producción:
- Diseño de extremo a extremo sin NMS: YOLO26 elimina de forma nativa el posprocesamiento de Supresión de No Máximos (NMS), lo que da lugar a canalizaciones de implementación mucho más sencillas y rápidas.
- Eliminación de DFL: La eliminación de la Pérdida Focal de Distribución garantiza una mejor compatibilidad con microcontroladores de bajo consumo y aceleradores de IA perimetral.
- Optimizador MuSGD: Inspirado en las innovaciones del entrenamiento de LLM, el optimizador MuSGD (un híbrido de SGD y Muon) ofrece un entrenamiento estable y una convergencia más rápida.
- Inferencia en CPU hasta un 43 % más rápida: Optimizada específicamente para dispositivos de computación perimetral sin GPU dedicadas.
- ProgLoss + STAL: Estas funciones de pérdida mejoradas aumentan drásticamente el reconocimiento de objetos pequeños, algo fundamental para la monitorización agrícola y las imágenes aéreas.
Los usuarios interesados en explorar arquitecturas diversas también pueden echar un vistazo a RT-DETR para el seguimiento basado en Transformer o a YOLO-World para la detección de vocabulario abierto sin ejemplos.
Conclusión#
YOLO11 y YOLOv9 se han hecho un lugar destacado en la historia de la visión por ordenador. YOLOv9 ofrece brillantes innovaciones arquitectónicas para maximizar la conservación de características. Sin embargo, para la gran mayoría de las implementaciones reales, desde aplicaciones empresariales de IA hasta dispositivos móviles perimetrales, la facilidad de uso, la eficiencia de memoria y la compatibilidad con varias tareas de YOLO11 ofrecen una ventaja insuperable. Además, a medida que el sector avanza, adoptar el más reciente YOLO26 garantiza que tus sistemas ejecuten la inferencia más rápida y fiable disponible actualmente.