YOLO11 frente a YOLOv9#
El panorama de la visión artificial evoluciona constantemente, con nuevas arquitecturas que amplían los límites de lo posible en la detección de objetos en tiempo real. Dos hitos importantes de esta evolución son Ultralytics YOLO11 y YOLOv9. Aunque ambos modelos ofrecen un rendimiento excepcional, representan enfoques distintos para resolver los desafíos fundamentales de la inferencia y el entrenamiento del aprendizaje profundo.
Esta guía ofrece una comparativa técnica exhaustiva entre YOLO11 y YOLOv9. Analiza sus arquitecturas, métricas de rendimiento y escenarios de despliegue ideales para ayudarte a elegir el modelo adecuado para tu próximo proyecto de inteligencia artificial.
Descripción general del modelo#
Ultralytics YOLO11#
YOLO11 es un modelo muy optimizado y versátil, diseñado para entornos de producción. Equilibra la precisión más avanzada con los requisitos prácticos de la computación periférica y el despliegue a gran escala.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: https://docs.ultralytics.com/models/yolo11
YOLOv9#
YOLOv9 es una potente contribución académica que introduce conceptos novedosos para mitigar la pérdida de información en redes neuronales profundas, con especial atención a los avances teóricos en la extracción de características.
- Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwán
- Fecha: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: https://github.com/WongKinYiu/yolov9
- Documentación: https://docs.ultralytics.com/models/yolov9
Innovaciones arquitectónicas#
YOLOv9: información de gradiente programable#
YOLOv9 aborda el problema del «cuello de botella de información», por el que se pierden datos a medida que atraviesan las capas sucesivas de una red profunda. Para resolverlo, sus autores introdujeron Programmable Gradient Information (PGI) y Generalized Efficient Layer Aggregation Network (GELAN). PGI garantiza que los gradientes utilizados para actualizar los pesos durante la retropropagación contengan toda la información, lo que da lugar a representaciones de características muy precisas. La arquitectura GELAN maximiza la eficiencia de los parámetros y permite que YOLOv9 alcance una gran precisión con una estructura relativamente ligera.
YOLO11: ecosistema y eficiencia#
Mientras que YOLOv9 se centra en el flujo de gradientes, YOLO11 está diseñado para ofrecer robustez y versatilidad en situaciones reales. Perfecciona la arquitectura YOLO fundamental para reducir drásticamente los requisitos de memoria CUDA durante el entrenamiento en comparación con las alternativas basadas en gran medida en Transformer. Además, YOLO11 no es solo un detector de objetos: también admite de forma nativa la segmentación de instancias, la clasificación de imágenes, la estimación de poses y las cajas delimitadoras orientadas (OBB).
Una de las mayores ventajas de YOLO11 es su integración en el paquete Python de Ultralytics, que abstrae las complejidades de la carga de datos, el aumento de datos y el entrenamiento distribuido mediante una API unificada.
Comparativa de rendimiento#
Al elegir un modelo para producción, es fundamental evaluar el equilibrio entre la precisión media (mAP), la velocidad de inferencia y el número de parámetros.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
Como muestra la tabla, YOLOv9e logra la mayor precisión global, por lo que es excelente para las pruebas de referencia académicas. Sin embargo, YOLO11 ofrece una relación entre velocidad y precisión superior en todos los casos. Por ejemplo, YOLO11m alcanza 51,5 mAP en 4,7 ms (TensorRT), superando en velocidad a YOLOv9m, de tamaño similar.
Metodologías de entrenamiento y ecosistema#
La experiencia de desarrollo difiere considerablemente entre ambos frameworks.
Entrenamiento de YOLOv9#
El entrenamiento de YOLOv9 suele requerir trabajar con código de investigación muy personalizado, gestionar versiones específicas de dependencias y utilizar argumentos complejos en la línea de comandos. Aunque es potente, puede resultar intimidante en entornos empresariales dinámicos.
Entrenamiento de YOLO11#
YOLO11 aprovecha la API de Python de Ultralytics, bien mantenida, para ofrecer una experiencia fluida desde cero hasta el dominio del modelo. Los procesos de entrenamiento eficientes se apoyan en pesos preentrenados disponibles y en una excelente asistencia de la comunidad.
from ultralytics import YOLO
# Carga un modelo YOLO11 pequeño preentrenado
model = YOLO("yolo11s.pt")
# Entrena con un conjunto de datos personalizado y los aumentos de datos integrados
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Exporta al formato ONNX para la implementación
model.export(format="onnx")Con solo tres líneas de Python, los desarrolladores pueden cargar un modelo, iniciar el entrenamiento con valores predeterminados optimizados para los hiperparámetros y exportar la arquitectura entrenada a frameworks como ONNX o TensorRT para su despliegue en dispositivos periféricos.
Aplicaciones en el mundo real#
Cuándo elegir YOLOv9#
YOLOv9 es una opción fantástica para los investigadores que quieren explorar arquitecturas de aprendizaje profundo. Su framework PGI lo convierte en un candidato ideal para el análisis minorista de alta velocidad, donde se necesita una precisión extrema en conjuntos de datos densos y la complejidad del despliegue queda en segundo plano frente al rendimiento algorítmico.
Cuándo elegir YOLO11#
YOLO11 es la herramienta definitiva para producción. Sus capacidades simplificadas de detección de objetos lo hacen perfecto para la gestión del tráfico en ciudades inteligentes y para dispositivos periféricos como Raspberry Pi o NVIDIA Jetson. Además, su versatilidad en distintas tareas permite que un único flujo de desarrollo se encargue de la segmentación en fabricación y la estimación de poses en el análisis deportivo.
A la vanguardia: llega YOLO26#
Aunque YOLO11 y YOLOv9 son extraordinarios, el campo de la inteligencia artificial evoluciona rápidamente. Para los desarrolladores que hoy empiezan nuevos proyectos, Ultralytics recomienda encarecidamente YOLO26 (lanzado en enero de 2026), que amplía aún más los límites de la visión artificial.
YOLO26 combina lo mejor de las innovaciones recientes en una potente solución lista para producción:
- Diseño de extremo a extremo sin NMS: El cabezal opcional uno a uno de YOLO26 (
nms=False) omite el posprocesamiento de supresión no máxima (NMS), lo que simplifica y acelera enormemente los flujos de despliegue. - Eliminación de DFL: La eliminación de Distribution Focal Loss garantiza una mejor compatibilidad con microcontroladores de bajo consumo y aceleradores de IA periférica.
- Optimizador MuSGD: Inspirado en las innovaciones del entrenamiento de LLM, el optimizador MuSGD (un híbrido de SGD y Muon) ofrece un entrenamiento estable y una convergencia más rápida.
- Inferencia en CPU hasta un 43 % más rápida: Optimizado específicamente para dispositivos de computación periférica sin GPU dedicada.
- ProgLoss + STAL: Estas funciones de pérdida mejoradas aumentan drásticamente el reconocimiento de objetos pequeños, fundamental para la supervisión agrícola y las imágenes aéreas.
A quienes les interese explorar distintas arquitecturas también puede interesarles RT-DETR para el seguimiento basado en Transformer o YOLO-World para la detección de vocabulario abierto con aprendizaje de cero ejemplos.
Conclusión#
Tanto YOLO11 como YOLOv9 se han ganado un lugar en la historia de la visión artificial. YOLOv9 ofrece brillantes innovaciones arquitectónicas para conservar al máximo las características. Sin embargo, para la gran mayoría de los despliegues reales —desde aplicaciones de IA empresarial hasta dispositivos móviles periféricos—, la facilidad de uso, la eficiencia de memoria y la compatibilidad con diversas tareas de YOLO11 ofrecen una ventaja imbatible. Y, a medida que avanza el sector, adoptar el nuevo YOLO26 garantiza que tus sistemas ejecuten la inferencia más rápida y fiable disponible hoy.