YOLOv10 frente a YOLOv9#
La evolución de la visión artificial en tiempo real ha estado marcada por avances continuos en velocidad, precisión y eficiencia arquitectónica. Al evaluar soluciones actuales para tu próxima implementación, comparar YOLOv10 y YOLOv9 permite apreciar dos enfoques distintos para resolver los cuellos de botella del aprendizaje profundo. YOLOv9 se centra en maximizar el flujo de información de gradiente durante el entrenamiento, mientras que YOLOv10 es pionero en un diseño integral nativo que elimina por completo los obstáculos del posprocesamiento tradicional.
Esta guía completa analiza sus innovaciones arquitectónicas, sus métricas de rendimiento y sus casos de uso idóneos para ayudar a desarrolladores e investigadores a elegir el modelo óptimo para sus tareas de visión artificial.
YOLOv10: pionero en la detección integral sin NMS#
Desarrollado para resolver los cuellos de botella de latencia de los detectores de objetos tradicionales, YOLOv10 introduce una arquitectura integral revolucionaria que elimina de forma nativa la necesidad de supresión no máxima (NMS).
Detalles técnicos y linaje:
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Tsinghua University
- Fecha: 23 de mayo de 2024
- Enlaces: Publicación en ArXiv, Repositorio de GitHub, Documentación de Ultralytics
Arquitectura y puntos fuertes#
La contribución más significativa de YOLOv10 al campo es su estrategia coherente de asignación dual para el entrenamiento sin NMS. Al eliminar NMS, el modelo reduce drásticamente la latencia de inferencia, especialmente en dispositivos edge, donde el posprocesamiento puede convertirse en un cuello de botella para todo el flujo de trabajo. Optimiza varios componentes desde la perspectiva de la eficiencia y la precisión, lo que da lugar a un modelo con una notable relación entre velocidad y número de parámetros. Por ejemplo, la variante YOLOv10-S es excepcionalmente rápida, por lo que resulta muy adecuada para el análisis de vídeo de alta velocidad y la navegación robótica en tiempo real.
Puntos débiles#
Aunque el diseño sin NMS es revolucionario para la detección de cajas delimitadoras, YOLOv10 está optimizado principalmente como detector de objetos puro. No ofrece la versatilidad inmediata de los ecosistemas más recientes, que admiten de forma nativa la segmentación de instancias o la estimación de pose.
Al preparar YOLOv10 para producción, asegúrate siempre de exportar el modelo a formatos optimizados como TensorRT u ONNX. Ejecutar los pesos PyTorch sin procesar durante la implementación puede ralentizar la inferencia más de lo previsto debido a operaciones del grafo sin optimizar.
YOLOv9: información de gradiente programable#
Antes de YOLOv10, YOLOv9 introdujo nuevos conceptos arquitectónicos para resolver el problema del cuello de botella de información inherente a las redes neuronales profundas, lo que permitió aprovechar los parámetros con gran eficiencia.
Detalles técnicos y linaje:
- Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwán
- Fecha: 21 de febrero de 2024
- Enlaces: Publicación en ArXiv, Repositorio de GitHub, Documentación de Ultralytics
Arquitectura y puntos fuertes#
YOLOv9 introduce la información de gradiente programable (PGI) junto con la red de agregación de capas eficiente generalizada (GELAN). PGI garantiza que no se pierda información crucial sobre los objetivos cuando los datos atraviesan las capas profundas de la red y genera gradientes fiables para actualizar los pesos. GELAN maximiza la eficiencia de los parámetros de la red. En conjunto, estas innovaciones permiten que YOLOv9 alcance una precisión media (mAP) muy alta en el conjunto de datos MS COCO, a menudo superando a modelos más pesados con menos FLOPs. Es un modelo excepcional para investigadores que buscan maximizar las métricas de precisión teórica.
Puntos débiles#
A pesar de su gran precisión, YOLOv9 sigue dependiendo del posprocesamiento NMS estándar. Esto significa que, aunque las operaciones de la red neuronal sean rápidas, el filtrado final de las cajas delimitadoras puede introducir una latencia variable según la densidad de objetos de la escena. Además, su proceso de entrenamiento puede consumir mucha más memoria que el de modelos posteriores, por lo que requiere más recursos de GPU para ajustar modelos a conjuntos de datos personalizados.
Comparativa de rendimiento#
La siguiente tabla muestra las métricas principales de ambos modelos. Observa que YOLOv10 suele lograr una latencia menor con TensorRT, mientras que YOLOv9 lleva la precisión al límite en su configuración más grande.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
La próxima generación: por qué YOLO26 es la recomendación definitiva#
Aunque YOLOv9 y YOLOv10 son hitos impresionantes, el panorama del aprendizaje automático evoluciona rápidamente. En los entornos de producción actuales, los desarrolladores confían cada vez más en el ecosistema integrado y bien mantenido de la Plataforma Ultralytics. En 2026, la recomendación indiscutible tanto para investigación como para empresas es el recién lanzado YOLO26.
YOLO26 aprovecha los conceptos fundamentales de sus predecesores y los lleva más allá con una experiencia de usuario optimizada, una API sencilla y unos requisitos de memoria durante el entrenamiento excepcionalmente bajos en comparación con las voluminosas arquitecturas basadas en Transformer.
Innovaciones clave de YOLO26#
- Diseño integral sin NMS: Sobre la base de los avances de YOLOv10, YOLO26 admite inferencia integral nativa, omite el posprocesamiento NMS con
nms=Falsey simplifica así la implementación y permite perfiles de latencia muy deterministas. - Inferencia en CPU hasta un 43 % más rápida: Optimizado de serie para IA en el edge, lo que lo convierte en la opción perfecta para sistemas integrados sin GPU específica.
- Optimizador MuSGD: Un innovador enfoque híbrido de SGD y Muon (inspirado en las optimizaciones de los modelos de lenguaje grandes) que garantiza procesos de entrenamiento muy estables y una convergencia increíblemente rápida.
- Eliminación de DFL: Al eliminar la pérdida focal de distribución, YOLO26 simplifica el proceso de exportación del modelo y mejora notablemente la compatibilidad con dispositivos de bajo consumo y diversos marcos de implementación edge.
- Mejoras específicas para cada tarea: A diferencia de los detectores especializados en una sola tarea, YOLO26 es una solución versátil y potente. Utiliza la pérdida de segmentación semántica para lograr una precisión refinada a nivel de píxel, la estimación de log-verosimilitud residual (RLE) para una estimación de pose impecable y una pérdida angular especializada para resolver los problemas de límites de OBB (caja delimitadora orientada).
Elegir un modelo de Ultralytics como YOLO11 o YOLO26 ofrece una facilidad de uso inigualable. Tendrás acceso a un desarrollo activo, una comunidad dinámica y actualizaciones frecuentes que garantizan que tus modelos sigan siendo compatibles con los motores de inferencia más recientes, como OpenVINO y CoreML.
Implementación práctica#
Entrenar e implementar estos modelos es sencillo con el SDK de Python. El siguiente ejemplo muestra cómo aprovechar los procesos de entrenamiento de gran eficiencia del ecosistema de Ultralytics, que gestiona automáticamente la planificación de hiperparámetros y la asignación óptima de memoria.
from ultralytics import YOLO
# Carga el modelo de última generación recomendado
model = YOLO("yolo26n.pt") # También es compatible con 'yolov10n.pt' o 'yolov9c.pt'
# Entrena el modelo de forma eficiente con un conjunto de datos personalizado
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0, batch=16)
# Ejecuta una inferencia ultrarrápida
predictions = model.predict("https://ultralytics.com/images/bus.jpg")
# Expórtalo a ONNX para simplificar la implementación en el edge
model.export(format="onnx")Casos de uso y recomendaciones#
Elegir entre YOLOv10 y YOLOv9 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir YOLOv10#
YOLOv10 es una buena opción para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección de extremo a extremo sin supresión no máxima, lo que reduce la complejidad de la implementación.
- Equilibrio entre velocidad y precisión: Proyectos que necesitan un buen equilibrio entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
- Aplicaciones con latencia constante: Escenarios de implementación en los que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.
Cuándo elegir YOLOv9#
YOLOv9 se recomienda para:
- Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
- Estudios de optimización del flujo de gradiente: Investigaciones centradas en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
- Evaluación comparativa de detección de alta precisión: Situaciones en las que el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO sirve como referencia para comparar arquitecturas.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
Conclusión#
YOLOv9 y YOLOv10 ofrecen ventajas únicas. YOLOv9 demuestra el potencial de maximizar la eficiencia de los parámetros de la red y el flujo teórico de gradientes, lo que se traduce en una precisión de primer nivel. Por su parte, YOLOv10 es pionero académico en la detección integral de cajas delimitadoras sin la penalización de latencia de NMS.
Sin embargo, para los desarrolladores que buscan el equilibrio perfecto entre rendimiento, versatilidad y facilidad de uso, es fundamental actualizarse a los modelos más recientes. Con su avanzado optimizador MuSGD, la funcionalidad ProgLoss + STAL para detectar mejor los objetos pequeños y una compatibilidad completa con múltiples tareas, YOLO26 representa la solución de última generación definitiva para cualquier reto de visión artificial del mundo real.