Comparativa entre YOLOv10 y RTDETRv2#
El panorama de la visión por computador avanza a un ritmo vertiginoso, con nuevas arquitecturas que redefinen constantemente el estado del arte en la detección de objetos en tiempo real. Dos hitos importantes de esta evolución son YOLOv10 y RTDETRv2. Ambos modelos pretenden resolver un cuello de botella fundamental de las canalizaciones de detección tradicionales eliminando la necesidad del procesamiento posterior de supresión no máxima (NMS), pero abordan este desafío desde paradigmas arquitectónicos completamente diferentes.
Esta comparativa técnica ofrece un análisis exhaustivo de sus arquitecturas, metodologías de entrenamiento y escenarios de implementación ideales para ayudar a desarrolladores e investigadores a elegir la herramienta adecuada para su próximo proyecto de IA de visión.
YOLOv10: el pionero sin NMS#
Desarrollado por investigadores de la Universidad de Tsinghua, YOLOv10 se centra especialmente en la eficiencia arquitectónica y la eliminación de los cuellos de botella del procesamiento posterior. Mediante la introducción de asignaciones duales coherentes para el entrenamiento sin NMS, logra un rendimiento competitivo y reduce significativamente la latencia de inferencia.
Especificaciones técnicas#
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Universidad de Tsinghua
- Fecha: 2024-05-23
- ArXiv: Artículo de YOLOv10
- GitHub: THU-MIG/yolov10
- Documentación: Documentación de YOLOv10
Arquitectura y metodologías#
El principal avance de YOLOv10 es su diseño del modelo, impulsado de forma integral por la eficiencia y la precisión. Optimiza varios componentes desde ambas perspectivas, reduciendo considerablemente la sobrecarga computacional. La estrategia de asignaciones duales coherentes permite entrenar el modelo sin depender de NMS, lo que se traduce en una canalización de implementación optimizada de extremo a extremo. Esto resulta especialmente beneficioso al exportar modelos a formatos para dispositivos periféricos como ONNX o TensorRT, donde las operaciones de procesamiento posterior pueden introducir una latencia inesperada.
Puntos fuertes y débiles#
El modelo ofrece un equilibrio excepcional entre velocidad y precisión, especialmente en las variantes más pequeñas (N y S). Su latencia mínima lo hace ideal para entornos periféricos de alta velocidad. Sin embargo, aunque YOLOv10 destaca por su velocidad de detección bruta, sigue siendo un modelo especializado exclusivamente en detección. Los equipos que necesiten segmentación de instancias o estimación de la pose tendrán que recurrir a frameworks más versátiles.
RTDETRv2: perfeccionamiento del Transformer de detección#
Basado en el Transformer de detección en tiempo real original, RTDETRv2 incorpora un «bag of freebies» para mejorar su línea base y demuestra que los Transformers pueden competir con las CNN en escenarios en tiempo real.
Especificaciones técnicas#
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 2024-07-24
- ArXiv: Artículo de RTDETRv2
- GitHub: lyuwenyu/RT-DETR
- Documentación: Documentación de RTDETRv2
Arquitectura y metodologías#
RTDETRv2 utiliza una arquitectura híbrida que combina una red neuronal convolucional (CNN) como backbone para la extracción de características visuales con un codificador-decodificador Transformer para comprender la escena de forma integral. El mecanismo de autoatención del Transformer permite al modelo observar la imagen de forma global, lo que lo hace muy eficaz para gestionar escenas complejas, objetos superpuestos y multitudes densas.
Puntos fuertes y débiles#
La arquitectura Transformer ofrece una precisión excelente, especialmente con escalas mayores de parámetros, y genera de forma nativa las detecciones finales sin NMS. Sin embargo, esto tiene un coste. Tradicionalmente, los modelos Transformer requieren mucha más memoria CUDA durante el entrenamiento y pueden converger más despacio que las arquitecturas basadas exclusivamente en CNN. Aunque RTDETRv2 ha mejorado las velocidades de inferencia, por lo general consume más memoria que las variantes ligeras de YOLO.
Comparación de rendimiento#
Evaluar las métricas de rendimiento ofrece una imagen más clara de los aspectos en los que destaca cada modelo. La tabla siguiente resalta sus capacidades en el conjunto de datos COCO:
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Al analizar los datos, YOLOv10 mantiene una ventaja clara en eficiencia de parámetros y velocidad de inferencia con TensorRT en tamaños comparables. RTDETRv2-x iguala en precisión al enorme YOLOv10x, pero requiere casi 20 millones de parámetros más y un número de FLOPs considerablemente mayor.
Casos de uso y recomendaciones#
La elección entre YOLOv10 y RT-DETR depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y las preferencias de tu ecosistema.
Cuándo elegir YOLOv10#
YOLOv10 es una opción sólida para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección integral sin supresión de no máximos, reduciendo la complejidad del despliegue.
- Equilibrios entre velocidad y precisión: Proyectos que requieren un equilibrio sólido entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
- Aplicaciones con latencia coherente: Situaciones de despliegue en las que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.
Cuándo elegir RT-DETR#
RT-DETR se recomienda para:
- Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
- Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
- Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
La ventaja de Ultralytics: ecosistema e innovación#
Aunque YOLOv10 y RTDETRv2 ofrecen capacidades de detección sólidas, elegir un modelo suele depender del ecosistema de software que lo rodea. La plataforma de Ultralytics proporciona una interfaz unificada y fluida que abstrae las complejidades del aprendizaje profundo.
El nuevo estándar: Ultralytics YOLO26#
Para los desarrolladores que buscan el máximo rendimiento, Ultralytics YOLO26 representa la culminación de los avances arquitectónicos recientes. Lanzado a principios de 2026, YOLO26 hereda el diseño de extremo a extremo sin NMS iniciado por YOLOv10 y elimina por completo el procesamiento posterior NMS para lograr una implementación más rápida y sencilla.
YOLO26 incorpora innovaciones del entrenamiento de LLM en la visión por computador mediante el optimizador MuSGD (un híbrido de SGD y Muon), lo que da lugar a un entrenamiento más estable y una convergencia más rápida. También ofrece hasta un 43 % más de velocidad de inferencia en CPU, lo que lo convierte en la opción preferente para la computación periférica.
Además, YOLO26 introduce ProgLoss + STAL para mejorar notablemente el reconocimiento de objetos pequeños y, a diferencia de YOLOv10, que está especializado, ofrece una versatilidad extrema. Admite de forma nativa la detección de objetos, la segmentación, la pose y las cajas delimitadoras orientadas (OBB), con mejoras específicas para cada tarea, como la pérdida de segmentación semántica y la estimación residual de log-verosimilitud (RLE) para la pose. Además, la eliminación de Distribution Focal Loss (DFL) garantiza una exportación simplificada y una mejor compatibilidad con dispositivos de bajo consumo.
Facilidad de uso y eficiencia del entrenamiento#
Tanto si estás experimentando con modelos de generaciones anteriores, como Ultralytics YOLO11, como si trabajas con el vanguardista YOLO26, la API de Python optimizada garantiza un menor uso de memoria durante el entrenamiento y flujos de trabajo extremadamente rápidos.
from ultralytics import RTDETR, YOLO
# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")El ecosistema, bien mantenido, proporciona herramientas para facilitar el ajuste de hiperparámetros y se integra a la perfección con amplias soluciones de seguimiento y opciones de implementación de modelos.
Conclusión#
YOLOv10 y RTDETRv2 representan hitos formidables en la búsqueda de la detección de objetos sin NMS. RTDETRv2 demuestra que los Transformers pueden lograr una latencia en tiempo real con una comprensión excelente del contexto global, aunque con mayores requisitos de memoria. YOLOv10 ofrece una alternativa CNN muy eficiente y rápida, adaptada a tareas de detección con recursos limitados.
Sin embargo, para conseguir un rendimiento equilibrado, versatilidad multitarea y el ecosistema más maduro, se recomienda encarecidamente a los desarrolladores utilizar Ultralytics YOLO26. Combina a la perfección las innovaciones arquitectónicas de sus predecesores con unas herramientas sólidas y fáciles de usar que hacen realidad una implementación fluida de la IA de visión.