RTDETRv2 frente a YOLOv10#
La evolución de la visión artificial ha estado impulsada en gran medida por la búsqueda constante del equilibrio entre velocidad y precisión. Tradicionalmente, los flujos de trabajo de detección de objetos en tiempo real han recurrido a la supresión no máxima (NMS) como paso de posprocesamiento para filtrar cajas delimitadoras solapadas. Sin embargo, NMS introduce cuellos de botella en la latencia y obliga a ajustar hiperparámetros complejos. Recientemente han surgido dos enfoques arquitectónicos distintos para resolver este problema de forma nativa: modelos basados en Transformer, como RTDETRv2, y modelos basados en CNN, como YOLOv10.
Esta guía ofrece una comparativa técnica exhaustiva de ambos modelos y analiza sus arquitecturas, métricas de rendimiento y casos de uso ideales. También destaca cómo las últimas innovaciones del ecosistema de Ultralytics ofrecen la solución definitiva para la implementación moderna.
RTDETRv2: transformadores de detección en tiempo real#
RTDETRv2 se basa en la arquitectura RT-DETR original y busca combinar la comprensión del contexto global de los Vision Transformers con los requisitos de velocidad en tiempo real que tradicionalmente han dominado los modelos YOLO.
Características principales:
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: https://github.com/lyuwenyu/RT-DETR/tree/main/rtdetrv2_pytorch
Arquitectura y metodologías de entrenamiento#
RTDETRv2 utiliza una arquitectura Transformer integral que evita NMS de forma inherente. Mejora a su predecesor con un enfoque «Bag-of-Freebies», que optimiza la estrategia de entrenamiento e incorpora capacidades de detección multiescala. El modelo usa una base CNN para extraer mapas de características (detalles visuales como bordes y texturas), que después procesa una estructura codificador-decodificador Transformer. Esto permite al modelo analizar simultáneamente todo el contexto de la imagen y comprender con gran eficacia escenas complejas con objetos densamente agrupados o solapados.
Puntos fuertes y débiles#
Puntos fuertes:
- Contexto global: El mecanismo de atención permite al modelo destacar en entornos complejos y abarrotados.
- Sin NMS: Predice directamente las coordenadas de los objetos y simplifica el flujo de trabajo de implementación.
- Alta precisión: Alcanza una precisión media (mAP) excelente en el conjunto de datos COCO.
Puntos débiles:
- Gran consumo de recursos: Las arquitecturas Transformer suelen requerir mucha más memoria CUDA durante el entrenamiento que las CNN, lo que encarece el ajuste fino en hardware estándar.
- Variabilidad en la velocidad de inferencia: Aunque es rápido, el elevado coste de los cálculos de atención puede reducir los FPS en visión artificial en dispositivos perimetrales sin aceleradores de IA específicos.
Más información sobre RTDETRv2
YOLOv10: detección de objetos integral en tiempo real#
YOLOv10 supone un cambio importante en la línea de detección de objetos YOLO, ya que aborda directamente el antiguo cuello de botella de NMS dentro de un marco CNN.
Características principales:
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Universidad de Tsinghua
- Fecha: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
Arquitectura y metodologías de entrenamiento#
La innovación principal de YOLOv10 son sus asignaciones duales coherentes para el entrenamiento sin NMS. Durante el entrenamiento emplea dos cabezas de detección: una con asignación de uno a muchos (como los YOLO tradicionales) para proporcionar señales de supervisión abundantes y otra con asignación de uno a uno para eliminar la necesidad de NMS. Durante la inferencia solo se utiliza la cabeza de uno a uno, lo que da lugar a un proceso integral. Además, los autores aplicaron una estrategia de diseño de modelos basada en la eficiencia y la precisión, optimizando exhaustivamente distintos componentes para reducir la redundancia computacional.
Puntos fuertes y débiles#
Puntos fuertes:
- Velocidad extrema: Al eliminar NMS y optimizar la arquitectura, YOLOv10 consigue una latencia de inferencia increíblemente baja.
- Eficiencia: Necesita menos parámetros y FLOPs para alcanzar una precisión comparable a la de otros modelos, por lo que resulta muy adecuado para entornos con recursos limitados.
- Implementaciones sin NMS: Simplifica la integración en aplicaciones perimetrales, como la videovigilancia inteligente.
Puntos débiles:
- Concepto de primera generación: Como primer YOLO que implementó esta arquitectura específica sin NMS, sentó las bases, aunque dejó margen para la versatilidad multitarea y la optimización de modelos posteriores, como YOLO11 y YOLO26.
Comparativa de rendimiento#
Al evaluar modelos para producción, es fundamental equilibrar la precisión con el coste computacional. La tabla siguiente destaca las ventajas y desventajas de rendimiento entre distintos tamaños de RTDETRv2 y YOLOv10.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
Aunque RTDETRv2 ofrece una precisión sólida, YOLOv10 presenta una ventaja notable en latencia y eficiencia en el uso de parámetros, especialmente en sus variantes más pequeñas (Nano y Small), lo que lo hace muy atractivo para aplicaciones de computación perimetral e inteligencia artificial de las cosas (AIoT).
Si vas a implementar en GPU de nivel servidor, donde el tamaño de lote y la VRAM tienen menos limitaciones, los modelos grandes (como -x o -l) maximizan la precisión. Para dispositivos perimetrales como Raspberry Pi o teléfonos móviles, prioriza las variantes nano (-n) o small (-s) para mantener tasas de fotogramas en tiempo real.
Casos de uso y recomendaciones#
La elección entre RT-DETR y YOLOv10 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir RT-DETR#
RT-DETR es una excelente opción para:
- Investigación en detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos integral sin NMS.
- Casos que requieren gran precisión y admiten una latencia flexible: Aplicaciones en las que la precisión de detección es prioritaria y se acepta una latencia de inferencia algo mayor.
- Detección de objetos grandes: Escenas con objetos principalmente medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.
Cuándo elegir YOLOv10#
YOLOv10 se recomienda para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección de extremo a extremo sin supresión no máxima, lo que reduce la complejidad de la implementación.
- Equilibrio entre velocidad y precisión: Proyectos que necesitan un buen equilibrio entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
- Aplicaciones con latencia constante: Escenarios de implementación en los que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
La ventaja de Ultralytics: descubre YOLO26#
Aunque RTDETRv2 y YOLOv10 ofrecen avances académicos prometedores, implementarlos en situaciones reales requiere un ecosistema de software sólido y bien mantenido. La plataforma Ultralytics ofrece una experiencia de desarrollo inigualable, que combina facilidad de uso, documentación exhaustiva y herramientas potentes para la anotación de datos y la implementación.
Para los desarrolladores que buscan lo último en 2026, la recomendación definitiva es Ultralytics YOLO26. Sintetiza las mejores ideas de ambas arquitecturas e incorpora mejoras revolucionarias:
- Diseño integral sin NMS: A partir del concepto introducido por YOLOv10, YOLO26 ofrece una cabeza opcional de uno a uno (
nms=False) que omite el posprocesamiento NMS, lo que simplifica y acelera la lógica de implementación y proporciona una latencia más uniforme. - Eliminación de DFL: Al eliminar Distribution Focal Loss, YOLO26 simplifica la exportación de modelos y mejora drásticamente la compatibilidad con dispositivos perimetrales y de bajo consumo.
- Optimizador MuSGD: Este novedoso optimizador, una combinación de SGD y Muon inspirada en las innovaciones del entrenamiento de LLM, proporciona un entrenamiento más estable y una convergencia mucho más rápida que los métodos tradicionales.
- Inferencia en CPU hasta un 43 % más rápida: Se ha optimizado cuidadosamente para entornos sin GPU específica, lo que democratiza la IA visual de alto rendimiento.
- ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, algo fundamental para las aplicaciones con drones y los sensores IoT.
- Versatilidad inigualable: A diferencia de los modelos limitados a las cajas delimitadoras, YOLO26 admite un conjunto completo de tareas, como la segmentación de instancias, la estimación de pose, la clasificación de imágenes y la detección de OBB, con mejoras específicas para cada tarea, como la estimación de máxima verosimilitud residual (RLE) para la pose.
Implementación sencilla con Python#
El entrenamiento y la implementación de estos modelos mediante la API de Python de Ultralytics están diseñados para resultar sencillos. Los requisitos de memoria durante el entrenamiento son notablemente inferiores a los de las arquitecturas que dependen mucho de Transformers, lo que te permite entrenar modelos potentes con hardware estándar.
from ultralytics import YOLO
# Carga el modelo YOLO26 de vanguardia (recomendado)
# También puedes cargar un modelo YOLOv10 con YOLO('yolov10n.pt')
model = YOLO("yolo26n.pt")
# Entrena el modelo con tu conjunto de datos personalizado
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Exporta fácilmente a varios formatos para implementarlo en dispositivos perimetrales
model.export(format="onnx", simplify=True)Tanto si implementas sistemas de alarma de seguridad como si realizas análisis de imágenes médicas, elegir un modelo respaldado por la activa comunidad de Ultralytics te garantiza las herramientas, las guías de ajuste de hiperparámetros y las actualizaciones continuas que necesitas para tener éxito. YOLOv10 y RTDETRv2 allanaron el camino para las arquitecturas sin NMS, pero YOLO26 perfecciona la fórmula y ofrece el mejor equilibrio entre rendimiento, versatilidad y preparación para producción.