YOLOv8 frente a RTDETRv2#
El panorama de la visión artificial evoluciona constantemente, y las nuevas arquitecturas amplían los límites de lo posible en la detección de objetos en tiempo real. Dos modelos destacados que han despertado un gran interés son Ultralytics YOLOv8 y RTDETRv2, de Baidu. Esta guía ofrece una comparación técnica exhaustiva de ambos modelos y analiza sus arquitecturas, métricas de rendimiento y escenarios de implementación ideales.
Descripción general de YOLOv8#
Ultralytics YOLOv8 es un hito importante en la familia de modelos YOLO (You Only Look Once). Se basa en años de investigación fundamental y ofrece una velocidad, precisión y facilidad de uso excepcionales para una amplia variedad de tareas.
Características principales:
- Autores: Glenn Jocher, Ayush Chaurasia y Jing Qiu
- Organización: Ultralytics
- Fecha: 10 de enero de 2023
- GitHub: Repositorio de Ultralytics
- Documentación: Documentación de YOLOv8
Arquitectura y puntos fuertes#
YOLOv8 presenta una arquitectura simplificada que optimiza tanto la extracción de características como la regresión de cajas delimitadoras. Es un detector sin anclajes, lo que simplifica el cabezal de predicción y reduce el número de ajustes de hiperparámetros necesarios durante el entrenamiento. Esta arquitectura ofrece un excelente equilibrio de rendimiento entre la velocidad de inferencia y la precisión media promedio (mAP), por lo que resulta muy adecuada para implementaciones en el mundo real, tanto en dispositivos edge como en servidores en la nube.
Además, YOLOv8 requiere mucha menos memoria durante el entrenamiento que las arquitecturas basadas en Transformer. Esto permite a los desarrolladores entrenar modelos en GPU de consumo estándar sin quedarse sin memoria.
Versatilidad#
Una de las principales fortalezas de YOLOv8 es su versatilidad nativa. Mientras que muchos modelos se centran únicamente en las cajas delimitadoras, YOLOv8 ofrece compatibilidad lista para usar con la detección de objetos, la segmentación de instancias, la clasificación de imágenes, la estimación de poses y la detección de cajas delimitadoras orientadas (OBB).
Descripción general de RTDETRv2#
RTDETRv2 (Transformer de detección en tiempo real, versión 2) se basa en el RT-DETR original y busca incorporar los potentes mecanismos de atención de los Vision Transformers a las aplicaciones de detección de objetos en tiempo real.
Características principales:
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Repositorio de RT-DETR
- Documentación: README de RTDETRv2
Arquitectura y puntos fuertes#
RTDETRv2 aprovecha una arquitectura híbrida que combina una estructura troncal de red neuronal convolucional (CNN) con una estructura de codificador-decodificador Transformer. Esto permite al modelo captar relaciones espaciales complejas y el contexto global mediante mecanismos de autoatención. Al utilizar un conjunto de estrategias de entrenamiento «bag-of-freebies», RTDETRv2 consigue puntuaciones mAP competitivas en conjuntos de datos de referencia estándar, como el conjunto de datos COCO.
Puntos débiles#
A pesar de su gran precisión, la naturaleza basada en Transformer de RTDETRv2 implica un mayor consumo de memoria y tiempos de entrenamiento más largos que las arquitecturas basadas exclusivamente en CNN. Los Transformer requieren más VRAM por naturaleza, lo que dificulta su entrenamiento en hardware con recursos limitados. Además, aunque RTDETRv2 destaca en detección, carece de la versatilidad multitarea (por ejemplo, para estimar poses y segmentar) propia del ecosistema Ultralytics.
Más información sobre RTDETRv2
Comparativa de rendimiento#
Al evaluar modelos para producción, es fundamental encontrar un equilibrio entre el tamaño del modelo, la velocidad de inferencia y la precisión. La tabla siguiente compara directamente las variantes de YOLOv8 y RTDETRv2.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.1 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Casos de uso y recomendaciones#
La elección entre YOLOv8 y RT-DETR depende de los requisitos concretos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir YOLOv8#
YOLOv8 es una buena opción para:
- Implementaciones versátiles y multitarea: Proyectos que necesitan un modelo probado para detección, segmentación, clasificación y estimación de pose dentro del ecosistema Ultralytics.
- Sistemas de producción consolidados: Entornos de producción existentes basados en la arquitectura YOLOv8, con canalizaciones de implementación estables y bien probadas.
- Amplio respaldo de la comunidad y del ecosistema: Aplicaciones que se benefician de los numerosos tutoriales de YOLOv8, las integraciones de terceros y los recursos de una comunidad activa.
Cuándo elegir RT-DETR#
RT-DETR está recomendado para:
- Investigación en detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos integral sin NMS.
- Casos que requieren gran precisión y admiten una latencia flexible: Aplicaciones en las que la precisión de detección es prioritaria y se acepta una latencia de inferencia algo mayor.
- Detección de objetos grandes: Escenas con objetos principalmente medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
La ventaja de Ultralytics#
Elegir un modelo va más allá de las métricas brutas; el ecosistema de software que lo rodea es crucial para la productividad de los desarrolladores. El ecosistema de Ultralytics es conocido por su facilidad de uso y ofrece una API unificada de Python que simplifica todo el ciclo de vida del aprendizaje automático.
Desde la gestión de conjuntos de datos hasta el entrenamiento distribuido, Ultralytics abstrae el complejo código repetitivo. Los desarrolladores se benefician de pesos preentrenados disponibles y de una integración perfecta con plataformas como Hugging Face y herramientas de supervisión. Este ecosistema bien mantenido garantiza un desarrollo activo, actualizaciones frecuentes y un sólido apoyo de la comunidad.
Además, la eficiencia del entrenamiento es una característica distintiva de los modelos Ultralytics YOLO. Están muy optimizados para converger rápidamente y ocupar menos memoria durante el proceso de entrenamiento, lo que acelera considerablemente los ciclos de experimentación frente a detectores basados en Transformer como RTDETRv2.
De cara al futuro: el potencial de YOLO26#
Aunque YOLOv8 sigue siendo un modelo muy potente, los desarrolladores que busquen lo más avanzado deberían plantearse actualizar a YOLO26, publicado en enero de 2026. YOLO26 redefine el estado del arte con varias innovaciones revolucionarias:
- Diseño integral sin NMS: El cabezal opcional uno a uno de YOLO26 (
nms=False) elimina el posprocesamiento de supresión de máximos no locales (NMS), lo que da lugar a flujos de implementación más rápidos y deterministas. - Eliminación de DFL: La eliminación de la pérdida focal de distribución simplifica el modelo y mejora su compatibilidad con dispositivos periféricos y de bajo consumo.
- Optimizador MuSGD: Al integrar innovaciones del entrenamiento de LLM, el optimizador MuSGD garantiza ejecuciones de entrenamiento más estables y una convergencia más rápida.
- Inferencia con CPU hasta un 43 % más rápida: Optimizado a fondo para entornos sin GPU dedicada.
- ProgLoss + STAL: La pérdida progresiva y la asignación de etiquetas consciente de objetos pequeños ofrecen mejoras notables en el reconocimiento de objetos pequeños, algo esencial en imágenes aéreas y robótica.
Otras alternativas modernas que merece la pena explorar dentro de la suite de Ultralytics incluyen YOLO11, que ofrece un rendimiento sólido para proyectos heredados, aunque se recomienda YOLO26 para todas las implementaciones nuevas.
Ejemplo de código: entrenamiento e inferencia#
La sencillez de la API de Ultralytics permite cargar, entrenar e implementar modelos con solo unas pocas líneas de código Python. Asegúrate de tener PyTorch instalado antes de ejecutar el siguiente ejemplo.
from ultralytics import YOLO
# Carga un modelo YOLOv8 pequeño preentrenado
model = YOLO("yolov8s.pt")
# Entrena el modelo con tu conjunto de datos personalizado
# El entrenamiento eficiente en memoria permite usar tamaños de lote mayores
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)
# Ejecuta la inferencia en una imagen de prueba
results = model("https://ultralytics.com/images/bus.jpg")
# Muestra los resultados
results[0].show()
# Exporta sin complicaciones para la implementación en dispositivos periféricos
export_path = model.export(format="onnx")Ultralytics admite exportaciones con un solo clic a numerosos formatos, incluidos ONNX, TensorRT y CoreML, lo que simplifica las opciones de implementación del modelo en distintas arquitecturas de hardware.
Conclusión#
Tanto YOLOv8 como RTDETRv2 ofrecen capacidades muy interesantes para la detección de objetos en tiempo real. RTDETRv2 demuestra el potencial de los Transformer para captar el contexto global, por lo que resulta adecuado para tareas complejas de razonamiento espacial en las que la velocidad de inferencia y el uso de memoria no son las principales limitaciones.
Sin embargo, para los desarrolladores que priorizan un equilibrio excepcional entre velocidad, precisión y eficiencia de recursos, los modelos Ultralytics YOLO siguen siendo la mejor opción. La naturaleza ligera de YOLOv8, combinada con su facilidad de uso inigualable, su versatilidad en múltiples tareas de visión y un próspero ecosistema de código abierto, lo convierte en la solución preferida para entornos de producción escalables. Para quienes busquen el máximo rendimiento en dispositivos periféricos, el recién publicado YOLO26 ofrece una eficiencia sin NMS inigualable que sigue liderando el sector.