Ultralytics YOLO27:

EfficientDet frente a RTDETRv2#

Elegir la arquitectura óptima para proyectos de visión por ordenador requiere desenvolverse en un panorama diverso de redes neuronales. Esta guía analiza una comparación técnica detallada entre dos enfoques distintos: EfficientDet, una familia altamente escalable de redes neuronales convolucionales (CNN), y RTDETRv2, un modelo Transformer de última generación para tiempo real. Evaluamos sus diferencias estructurales, metodologías de entrenamiento y adecuación para el despliegue en diversos entornos de hardware.

Al comprender las ventajas y desventajas entre la eficiencia de los modelos heredados y las capacidades de los Transformer modernos, los desarrolladores pueden tomar decisiones fundamentadas. Además, exploraremos cómo alternativas modernas como el nuevo Ultralytics YOLO26 acortan distancias, ofreciendo una velocidad, precisión y facilidad de uso incomparables.

Conociendo EfficientDet#

EfficientDet revolucionó la detección de objetos al introducir un enfoque sistemático para el escalado de modelos.

Arquitectura y conceptos fundamentales#

En esencia, EfficientDet utiliza EfficientNet como red troncal e introduce la red piramidal de características bidireccional (BiFPN). BiFPN permite fusionar características multiescala de forma sencilla y rápida mediante la aplicación de pesos aprendibles para determinar la importancia de las distintas características de entrada. Esto se combina con un método de escalado compuesto que escala uniformemente la resolución, la profundidad y la anchura de todas las redes troncales, de características y de predicción de cajas/clases al mismo tiempo.

Puntos fuertes y limitaciones#

La principal fortaleza de EfficientDet reside en su eficiencia en cuanto a parámetros. En el momento de su lanzamiento, modelos como EfficientDet-D0 lograban una mayor precisión con menos parámetros y FLOPs que las versiones anteriores de YOLO. Esto lo hacía muy atractivo para entornos con limitaciones estrictas de capacidad de cálculo.

Sin embargo, EfficientDet depende de la supresión de no máximos (NMS) estándar durante el posprocesamiento para filtrar las cajas delimitadoras superpuestas, lo que puede introducir cuellos de botella de latencia en las canalizaciones en tiempo real. Además, aunque el proceso de entrenamiento está bien documentado, ajustar EfficientDet puede resultar engorroso en comparación con las experiencias de desarrollo altamente optimizadas que ofrecen las herramientas modernas.

Más información sobre EfficientDet

Compatibilidad con versiones heredadas

Aunque EfficientDet allanó el camino para las redes escalables, desplegar estos modelos en NPU modernas suele requerir una amplia optimización manual. Para agilizar los despliegues, los nuevos modelos de Ultralytics ofrecen una función de exportación con un solo clic.

Exploración de RTDETRv2#

RTDETRv2 representa la evolución de las arquitecturas basadas en Transformer y cambia el paradigma, alejándose de las CNN tradicionales basadas en anchors.

Avances en los Transformer#

RTDETRv2 se basa en la arquitectura de referencia del Transformer de detección en tiempo real (RT-DETR). Aprovecha mecanismos de atención global, lo que permite al modelo comprender contextos complejos de las escenas sin las restricciones localizadas de las convoluciones estándar. Su ventaja arquitectónica más importante es su diseño nativo sin NMS. Al predecir los objetos directamente a partir de la imagen de entrada, simplifica la canalización de inferencia y evita el ajuste heurístico necesario para el posprocesamiento con NMS.

Puntos fuertes y débiles#

RTDETRv2 destaca en entornos de alta densidad, donde los objetos superpuestos confunden a las CNN tradicionales. Es muy preciso en conjuntos de datos de referencia complejos como COCO.

A pesar de su precisión, los modelos Transformer requieren de forma natural una cantidad considerable de memoria. La eficiencia del entrenamiento es notablemente inferior: necesita muchas más épocas y una mayor cantidad de memoria de CUDA para converger que las CNN. Esto hace que RTDETRv2 sea menos adecuado para desarrolladores que trabajan con presupuestos limitados en la nube o necesitan crear prototipos rápidamente.

Más información sobre RTDETRv2

Limitaciones de memoria de los Transformer

Entrenar modelos Transformer como RTDETRv2 suele requerir GPU de gama alta. Si encuentras errores de falta de memoria (OOM), considera utilizar durante el entrenamiento modelos que requieran menos memoria, como la serie Ultralytics YOLO.

Comparación de referencias de rendimiento#

Comprender las métricas de rendimiento sin procesar es fundamental para seleccionar un modelo. La siguiente tabla muestra la comparación entre EfficientDet y RTDETRv2 en distintos tamaños.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Casos de uso y recomendaciones#

Elegir entre EfficientDet y RT-DETR depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y las preferencias del ecosistema.

Cuándo elegir EfficientDet#

EfficientDet es una buena opción para:

  • Pipelines de Google Cloud y TPU: Sistemas profundamente integrados con las API de Google Cloud Vision o con infraestructuras TPU en las que EfficientDet cuenta con optimización nativa.
  • Investigación sobre escalado compuesto: Evaluaciones académicas centradas en estudiar los efectos de escalar de forma equilibrada la profundidad, la anchura y la resolución de la red.
  • Implementación móvil mediante TFLite: Proyectos que requieren específicamente exportar a TensorFlow Lite para Android o dispositivos Linux integrados.

Cuándo elegir RT-DETR#

RT-DETR se recomienda para:

  • Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
  • Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
  • Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

La ventaja de Ultralytics: presentamos YOLO26#

Aunque EfficientDet y RTDETRv2 se han consolidado en la historia de la visión por ordenador, los entornos de producción modernos exigen un equilibrio perfecto entre velocidad, precisión y una experiencia de desarrollo excepcional. El recientemente lanzado Ultralytics YOLO26 sintetiza los mejores aspectos de estas arquitecturas tan diferentes.

YOLO26 destaca por combinar el ecosistema optimizado por el que se conoce a Ultralytics con mecanismos internos revolucionarios.

¿Por qué elegir YOLO26 frente a la competencia?#

  • Diseño integral sin NMS: Inspirándose en Transformer como RTDETRv2, YOLO26 es integral de forma nativa. Elimina el posprocesamiento con NMS, garantizando canalizaciones de despliegue más rápidas y sencillas sin el enorme exceso de parámetros de los Transformer puros.
  • Optimizador MuSGD: Inspirado en las innovaciones del entrenamiento de modelos de lenguaje de gran tamaño (como Kimi K2 de Moonshot AI), YOLO26 utiliza una combinación híbrida de SGD y Muon. Esto proporciona una estabilidad de entrenamiento sin precedentes y tasas de convergencia significativamente más rápidas en comparación con los programas prolongados que requiere RTDETRv2.
  • Optimizado para el edge: Con una inferencia en CPU hasta un 43 % más rápida, YOLO26 está diseñado para la IA en el edge. Supera fácilmente a los modelos Transformer pesados en hardware limitado, como teléfonos móviles y cámaras inteligentes.
  • Eliminación de DFL: Eliminar Distribution Focal Loss simplifica el grafo del modelo y facilita las exportaciones fluidas a TensorRT y ONNX.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas producen mejoras notables en el reconocimiento de objetos pequeños y resuelven un cuello de botella habitual en las imágenes aéreas y la robótica.
  • Versatilidad: A diferencia de RTDETRv2, que se centra principalmente en la detección, YOLO26 admite de forma nativa la segmentación de instancias, la estimación de poses, la clasificación de imágenes y las cajas delimitadoras orientadas (OBB), con mejoras específicas para cada tarea, como RLE para poses y una función de pérdida de ángulo especializada para OBB.
Ecosistema integrado

Con la plataforma Ultralytics, puedes gestionar tus conjuntos de datos, entrenar modelos como YOLO26 o YOLO11 en la nube y desplegarlos sin problemas mediante API flexibles.

Sencillez del código con Ultralytics#

La API de Python de Ultralytics, bien mantenida, hace que el entrenamiento y la inferencia de modelos sean muy sencillos. Los desarrolladores pueden comparar fácilmente modelos o iniciar scripts de entrenamiento con un código repetitivo mínimo.

from ultralytics import YOLO

# Load the state-of-the-art YOLO26 model
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference on a test image
predictions = model.predict("image.jpg")

Para quienes gestionan infraestructuras heredadas, el ampliamente reconocido Ultralytics YOLOv8 sigue siendo una opción estable y potente que demuestra la fiabilidad a largo plazo del ecosistema de Ultralytics. Tanto si ejecutas algoritmos complejos de seguimiento en tiempo real como una detección de defectos sencilla, actualizar a YOLO26 garantiza que tu sistema esté preparado para el futuro, sea muy preciso y utilice la memoria de forma eficiente.

Comentarios