Ultralytics YOLO27:

YOLOv7 frente a YOLOX#

La evolución de la visión por ordenador ha estado marcada por rápidos avances en la detección de objetos en tiempo real. Dos hitos decisivos de este recorrido son YOLOv7 y YOLOX. Aunque ambos modelos ampliaron los límites de la velocidad y la precisión, adoptaron filosofías arquitectónicas diferentes para conseguir sus resultados. Esta guía ofrece una comparación técnica exhaustiva entre estos dos potentes modelos para ayudarte a elegir la arquitectura adecuada para tus proyectos de visión por ordenador.

Introducción a los modelos#

Comprender los orígenes y las principales decisiones de diseño de estos modelos es fundamental para implementarlos eficazmente en las operaciones modernas de machine learning.

Detalles de YOLOv7#

Desarrollado por los investigadores que mantuvieron las arquitecturas CSPNet y Scaled-YOLOv4, YOLOv7 introdujo un enfoque de «bag of freebies entrenable» para maximizar la precisión sin aumentar el coste de inferencia.

Más información sobre YOLOv7

Detalles de YOLOX#

YOLOX siguió un camino diferente al devolver el paradigma a la detección sin anclajes, simplificando considerablemente la arquitectura de la cabecera y manteniendo al mismo tiempo un rendimiento sólido.

Aprende más sobre YOLOX

Diferencias e innovaciones arquitectónicas#

Las principales diferencias entre YOLOv7 y YOLOX se encuentran en su enfoque para la extracción de características, la predicción de cuadros delimitadores y la asignación de etiquetas.

YOLOX: el pionero de la detección sin anchors#

YOLOX revolucionó la familia YOLO al pasar a un diseño sin anclajes. Los detectores tradicionales basados en anclajes requieren un ajuste heurístico complejo para la agrupación de cuadros de anclaje, que puede depender en gran medida del conjunto de datos. Al eliminar los cuadros de anclaje, YOLOX redujo significativamente el número de parámetros de diseño. Además, YOLOX utiliza una cabecera desacoplada, que separa las tareas de clasificación y localización en ramas de red distintas. Esto resuelve el conflicto inherente entre clasificar un objeto y regresionar sus coordenadas espaciales. YOLOX también integra estrategias avanzadas de asignación de etiquetas, como SimOTA, que asignan dinámicamente muestras positivas durante el entrenamiento.

YOLOv7: agregación de capas eficientes ampliada#

YOLOv7 volvió a las metodologías basadas en anclajes, pero introdujo la red de agregación de capas eficientes ampliada (E-ELAN). E-ELAN optimiza la longitud de la ruta del gradiente, garantizando que la red aprenda eficazmente con distintas profundidades. La arquitectura se basa en gran medida en técnicas de reparametrización, que fusionan las capas convolucionales durante la inferencia para aumentar la velocidad sin sacrificar precisión. La estrategia de «bag of freebies» de YOLOv7 incluye innovaciones como las convoluciones reparametrizadas planificadas y la asignación de etiquetas guiada de grueso a fino, que elevan la precisión media promedio del modelo a niveles extraordinarios.

Basado en anclajes frente a sin anclajes

Aunque YOLOX simplificó las canalizaciones de implementación con su configuración sin anclajes, las arquitecturas modernas de Ultralytics han perfeccionado desde entonces este enfoque y han eliminado por completo la necesidad de cuadros predefinidos en las generaciones más recientes.

Comparación de rendimiento#

Al evaluar estos modelos para producción, es esencial equilibrar la precisión con la eficiencia computacional. La tabla siguiente ilustra estas ventajas y desventajas, y resalta en negrita las métricas con mejor rendimiento.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Como se muestra arriba, YOLOv7x logra el mAP más alto, lo que lo hace excepcionalmente preciso para conjuntos de datos complejos. Por el contrario, YOLOX-Nano está muy optimizado para restricciones extremas de recursos. Sin embargo, ambos modelos presentan un uso de memoria relativamente elevado durante el entrenamiento en comparación con las arquitecturas modernas.

Metodologías de entrenamiento y ecosistema#

Un factor crucial para investigadores y desarrolladores es la facilidad de implementación. Históricamente, las versiones antiguas de YOLO requerían scripts de C++ muy personalizados o una gestión compleja de dependencias.

La ventaja del ecosistema de Ultralytics#

Hoy, la forma más eficaz de utilizar estas arquitecturas es mediante el ecosistema de Ultralytics, que recibe un mantenimiento constante. Ultralytics proporciona una API de Python unificada y muy intuitiva que simplifica enormemente el entrenamiento, la validación y la implementación.

  • Facilidad de uso: Con solo unas pocas líneas de código, puedes iniciar un ciclo de entrenamiento y reducir la pronunciada curva de aprendizaje asociada a las implementaciones de PyTorch sin abstracciones.
  • Eficiencia del entrenamiento: Los modelos YOLO de Ultralytics utilizan de forma inherente menos memoria durante el entrenamiento que los modelos Transformer pesados, como RT-DETR. Esto permite a los desarrolladores maximizar el tamaño de los lotes en hardware de consumo.
  • Versatilidad: Más allá de los simples cuadros delimitadores, el ecosistema se amplía fácilmente a tareas como la segmentación de instancias y la estimación de poses.

A continuación se muestra un ejemplo ejecutable al 100 % que demuestra cómo entrenar un modelo utilizando la API de Ultralytics:

from ultralytics import YOLO

# Load a pre-trained model
model = YOLO("yolov8n.pt")  # Readily available weights for rapid transfer learning

# Train the model efficiently on your custom data
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    batch=16,
    device="0",  # Utilizes optimal CUDA memory management
)

# Export seamlessly to ONNX or TensorRT
model.export(format="onnx")

Al estandarizar la canalización de exportación, los desarrolladores pueden transferir fácilmente sus pesos a formatos como TensorRT u ONNX, lo que garantiza una inferencia de alta velocidad en el hardware de destino.

Casos de uso ideales y aplicaciones reales#

La elección entre YOLOX y YOLOv7 depende en gran medida de los objetivos de implementación:

  • YOLOX para IA en el edge: Las variantes YOLOX-Nano y YOLOX-Tiny son muy adecuadas para implementarse en dispositivos de bajo consumo. Si estás creando una cámara de seguridad inteligente con una Raspberry Pi, las convoluciones sencillas sin anclajes de YOLOX se adaptan fácilmente a los aceleradores edge.
  • YOLOv7 para análisis de alta fidelidad: Si procesas imágenes por satélite de alta resolución o ejecutas un control de calidad de fabricación complejo, el elevado mAP de YOLOv7x, impulsado por GPU NVIDIA de gama alta, garantiza que se detecten incluso las anomalías más pequeñas.

El futuro: actualízate a Ultralytics YOLO26#

Aunque YOLOv7 y YOLOX fueron revolucionarios cuando aparecieron, el panorama de la visión por ordenador ha avanzado considerablemente. Para las nuevas implementaciones, los desarrolladores deberían optar por Ultralytics YOLO26, lanzado en enero de 2026. Este modelo de vanguardia reúne las mejores teorías arquitectónicas en el sistema definitivo listo para producción.

Estas son las razones por las que se recomienda encarecidamente actualizarse:

  • Diseño integral sin NMS: YOLO26 elimina de forma nativa la supresión de no máximos (NMS) durante el posprocesamiento. Introducido inicialmente en YOLOv10, esto garantiza una latencia baja constante y simplifica la implementación en dispositivos sin compatibilidad de hardware con NMS.
  • Eliminación de DFL: Al eliminar Distribution Focal Loss, YOLO26 consigue una compatibilidad mucho mayor con dispositivos edge de bajo consumo y exportaciones ONNX sencillas.
  • Optimizador MuSGD: Inspirado en las innovaciones del entrenamiento de LLM, YOLO26 utiliza un optimizador híbrido MuSGD que garantiza una convergencia más rápida y una dinámica de entrenamiento extraordinariamente estable.
  • Hasta un 43 % más rápido en inferencia con CPU: Optimizado en gran medida para hardware real, YOLO26 ofrece un rendimiento excelente en CPU estándar sin requerir una infraestructura de GPU costosa.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran considerablemente el reconocimiento de objetos pequeños, una característica fundamental para las inspecciones aéreas con drones y las redes IoT sofisticadas.

Para los desarrolladores que buscan el mejor equilibrio de rendimiento en detección de objetos, segmentación y otras tareas, implementar modelos mediante la plataforma Ultralytics ofrece una experiencia incomparable y sin fricciones.

Conclusión#

Tanto YOLOX como YOLOv7 introdujeron técnicas decisivas que marcaron la trayectoria de la IA de visión de código abierto. YOLOX demostró la viabilidad de las cabeceras desacopladas sin anclajes, mientras que YOLOv7 puso de manifiesto el enorme potencial de la reparametrización de la ruta del gradiente. Hoy, aprovechar el ecosistema de Ultralytics garantiza que puedas extraer el máximo potencial de estas arquitecturas históricas o pasar sin problemas al estado del arte con YOLO26 para preparar tu próxima aplicación de visión por ordenador para el futuro.

Colaboradores

Comentarios