Ultralytics YOLO27:

YOLOv7 frente a YOLOv10#

El campo de la visión por ordenador ha experimentado avances extraordinarios en los últimos años, con la familia de modelos YOLO (solo miras una vez) a la cabeza en la detección de objetos en tiempo real. Elegir la arquitectura adecuada para tus proyectos de visión por ordenador requiere un conocimiento profundo de las opciones disponibles. En esta completa comparación técnica, exploraremos las diferencias clave entre dos arquitecturas emblemáticas: YOLOv7 y YOLOv10.

Introducción a los modelos#

Ambos modelos representan hitos importantes en la historia de la inteligencia artificial, pero adoptan enfoques fundamentalmente distintos para resolver los desafíos de la detección de objetos.

YOLOv7: pionero de las técnicas gratuitas#

Publicado el 6 de julio de 2022 por los investigadores Chien-Yao Wang, Alexey Bochkovskiy y Hong-Yuan Mark Liao del Institute of Information Science, Academia Sinica, YOLOv7 introdujo un cambio de paradigma en la forma de optimizar las redes neuronales. La investigación original, detallada en su artículo académico y alojada en su repositorio oficial de GitHub, se centró especialmente en la reparametrización arquitectónica y en una «bolsa de recursos gratuitos» entrenable.

YOLOv7 utiliza una red ampliada de agregación eficiente de capas (E-ELAN) para guiar a la red en el aprendizaje de características diversas sin destruir la ruta de gradiente original. Esto lo convierte en una opción sólida para las evaluaciones comparativas de investigación académica y los sistemas que dependen en gran medida de GPU de gama alta estándar.

Más información sobre YOLOv7

YOLOv10: detección de extremo a extremo en tiempo real#

Desarrollado por Ao Wang y su equipo en la Universidad de Tsinghua, YOLOv10 se publicó el 23 de mayo de 2024. Como se detalla en su publicación de arxiv y en el repositorio de GitHub de Tsinghua, este modelo elimina un cuello de botella persistente en la detección de objetos: la supresión no máxima (NMS).

YOLOv10 introdujo asignaciones duales coherentes para el entrenamiento sin NMS, alterando fundamentalmente la canalización de posprocesamiento. Al implementar una estrategia holística de diseño de modelos orientada a la eficiencia y la precisión, YOLOv10 reduce la redundancia computacional. El resultado es una arquitectura especialmente adaptada a dispositivos periféricos que requieren una latencia extremadamente baja.

Más información sobre YOLOv10

Arquitectura sin NMS

La eliminación de la supresión no máxima (NMS) en YOLOv10 permite exportar todo el modelo como un único grafo computacional. Esto simplifica enormemente el despliegue mediante runtimes como TensorRT u OpenVINO.

Comparación de rendimiento y métricas#

Al analizar el rendimiento de los modelos, es fundamental evaluar el equilibrio entre precisión, velocidad y carga computacional. La siguiente tabla muestra cómo se comparan entre sí los distintos tamaños de estos modelos.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

Análisis del equilibrio entre factores#

Las métricas anteriores revelan una marcada brecha generacional. Aunque YOLOv7x ofrece un mAPval muy sólido del 53,1 %, requiere 71,3 M de parámetros y 189,9 B de FLOPs. En cambio, YOLOv10l supera esa precisión (53,3 % de mAP) con menos de la mitad de parámetros (29,5 M) y muchos menos FLOPs (120,3 B). Además, el YOLOv10n altamente optimizado proporciona una asombrosa velocidad de inferencia de 1,56 ms, lo que lo hace ideal para el análisis de vídeo en tiempo real y las aplicaciones móviles.

Casos de uso reales#

Las diferencias arquitectónicas entre estos modelos determinan sus casos de uso óptimos.

Cuándo utilizar YOLOv7#

Gracias a su rica representación de características, YOLOv7 destaca en entornos muy complejos. Casos de uso como la supervisión del flujo de tráfico en zonas urbanas densas, el análisis de imágenes de satélite o la identificación de defectos en la automatización industrial se benefician de su sólida reparametrización estructural. También es una opción muy habitual en entornos heredados que ya están profundamente integrados con canalizaciones específicas de PyTorch 1.12.

Cuándo utilizar YOLOv10#

El diseño ligero y sin NMS de YOLOv10 destaca en entornos con recursos limitados. Se recomienda especialmente para dispositivos de computación periférica como NVIDIA Jetson Nano o Raspberry Pi. Su rendimiento de baja latencia lo hace perfecto para aplicaciones rápidas como el análisis deportivo, la navegación autónoma de drones y la clasificación robótica de alta velocidad en cintas transportadoras.

La ventaja del ecosistema de Ultralytics#

Aunque ambos modelos tienen sólidas raíces académicas, su verdadero potencial se desbloquea al utilizarlos en la Plataforma Ultralytics unificada. Desarrollar modelos de visión por ordenador desde cero es notoriamente difícil, pero el ecosistema de Ultralytics proporciona una experiencia inigualable para los ingenieros de machine learning.

  • Facilidad de uso: la API de Python de Ultralytics proporciona una interfaz unificada. Puedes entrenar, validar y exportar modelos con solo unas líneas de código, evitando las complejas pesadillas de dependencias asociadas a los repositorios académicos habituales.
  • Ecosistema bien mantenido: Ultralytics garantiza que el código subyacente se desarrolla activamente. Los usuarios se benefician de integraciones fluidas con herramientas de ML populares como Weights & Biases para el registro de datos o Hugging Face para demostraciones web rápidas.
  • Requisitos de memoria: los detectores de objetos basados en Transformer suelen consumir enormes cantidades de memoria CUDA durante el entrenamiento. En cambio, los modelos YOLO de Ultralytics requieren mucha menos memoria, lo que permite utilizar tamaños de lote mucho mayores en hardware de consumo.
  • Versatilidad: la canalización de Ultralytics no está restringida a los cuadros delimitadores estándar. Admite sin problemas la estimación de poses, la segmentación de instancias y los cuadros delimitadores orientados en familias de modelos compatibles como YOLO11 y YOLOv8.

Ejemplo de entrenamiento simplificado#

Ejecutar una canalización de entrenamiento con Ultralytics es sorprendentemente sencillo. Tanto si aprovechas la solidez histórica de YOLOv7 como la velocidad sin NMS de YOLOv10, la sintaxis se mantiene uniforme:

from ultralytics import YOLO

# Load the preferred model (e.g., YOLOv10 Nano)
model = YOLO("yolov10n.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run an inference prediction on a sample image
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# Export to an edge-friendly format like ONNX
model.export(format="onnx")

Casos de uso y recomendaciones#

La elección entre YOLOv7 y YOLOv10 depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias respecto al ecosistema.

Cuándo elegir YOLOv7#

YOLOv7 es una opción sólida para:

  • Evaluación comparativa académica: reproducir resultados del estado del arte de la época de 2022 o estudiar los efectos de E-ELAN y de las técnicas de conjunto entrenable de técnicas gratuitas.
  • Investigación sobre reparametrización: investigar convoluciones reparametrizadas planificadas y estrategias de escalado compuesto de modelos.
  • Pipelines personalizados existentes: proyectos con pipelines muy personalizados construidos en torno a la arquitectura específica de YOLOv7 que no se pueden refactorizar fácilmente.

Cuándo elegir YOLOv10#

YOLOv10 se recomienda para:

  • Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección integral sin supresión de no máximos, reduciendo la complejidad del despliegue.
  • Equilibrios entre velocidad y precisión: Proyectos que requieren un equilibrio sólido entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
  • Aplicaciones con latencia coherente: Situaciones de despliegue en las que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

El futuro: presentamos YOLO26#

Aunque YOLOv7 y YOLOv10 son hitos impresionantes, la frontera de la IA avanza constantemente. Publicado en enero de 2026, Ultralytics YOLO26 es el nuevo estándar indiscutible de eficiencia y precisión en todos los escenarios de despliegue periférico y en la nube.

Si hoy empiezas un proyecto nuevo de visión por ordenador, YOLO26 es la arquitectura recomendada. Se basa en el legado de sus predecesores e incorpora varias innovaciones revolucionarias:

  • Diseño de extremo a extremo sin NMS: inspirándose en YOLOv10, YOLO26 elimina de forma nativa el posprocesamiento NMS y garantiza una inferencia de latencia ultrabaja para la robótica determinista en tiempo real.
  • Hasta un 43 % más de velocidad de inferencia en CPU: al eliminar estratégicamente el módulo Distribution Focal Loss (DFL), YOLO26 acelera drásticamente la ejecución en hardware periférico de computación que no utiliza GPU, lo que lo convierte en una solución muy potente para dispositivos IoT.
  • Optimizador MuSGD: inspirado en innovaciones recientes del entrenamiento de modelos de lenguaje grandes, YOLO26 incorpora una combinación de SGD y Muon que estabiliza las rutas de entrenamiento y garantiza una convergencia más rápida.
  • ProgLoss + STAL: estas funciones de pérdida avanzadas ofrecen mejoras notables en el reconocimiento de objetos pequeños y superan una debilidad histórica de las generaciones anteriores de YOLO.
  • Versatilidad inigualable: YOLO26 incorpora optimizaciones nativas específicas para cada tarea, como Residual Log-Likelihood Estimation (RLE) para el seguimiento de poses y pérdidas de ángulo especializadas para una detección precisa de OBB en imágenes aéreas.

Para los ingenieros que buscan el equilibrio definitivo entre velocidad, precisión y sencillez de despliegue, pasar de modelos heredados a YOLO26 proporciona una ventaja competitiva inmediata y medible.

Colaboradores

Comentarios