YOLOv7 frente a YOLOv10#
El campo de la visión artificial ha experimentado avances notables en los últimos años, y la familia de modelos YOLO (You Only Look Once) ha liderado la detección de objetos en tiempo real. Elegir la arquitectura adecuada para tus proyectos de visión artificial requiere conocer a fondo las opciones disponibles. En esta completa comparación técnica, analizaremos las diferencias clave entre dos arquitecturas emblemáticas: YOLOv7 y YOLOv10.
Introducción a los modelos#
Ambos modelos representan hitos importantes en la historia de la inteligencia artificial, pero adoptan enfoques fundamentalmente distintos para resolver los retos de la detección de objetos.
YOLOv7: pionero en técnicas gratuitas#
Publicado el 6 de julio de 2022 por los investigadores Chien-Yao Wang, Alexey Bochkovskiy y Hong-Yuan Mark Liao, del Instituto de Ciencias de la Información de Academia Sinica, YOLOv7 supuso un cambio de paradigma en la optimización de las redes neuronales. La investigación original, descrita en su artículo académico y disponible en su repositorio oficial de GitHub, se centró especialmente en la reparametrización arquitectónica y en una «bolsa de ventajas» entrenable.
YOLOv7 aprovecha una red extendida de agregación eficiente de capas (E-ELAN) para guiar el aprendizaje de características diversas sin destruir la ruta de gradiente original. Esto lo convierte en una opción robusta para las comparativas de investigación académica y los sistemas que dependen en gran medida de GPU estándar de gama alta.
YOLOv10: detección de extremo a extremo en tiempo real#
Desarrollado por Ao Wang y su equipo en la Universidad de Tsinghua, YOLOv10 se publicó el 23 de mayo de 2024. Tal como se detalla en su publicación en arXiv y en el repositorio de GitHub de Tsinghua, este modelo elimina un cuello de botella persistente en la detección de objetos: la supresión no máxima (NMS).
YOLOv10 introdujo asignaciones duales coherentes para el entrenamiento sin NMS, lo que cambió de forma fundamental la canalización de posprocesamiento. Al aplicar una estrategia de diseño integral del modelo basada en la eficiencia y la precisión, YOLOv10 reduce la redundancia computacional. El resultado es una arquitectura especialmente adaptada a dispositivos edge que requieren una latencia extremadamente baja.
Comparativa de rendimiento y métricas#
Al analizar el rendimiento de los modelos, es fundamental evaluar el equilibrio entre precisión, velocidad y coste computacional. La siguiente tabla muestra cómo se comparan entre sí los distintos tamaños de estos modelos.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
Análisis de las compensaciones#
Las métricas anteriores muestran una clara brecha generacional. Aunque YOLOv7x alcanza un mAPval muy sólido del 53,1 %, requiere 71,3 M de parámetros y 189,9 B de FLOPs. En cambio, YOLOv10l supera esa precisión (53,2 % de mAP) con aproximadamente un tercio de los parámetros (24,4 M) y bastantes menos FLOPs (120,3 B). Además, YOLOv10n, altamente optimizado, ofrece una asombrosa velocidad de inferencia de 1,84 ms, lo que lo hace ideal para el análisis de vídeo en tiempo real y las aplicaciones móviles.
Casos de uso reales#
Las diferencias arquitectónicas entre estos modelos determinan sus casos de uso óptimos.
Cuándo utilizar YOLOv7#
Gracias a su rica representación de características, YOLOv7 destaca en entornos muy complejos. Casos de uso como la supervisión del flujo de tráfico en zonas urbanas densas, el análisis de imágenes satelitales o la identificación de defectos en la automatización de la fabricación pesada se benefician de su sólida reparametrización estructural. También se utiliza mucho en entornos heredados ya integrados estrechamente con canalizaciones específicas de PyTorch 1.12.
Cuándo utilizar YOLOv10#
El diseño ligero y sin NMS de YOLOv10 destaca en entornos con recursos limitados. Se recomienda especialmente para dispositivos de computación en el edge, como NVIDIA Jetson Nano o Raspberry Pi. Su rendimiento de baja latencia es ideal para aplicaciones rápidas como el análisis deportivo, la navegación autónoma de drones y la clasificación robótica de alta velocidad en cintas transportadoras.
La ventaja del ecosistema Ultralytics#
Aunque ambos modelos tienen sólidas raíces académicas, el verdadero potencial de YOLOv10 se descubre al utilizarlo en la plataforma unificada Ultralytics. Desarrollar modelos de visión artificial desde cero es notoriamente difícil, pero el ecosistema Ultralytics ofrece una experiencia inigualable a los ingenieros de aprendizaje automático.
- Facilidad de uso: La API Python de Ultralytics ofrece una interfaz unificada. Puedes entrenar, validar y exportar modelos con solo unas pocas líneas de código, sin los complicados problemas de dependencias propios de los repositorios académicos habituales.
- Ecosistema con mantenimiento continuo: Ultralytics garantiza que el código subyacente se desarrolla activamente. Los usuarios se benefician de integraciones perfectas con herramientas populares de ML, como Weights & Biases para el registro de datos o Gradio para crear demostraciones web rápidamente.
- Requisitos de memoria: Los detectores de objetos basados en Transformer suelen consumir muchísima memoria CUDA durante el entrenamiento. En cambio, los modelos YOLO de Ultralytics requieren mucha menos memoria, lo que permite utilizar tamaños de lote mucho mayores en hardware de consumo.
- Versatilidad: La canalización de Ultralytics no se limita a las cajas delimitadoras estándar. Admite sin problemas la estimación de pose, la segmentación de instancias y las cajas delimitadoras orientadas en familias de modelos compatibles como YOLO11 y YOLOv8.
Ejemplo de entrenamiento simplificado#
Ejecutar una canalización de entrenamiento con Ultralytics es extraordinariamente sencillo. Tanto si aprovechas la velocidad sin NMS de YOLOv10 como si utilizas otro modelo compatible, la sintaxis se mantiene (ten en cuenta que el paquete Ultralytics no admite el entrenamiento de YOLOv7):
from ultralytics import YOLO
# Carga el modelo que prefieras (p. ej., YOLOv10 Nano)
model = YOLO("yolov10n.pt")
# Entrena el modelo con el conjunto de datos COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Ejecuta una predicción de inferencia con una imagen de muestra
predictions = model.predict("https://ultralytics.com/images/bus.jpg")
# Exporta a un formato apto para el edge, como ONNX
model.export(format="onnx")Casos de uso y recomendaciones#
La elección entre YOLOv7 y YOLOv10 depende de los requisitos específicos de tu proyecto, las restricciones de despliegue y tus preferencias de ecosistema.
Cuándo elegir YOLOv7#
YOLOv7 es una buena opción para:
- Evaluación comparativa académica: reproducir resultados de vanguardia de 2022 o estudiar los efectos de E-ELAN y las técnicas de conjunto de técnicas gratuitas entrenables.
- Investigación sobre reparametrización: estudiar convoluciones reparametrizadas planificadas y estrategias de escalado compuesto de modelos.
- Flujos personalizados existentes: proyectos con flujos muy personalizados basados en la arquitectura específica de YOLOv7 que no se puedan refactorizar fácilmente.
Cuándo elegir YOLOv10#
YOLOv10 se recomienda para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección de extremo a extremo sin supresión no máxima, lo que reduce la complejidad de la implementación.
- Equilibrio entre velocidad y precisión: Proyectos que necesitan un buen equilibrio entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
- Aplicaciones con latencia constante: Escenarios de implementación en los que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
El futuro: presentamos YOLO26#
Aunque YOLOv7 y YOLOv10 son hitos impresionantes, la frontera de la IA sigue avanzando. Publicado en enero de 2026, Ultralytics YOLO26 es el nuevo estándar indiscutible de eficiencia y precisión para todos los escenarios de despliegue en el edge y en la nube.
Si hoy empiezas un nuevo proyecto de visión artificial, YOLO26 es la arquitectura recomendada. Se basa en el legado de sus predecesores e incorpora varias innovaciones revolucionarias:
- Diseño de extremo a extremo sin NMS: Inspirada en YOLOv10, la cabeza opcional uno a uno de YOLO26 (
nms=False) omite el posprocesamiento NMS y garantiza una inferencia de latencia ultrabaja para la robótica determinista en tiempo real. - Inferencia en CPU hasta un 43 % más rápida: Al eliminar estratégicamente el módulo de pérdida focal de distribución (DFL), YOLO26 acelera drásticamente la ejecución en hardware de computación en el edge sin GPU, lo que lo convierte en una opción potente para dispositivos IoT.
- Optimizador MuSGD: Inspirado en las innovaciones recientes en el entrenamiento de modelos de lenguaje grandes, YOLO26 combina SGD y Muon en un enfoque híbrido que estabiliza las trayectorias de entrenamiento y garantiza una convergencia más rápida.
- ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños y superan una debilidad histórica de las generaciones anteriores de YOLO.
- Versatilidad inigualable: YOLO26 incorpora optimizaciones nativas y específicas para cada tarea, como la estimación de log-verosimilitud residual (RLE) para el seguimiento de pose y funciones de pérdida angular especializadas para detectar OBB con precisión en imágenes aéreas.
Para los ingenieros que buscan el equilibrio definitivo entre velocidad, precisión y sencillez de despliegue, pasar de modelos heredados a YOLO26 ofrece una ventaja competitiva inmediata y cuantificable.