YOLOv10 frente a YOLOv7#
La rápida evolución de la visión por computador durante los últimos años ha dado lugar a arquitecturas cada vez más eficientes para aplicaciones en tiempo real. Comparar YOLOv10 y YOLOv7 pone de relieve un periodo de transición crucial en esta evolución. Mientras que YOLOv7 introdujo estrategias de entrenamiento y escalado arquitectónico muy eficaces, YOLOv10 revolucionó el despliegue al eliminar la dependencia histórica de la supresión no máxima (NMS).
Ambos modelos ampliaron los límites de la detección de objetos cuando se publicaron, pero el moderno ecosistema de Ultralytics y la introducción de modelos de nueva generación como YOLO26 ofrecen flujos de trabajo muy superiores para los profesionales de la IA actuales.
Perfiles y orígenes de los modelos#
Comprender los orígenes de estos modelos aporta un contexto valioso sobre las decisiones de diseño arquitectónico y la investigación académica que los impulsa.
Detalles de YOLOv10#
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Universidad de Tsinghua
- Fecha: 2024-05-23
- Arxiv: YOLOv10: Real-Time End-to-End Object Detection
- GitHub: THU-MIG/yolov10
- Documentación: Documentación de Ultralytics YOLOv10
Detalles de YOLOv7#
- Autores: Chien-Yao Wang, Alexey Bochkovskiy y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwan
- Fecha: 2022-07-06
- Arxiv: YOLOv7: Trainable bag-of-freebies sets new state-of-the-art
- GitHub: WongKinYiu/yolov7
- Documentación: Documentación de Ultralytics YOLOv7
Innovaciones arquitectónicas#
El enfoque de YOLOv7#
Publicado en 2022, YOLOv7 se centró especialmente en optimizar las rutas de gradiente. Introdujo la red de agregación de capas eficiente ampliada (E-ELAN), que permitía al modelo aprender características más diversas sin destruir la ruta de gradiente original. Además, los autores implementaron una metodología de «conjunto entrenable de técnicas gratuitas», utilizando técnicas de reparametrización durante el entrenamiento que podían fusionarse durante la inferencia para mantener velocidades de ejecución rápidas. A pesar de estas impresionantes optimizaciones, YOLOv7 seguía dependiendo en gran medida de NMS para el posprocesamiento, lo que generaba una latencia variable durante el análisis de escenas densas.
El avance de YOLOv10#
YOLOv10 abordó directamente el cuello de botella de NMS. Al introducir asignaciones duales coherentes durante el entrenamiento, el equipo de Tsinghua University habilitó la detección de extremo a extremo sin NMS. Este enfoque de doble cabeza utiliza una rama con asignaciones de uno a muchos para obtener señales de supervisión enriquecidas durante el entrenamiento y otra rama con asignaciones de uno a uno para la inferencia sin NMS. Este cambio arquitectónico garantiza una latencia de inferencia ultrabaja y coherente, adecuada para el análisis de vídeo de alta velocidad. Además, YOLOv10 emplea un diseño de modelo integral orientado a la eficiencia y la precisión, eliminando la redundancia computacional presente en generaciones anteriores.
Eliminar el posprocesamiento NMS no solo acelera la inferencia, sino que también simplifica considerablemente el despliegue en hardware de IA en el borde, como aceleradores de IA y NPU, donde las operaciones NMS personalizadas son especialmente difíciles de compilar.
Comparación de rendimiento#
Al comparar las métricas sin procesar en el conjunto de datos MS COCO, la brecha generacional resulta evidente. YOLOv10 logra un equilibrio mucho más favorable entre el número de parámetros, los requisitos computacionales y la precisión.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Como se muestra arriba, YOLOv10x alcanza un mAP superior del 54,4 % frente al 53,1 % de YOLOv7x, utilizando aproximadamente un 20 % menos de parámetros. Además, los modelos ligeros de YOLOv10 (Nano y Small) ofrecen velocidades excepcionales de despliegue con TensorRT, lo que los hace especialmente atractivos para el despliegue móvil.
La ventaja del ecosistema de Ultralytics#
Aunque estudiar artículos sobre arquitecturas resulta útil, el desarrollo moderno de la visión por computador depende de frameworks sólidos y bien mantenidos. Elegir un modelo compatible con Ultralytics ofrece una gran ventaja a los desarrolladores que buscan pasar rápidamente del prototipo a producción.
Desarrollo simplificado#
Puedes acceder tanto a YOLOv10 como a YOLOv7 mediante el paquete estándar de Ultralytics para Python. Esto proporciona una Facilidad de uso incomparable y sustituye miles de líneas de código repetitivo por una API sencilla e intuitiva. Además, los modelos YOLO de Ultralytics requieren mucha menos memoria CUDA durante el entrenamiento que las arquitecturas Transformer pesadas, lo que permite utilizar tamaños de lote mayores en hardware de consumo.
Versatilidad incomparable#
Mientras que los repositorios antiguos suelen centrarse exclusivamente en la detección mediante cajas delimitadoras, el framework integrado de Ultralytics admite sin problemas una enorme variedad de tareas. Tanto si realizas segmentación de instancias, estimación de poses o detección con cajas delimitadoras orientadas (OBB), el flujo de trabajo sigue siendo idéntico.
Ejemplo de código: flujos de trabajo de entrenamiento coherentes#
El siguiente fragmento de código muestra el proceso de entrenamiento fluido, que gestiona automáticamente el aumento de datos y la programación de la tasa de aprendizaje:
from ultralytics import YOLO
# Load the desired model (YOLOv10, YOLOv7, or the recommended YOLO26)
model = YOLO("yolo26n.pt")
# Train the model effortlessly on your dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# Export to ONNX format for rapid deployment
model.export(format="onnx")Casos de uso y recomendaciones#
Elegir entre YOLOv10 y YOLOv7 depende de los requisitos específicos de tu proyecto, las limitaciones de despliegue y tus preferencias de ecosistema.
Cuándo elegir YOLOv10#
YOLOv10 es una opción sólida para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección integral sin supresión de no máximos, reduciendo la complejidad del despliegue.
- Equilibrios entre velocidad y precisión: Proyectos que requieren un equilibrio sólido entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
- Aplicaciones con latencia coherente: Situaciones de despliegue en las que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.
Cuándo elegir YOLOv7#
YOLOv7 se recomienda para:
- Evaluación comparativa académica: reproducir resultados del estado del arte de la época de 2022 o estudiar los efectos de E-ELAN y de las técnicas de conjunto entrenable de técnicas gratuitas.
- Investigación sobre reparametrización: investigar convoluciones reparametrizadas planificadas y estrategias de escalado compuesto de modelos.
- Pipelines personalizados existentes: proyectos con pipelines muy personalizados construidos en torno a la arquitectura específica de YOLOv7 que no se pueden refactorizar fácilmente.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
El nuevo estándar: presentación de YOLO26#
Aunque YOLOv10 supuso un gran salto adelante en 2024, el panorama de la visión por computador evoluciona a una velocidad increíble. Para cualquier desarrollo nuevo, recomendamos encarecidamente el modelo de última generación: Ultralytics YOLO26. Publicado en enero de 2026, representa la cima absoluta de la IA de visión en tiempo real y supera ampliamente tanto a YOLOv7 como a YOLOv10.
YOLO26 incorpora innovaciones sin precedentes diseñadas específicamente para los entornos de despliegue modernos:
- Diseño de extremo a extremo sin NMS: basándose en los cimientos establecidos por YOLOv10, YOLO26 elimina de forma nativa el posprocesamiento NMS para simplificar los pipelines de despliegue y ofrecer una inferencia coherente a alta velocidad.
- Hasta un 43 % más de velocidad de inferencia en CPU: optimizado especialmente para la computación en el borde y los dispositivos sin GPU dedicadas, lo que permite ahorrar considerablemente en costes de hardware.
- Eliminación de DFL: la pérdida focal de distribución se ha eliminado por completo, lo que simplifica radicalmente la lógica de exportación y mejora enormemente la compatibilidad con dispositivos de borde de bajo consumo y microcontroladores.
- Optimizador MuSGD: inspirado en Kimi K2 de Moonshot AI, esta combinación híbrida de SGD y Muon incorpora innovaciones del entrenamiento de modelos de lenguaje grandes (LLM) directamente a la visión por computador, lo que produce dinámicas de entrenamiento extremadamente estables y una convergencia más rápida.
- ProgLoss + STAL: estas funciones de pérdida avanzadas ofrecen mejoras notables en el reconocimiento de objetos pequeños, un área históricamente difícil que resulta crucial para drones, robótica y la supervisión de ciudades inteligentes.
- Mejoras específicas por tarea: YOLO26 no es solo un detector. Incluye una pérdida especializada para la segmentación semántica, estimación residual de log-verosimilitud (RLE) para un seguimiento de poses de precisión extrema y algoritmos especializados de pérdida angular para eliminar los problemas de límites de OBB.
Para disfrutar de la mejor experiencia posible al gestionar tus conjuntos de datos, entrenar YOLO26 y desplegar modelos en la nube, explora la plataforma de Ultralytics. Ofrece una interfaz sin código que complementa perfectamente el SDK de Python.
Casos de uso reales#
Elegir la arquitectura adecuada depende en gran medida de las limitaciones de tu hardware y aplicación.
Cuándo usar YOLOv7#
YOLOv7 sigue siendo una opción fiable para mantener pipelines heredados que ya están profundamente integrados con sus estructuras tensoriales específicas o para reproducir benchmarks académicos de 2022 y 2023. Ofrece un rendimiento excelente en GPU de servidor de alta gama.
Cuándo usar YOLOv10#
YOLOv10 destaca en situaciones que requieren una latencia estricta e invariable. Al no utilizar NMS, es excelente para el recuento de multitudes de alta densidad o la detección de defectos de fabricación, donde el número de objetos fluctúa enormemente, pero el tiempo de procesamiento por fotograma debe mantenerse constante.
Cuándo utilizar YOLO26#
YOLO26 es la opción definitiva para cualquier proyecto nuevo. Desde desplegar sofisticados sistemas de alarma de seguridad en una Raspberry Pi básica hasta ejecutar análisis de vídeo masivos basados en la nube, sus velocidades superiores en CPU y su avanzada detección de objetos pequeños lo hacen muy superior a las generaciones anteriores.
Para los desarrolladores interesados en explorar arquitecturas modernas alternativas, también ofrecemos amplia compatibilidad con detectores basados en Transformer como RT-DETR y modelos de referencia de generaciones anteriores como Ultralytics YOLO11.