YOLOv10 frente a DAMO-YOLO#
Al crear canales modernos de computer vision, seleccionar la arquitectura de detección de objetos en tiempo real adecuada es fundamental. En este análisis técnico exhaustivo, exploramos las arquitecturas, las métricas de rendimiento y los casos de uso ideales para YOLOv10 y DAMO-YOLO. Ambos modelos representan saltos significativos en las capacidades de detección de objetos, pero siguen caminos arquitectónicos diferentes para alcanzar sus objetivos.
Ya sea que tu proyecto requiera implementación en hardware de edge AI con limitaciones o exija la máxima precisión en GPU en la nube, comprender los matices de estas arquitecturas te ayudará a tomar una decisión informada.
Explorando YOLOv10#
Introducido por investigadores de la Universidad de Tsinghua, YOLOv10 revolucionó la familia YOLO al presentar un enfoque nativo de extremo a extremo, eliminando de forma efectiva la necesidad de la supresión de no máximos (NMS) durante el posprocesamiento.
Detalles de YOLOv10:
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Tsinghua University
- Fecha: 23-05-2024
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
- Documentación: https://docs.ultralytics.com/models/yolov10
Características arquitectónicas clave#
La innovación principal de YOLOv10 es su estrategia de asignaciones duales consistentes para el entrenamiento sin NMS. Los detectores de objetos tradicionales dependen en gran medida de NMS para filtrar cuadros delimitadores superpuestos, lo que introduce una latencia impredecible, un cuello de botella significativo para aplicaciones en tiempo real como autonomous vehicles y robótica de alta velocidad. Al predecir directamente un único cuadro delimitador óptimo por objeto, YOLOv10 logra una inferencia predecible y de ultrabaja latencia.
Además, el modelo emplea un diseño impulsado por la eficiencia y la precisión holísticas. La arquitectura optimiza varios componentes, incluida una cabeza de clasificación ligera y un submuestreo desacoplado de canal espacial, lo que reduce significativamente la redundancia computacional. Esto da como resultado una arquitectura que cuenta con un menor recuento de parámetros y menos FLOPs mientras mantiene una mean Average Precision (mAP) competitiva.
Ejemplo de uso#
YOLOv10 está profundamente integrado en el ecosistema de Ultralytics, lo que hace que sea increíblemente fácil de usar a través del Ultralytics Python package.
from ultralytics import YOLO
# Load a pre-trained YOLOv10 nano model
model = YOLO("yolov10n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")
# Export the model to TensorRT format
model.export(format="engine", quantize=16)Explorando DAMO-YOLO#
Desarrollado por Alibaba Group, DAMO-YOLO se centra en descubrir estructuras de red altamente eficientes a través de la búsqueda de arquitectura neuronal (NAS) automatizada, con el objetivo de impulsar la frontera de Pareto de velocidad y precisión.
Detalles de DAMO-YOLO:
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
- Organización: Alibaba Group
- Fecha: 23-11-2022
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
Características arquitectónicas clave#
DAMO-YOLO introduce varias tecnologías novedosas adaptadas a las aplicaciones industriales. La base del modelo es su backbone MAE-NAS, generado a través de una búsqueda evolutiva multiobjetivo. Este proceso automatizado descubre estructuras de backbone que se adhieren estrictamente a presupuestos computacionales predefinidos, logrando un fino equilibrio entre la precisión y la latencia de inferencia.
Además, la arquitectura utiliza un cuello Efficient RepGFPN. Esta red de pirámide de características está diseñada para mejorar la fusión de características en diferentes escalas, lo cual es fundamental para tareas complejas como el aerial imagery analysis donde los objetos varían drásticamente de tamaño. Para complementar esto, DAMO-YOLO implementa una ZeroHead, una cabeza de detección minimalista que reduce drásticamente la complejidad de las capas de predicción finales, ahorrando un tiempo de cálculo valioso durante la inferencia.
Más información sobre DAMO-YOLO
Comparación de rendimiento#
Al evaluar las arquitecturas de detección de objetos, encontrar el equilibrio adecuado entre la velocidad de inferencia, la eficiencia de los parámetros y la precisión de la detección es primordial. La siguiente tabla compara el rendimiento de YOLOv10 y DAMO-YOLO a través de sus respectivos tamaños de modelo.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Como se observa en los benchmarks, YOLOv10 ofrece consistentemente perfiles de latencia excepcionales en TensorRT, particularmente en su variante nano, requiriendo significativamente menos parámetros y FLOPs que los modelos comparables de DAMO-YOLO. Si bien DAMO-YOLO ofrece una buena mAP en su variante tiny, la eficiencia de los parámetros y la latencia de inferencia de la familia YOLOv10 proporcionan una ventaja distinta para entornos de despliegue restringidos.
Casos de uso y recomendaciones#
Elegir entre YOLOv10 y DAMO-YOLO depende de los requisitos específicos de tu proyecto, las restricciones de despliegue y las preferencias del ecosistema.
Cuándo elegir YOLOv10#
YOLOv10 es una opción sólida para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de una detección integral (end-to-end) sin NMS, lo que reduce la complejidad de la implementación.
- Equilibrio entre velocidad y precisión: Proyectos que requieren un buen equilibrio entre la velocidad de inferencia y la precisión de detección en varias escalas de modelo.
- Aplicaciones de latencia consistente: Escenarios de despliegue donde los tiempos de inferencia predecibles son críticos, como en robotics o sistemas autónomos.
Cuándo elegir DAMO-YOLO#
DAMO-YOLO se recomienda para:
- Analítica de vídeo de alto rendimiento: Procesamiento de flujos de vídeo de altos FPS en infraestructura de GPU NVIDIA fija, donde el rendimiento por lote (batch-1) es la métrica principal.
- Líneas de fabricación industrial: Escenarios con restricciones estrictas de latencia de GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
- Investigación en búsqueda de arquitectura neuronal: Estudio de los efectos de la búsqueda automatizada de arquitectura (MAE-NAS) y backbones reparametrizados eficientes en el rendimiento de detección.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia de desarrollo:
- Implementación en el borde sin NMS: Aplicaciones que requieren una inferencia consistente y de baja latencia sin la complejidad del posprocesamiento de supresión de no máximos.
- Entornos solo de CPU: Dispositivos sin aceleración de GPU dedicada, donde la inferencia en CPU hasta un 43% más rápida de YOLO26 proporciona una ventaja decisiva.
- Detección de objetos pequeños: Escenarios desafiantes como la aerial drone imagery o el análisis con sensores IoT donde ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
La ventaja de Ultralytics#
Aunque ambos modelos son técnicamente impresionantes, elegir una arquitectura para producción implica mirar más allá de las métricas brutas. Construir con modelos respaldados de forma nativa por el Ultralytics ecosystem ofrece ventajas incomparables tanto para desarrolladores como para investigadores.
Facilidad de uso y ecosistema bien mantenido#
A diferencia de los repositorios académicos independientes que a menudo se enfrentan al abandono, Ultralytics ofrece un ecosistema robusto y mantenido activamente. Configurar entornos complejos para modelos que dependen en gran medida de canales de NAS puede ser desalentador. En contraste, Ultralytics proporciona una API de Python estandarizada e intuitiva y una potente CLI, respaldadas por una extensa documentation. Esto reduce radicalmente el tiempo de comercialización para soluciones de visión personalizadas.
Eficiencia de entrenamiento y requisitos de memoria#
Entrenar modelos grandes puede volverse rápidamente costoso desde el punto de vista computacional. Las arquitecturas de Ultralytics YOLO son históricamente conocidas por su baja huella de memoria CUDA durante el entrenamiento y la inferencia. Esta eficiencia permite a los desarrolladores entrenar modelos en hardware de nivel de consumidor o instancias en la nube rentables sin encontrarse con errores de falta de memoria que son comunes al trabajar con modelos basados en Transformer como RT-DETR.
Ultralytics se integra de forma nativa con las mejores herramientas de MLOps. Puedes realizar un seguimiento fácilmente del progreso de tu entrenamiento de modelos utilizando integraciones con Weights & Biases, Comet o ClearML sin código de relleno adicional.
Versatilidad en todas las tareas#
Una limitación significativa de muchos modelos de detección especializados es su enfoque limitado. Dentro del ecosistema de Ultralytics, no te limitas solo a la detección de objetos. Las herramientas se extienden sin problemas a múltiples computer vision tasks, incluida la instance segmentation, la image classification, la pose estimation y la oriented bounding box (OBB) detection.
Mirando hacia el futuro: La evolución de YOLO26#
Mientras que YOLOv10 fue pionero en la inferencia sin NMS y DAMO-YOLO mostró el poder de NAS, el campo de la computer vision avanza rápidamente. Para los desarrolladores que buscan la solución definitiva de vanguardia, recomendamos consultar Ultralytics YOLO26.
Lanzado como el sucesor definitivo de YOLO11, YOLO26 se basa en la base sin NMS establecida por YOLOv10 pero la lleva mucho más lejos.
Los avances clave en YOLO26 incluyen:
- Hasta un 43% más rápido en inferencia de CPU: optimizado específicamente para la computación en el borde y dispositivos de baja potencia.
- Eliminación de DFL: Se ha eliminado la Distribution Focal Loss, lo que garantiza exportaciones más simples y una mayor compatibilidad con diversos destinos de despliegue.
- Optimizador MuSGD: Un híbrido de SGD y Muon, que aporta estabilidad avanzada de entrenamiento de LLM y una convergencia más rápida directamente a la visión artificial.
- ProgLoss + STAL: Funciones de pérdida drásticamente mejoradas que ofrecen mejoras notables en el reconocimiento de objetos pequeños, lo cual es esencial para casos de uso como agriculture y teledetección.
Utilizando la recién renovada Ultralytics Platform, los desarrolladores pueden anotar, entrenar e implementar sin problemas modelos de próxima generación como YOLO26 en solo unos pocos clics, asegurando que tu canal de computer vision sea tanto de vanguardia como a prueba de futuro.