DAMO-YOLO frente a YOLOv6-3.0#
La rápida evolución de la visión artificial ha producido arquitecturas altamente especializadas, adaptadas a aplicaciones industriales. Entre ellas, dos pesos pesados destacan por centrarse en el rendimiento en tiempo real y la eficiencia de despliegue: DAMO-YOLO y YOLOv6-3.0. Esta página ofrece una comparación técnica exhaustiva de sus arquitecturas, métricas de rendimiento y metodologías de entrenamiento para ayudarte a elegir la opción de despliegue más adecuada.
DAMO-YOLO: la búsqueda de arquitecturas neuronales se une a la detección de objetos#
Desarrollado por investigadores de Alibaba Group, DAMO-YOLO introduce un enfoque novedoso en la familia YOLO al integrar ampliamente la búsqueda de arquitecturas neuronales (NAS) en el diseño de su backbone.
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
- Organización: Alibaba Group
- Fecha: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
Innovaciones arquitectónicas#
DAMO-YOLO utiliza un backbone optimizado mediante NAS denominado MAE-NAS, que busca automáticamente las estructuras de red óptimas bajo restricciones de latencia específicas. Esto garantiza que el modelo se adapte de forma eficiente a distintos perfiles de hardware. Para mejorar la fusión de características, la arquitectura emplea una Efficient RepGFPN (red piramidal de características generalizada reparametrizada), lo que mejora significativamente la representación multiescala.
Además, el modelo introduce un diseño «ZeroHead». Al eliminar las estructuras complejas de múltiples ramas en la cabeza de detección, conserva la información espacial de forma más eficaz y reduce la sobrecarga computacional. La metodología de entrenamiento también aprovecha AlignedOTA (asignación de transporte óptimo alineado) y una destilación de conocimiento sólida, lo que permite que modelos estudiante más pequeños aprendan de redes profesor de mayor tamaño.
Más información sobre DAMO-YOLO
Aunque la destilación de conocimiento ayuda a DAMO-YOLO a lograr una gran precisión, requiere una canalización de entrenamiento en varias etapas. Esto aumenta drásticamente el cómputo de GPU necesario en comparación con el entrenamiento de modelos estándar de una sola etapa.
YOLOv6-3.0: maximización del rendimiento industrial#
Desarrollado por el Departamento de Vision AI de Meituan, YOLOv6-3.0 se presenta explícitamente como un detector de objetos industrial, diseñado específicamente para maximizar el rendimiento en hardware NVIDIA.
- Autores: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu y Xiangxiang Chu
- Organización: Meituan
- Fecha: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
Características y mejoras principales#
YOLOv6-3.0 se basa en el backbone EfficientRep, optimizado para el hardware, lo que lo hace excepcionalmente rápido al aprovechar optimizaciones como TensorRT en GPU modernas. En su iteración v3.0, la red integra un módulo de concatenación bidireccional (BiC) para mejorar la localización de objetos de distintos tamaños.
Otra característica destacada es la estrategia de entrenamiento asistido por anclas (AAT). AAT combina la estabilidad de los detectores basados en anclas durante el entrenamiento con la velocidad de inferencia de un diseño sin anclas. Este enfoque híbrido logra una convergencia excelente sin sacrificar la latencia de despliegue, lo que lo convierte en una opción potente para procesar enormes flujos de vídeo en análisis de ciudades inteligentes y sistemas de autopago.
Comparación de rendimiento#
Al evaluar estos modelos para la inferencia en tiempo real, es fundamental equilibrar los parámetros, los FLOPs y la precisión. A continuación se muestra una evaluación detallada que compara su rendimiento.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
Aunque DAMO-YOLO muestra una ligera ventaja en la categoría pequeña (46.0 mAP frente a 45.0 mAP), YOLOv6-3.0 demuestra una escalabilidad superior y gana en las categorías mediana y grande, manteniendo a la vez el menor número absoluto de parámetros en su configuración nano.
Si tu entorno de hardware permite realizar búsquedas automatizadas exhaustivas para personalizar el backbone, el enfoque NAS de DAMO-YOLO es muy eficaz. Sin embargo, si dependes completamente de la aceleración de GPU estandarizada (como T4 o A100), las estructuras EfficientRep de YOLOv6 suelen traducirse en un FPS bruto superior.
Casos de uso y recomendaciones#
La elección entre DAMO-YOLO y YOLOv6 depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias de ecosistema.
Cuándo elegir DAMO-YOLO#
DAMO-YOLO es una buena opción para:
- Análisis de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con un FPS elevado en una infraestructura GPU NVIDIA fija, donde el rendimiento con batch-1 es la métrica principal.
- Líneas industriales de fabricación: Situaciones con estrictas restricciones de latencia GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
- Investigación sobre búsqueda de arquitectura neuronal: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de los backbones reparametrizados eficientes en el rendimiento de la detección.
Cuándo elegir YOLOv6#
YOLOv6 se recomienda para:
- Despliegues industriales conscientes del hardware: situaciones en las que el diseño adaptado al hardware y la reparametrización eficiente del modelo proporcionan un rendimiento optimizado en hardware de destino específico.
- Detección rápida en una sola etapa: aplicaciones que priorizan la velocidad de inferencia bruta en GPU para el procesamiento de vídeo en tiempo real en entornos controlados.
- Integración con el ecosistema de Meituan: equipos que ya trabajan con la pila tecnológica y la infraestructura de despliegue de Meituan.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
La ventaja de Ultralytics: presentamos YOLO26#
Aunque DAMO-YOLO y YOLOv6-3.0 son muy capaces, presentan ecosistemas fragmentados, limitaciones para una sola tarea y canalizaciones de despliegue complejas. Para los equipos de ingeniería modernos, los modelos de Ultralytics ofrecen una experiencia de desarrollo considerablemente mejor, que culmina en el revolucionario YOLO26.
Lanzado en enero de 2026, YOLO26 representa el nuevo estándar para el despliegue en edge y en la nube, optimizando ampliamente los requisitos de memoria y la eficiencia computacional.
¿Por qué elegir YOLO26?#
- Diseño de extremo a extremo sin NMS: Basándose en conceptos de YOLOv10, YOLO26 elimina de forma nativa el posprocesamiento de supresión de no máximos. Esto simplifica significativamente el código de despliegue y reduce la variación de la latencia de inferencia en todos los dispositivos edge.
- Optimización superior: YOLO26 emplea el optimizador MuSGD, una combinación de SGD y Muon (inspirada en los modelos de lenguaje de gran tamaño), que proporciona ejecuciones de entrenamiento muy estables y una convergencia más rápida.
- Versatilidad de hardware: Al implementar la eliminación de DFL (pérdida focal de distribución), se simplifican las cabezas de salida, lo que mejora la compatibilidad con dispositivos edge. De hecho, YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, lo que lo hace muy superior a YOLOv6 en entornos edge móviles o del IoT.
- Precisión mejorada: Mediante el uso de ProgLoss + STAL, YOLO26 consigue mejoras notables en la detección de objetos pequeños, lo que lo convierte en la opción óptima para las imágenes aéreas y la inspección de defectos.
- Versatilidad sin igual: A diferencia de los modelos industriales que solo realizan cuadros delimitadores, la familia YOLO26 admite múltiples tareas, incluyendo Image Classification, Instance Segmentation, Pose Estimation y Oriented Bounding Boxes (OBB).
Experiencia de ecosistema fluida#
La Ultralytics Platform transforma todo el ciclo de vida del machine learning. Entrenar un modelo ya no es un engorroso proceso de destilación en varias etapas. Con aumento de datos automático, ajuste unificado de hiperparámetros y exportaciones con un solo clic a formatos como ONNX, OpenVINO y CoreML, pasas del conjunto de datos a producción en horas, no en semanas.
Además, los modelos de Ultralytics son conocidos por su eficiencia de memoria, evitando los enormes cuellos de botella de VRAM que afectan a arquitecturas Transformer como RT-DETR.
Ejemplo de código de inicio rápido#
Entrenar y ejecutar inferencias con un modelo de Ultralytics como YOLO26 es sorprendentemente sencillo. El siguiente script de Python muestra cómo puedes empezar a realizar el seguimiento de objetos de inmediato con solo unas pocas líneas de código:
from ultralytics import YOLO
# Load the highly efficient, NMS-free YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset seamlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on a sample image
prediction = model("https://ultralytics.com/images/bus.jpg")
# Export to TensorRT for maximum GPU throughput
model.export(format="engine", dynamic=True)Conclusión#
Tanto DAMO-YOLO como YOLOv6-3.0 son impresionantes logros de ingeniería que amplían los límites de la detección industrial de objetos. Sin embargo, son herramientas muy especializadas que a menudo requieren configuraciones complejas y restricciones de hardware rígidas.
Para desarrolladores e investigadores que exigen un equilibrio de rendimiento perfecto, capacidades multitarea y un ecosistema con mantenimiento activo, YOLO26 de Ultralytics no tiene rival. Al combinar optimizadores inspirados en los LLM con una arquitectura limpia y sin NMS, YOLO26 simplifica el despliegue de IA y ofrece una precisión de vanguardia en entornos edge y en la nube.
Si estás evaluando modelos para un nuevo proyecto de visión artificial, te recomendamos encarecidamente explorar las capacidades del ecosistema Ultralytics YOLO. También puede resultarte útil comparar estos modelos con otras arquitecturas, como EfficientDet, o con hitos anteriores, como YOLO11, para comprender plenamente la evolución de la IA de visión en tiempo real.