Ultralytics YOLO27:
Get Started

DAMO-YOLO frente a YOLOv6-3.0#

La rápida evolución de la visión artificial ha dado lugar a arquitecturas muy especializadas y adaptadas a aplicaciones industriales. Entre ellas, destacan dos pesos pesados por centrarse en el rendimiento en tiempo real y la eficiencia de implementación: DAMO-YOLO y YOLOv6-3.0. Esta página ofrece una comparación técnica en profundidad de sus arquitecturas, métricas de rendimiento y metodologías de entrenamiento para ayudarte a elegir cómo implementarlos.

DAMO-YOLO: la búsqueda de arquitecturas neuronales se une a la detección de objetos#

Desarrollado por investigadores de Alibaba Group, DAMO-YOLO introduce un enfoque novedoso en la familia YOLO al integrar intensivamente la búsqueda de arquitecturas neuronales (NAS) en el diseño de su backbone.

Innovaciones arquitectónicas#

DAMO-YOLO utiliza un backbone optimizado mediante NAS, denominado MAE-NAS, que busca automáticamente las estructuras de red óptimas dentro de unos límites de latencia específicos. Esto permite que el modelo se adapte de manera eficiente a distintos perfiles de hardware. Para mejorar la fusión de características, la arquitectura emplea Efficient RepGFPN (red piramidal de características generalizada reparametrizada), lo que mejora notablemente la representación multiescala.

Además, el modelo introduce un diseño «ZeroHead». Al eliminar las complejas estructuras de múltiples ramas de la cabeza de detección, conserva la información espacial de forma más eficaz y reduce la carga computacional. La metodología de entrenamiento también aprovecha AlignedOTA (asignación de transporte óptimo alineado) y una destilación de conocimiento robusta, que permite a los modelos estudiantes más pequeños aprender de redes docentes de mayor tamaño.

Más información sobre DAMO-YOLO

Complejidad de la destilación

Aunque la destilación de conocimiento ayuda a DAMO-YOLO a alcanzar una gran precisión, requiere un proceso de entrenamiento en varias etapas. Esto aumenta drásticamente el cómputo en GPU necesario en comparación con el entrenamiento de modelos estándar de una sola etapa.

YOLOv6-3.0: máximo rendimiento industrial#

Desarrollado por el Departamento de IA de Visión de Meituan, YOLOv6-3.0 se presenta explícitamente como un detector de objetos industrial, diseñado específicamente para maximizar el rendimiento en hardware NVIDIA.

  • Autores: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu y Xiangxiang Chu
  • Organización: Meituan
  • Fecha: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

Características y mejoras principales#

YOLOv6-3.0 se basa en el backbone EfficientRep, diseñado para aprovechar el hardware, por lo que ofrece una velocidad excepcional al utilizar optimizaciones como TensorRT en GPU modernas. En la versión 3.0, la red incorpora un módulo de concatenación bidireccional (BiC) para mejorar la localización de objetos de distintos tamaños.

Otra característica destacada es la estrategia de entrenamiento asistido por anclajes (AAT). AAT combina la estabilidad de los detectores basados en anclajes durante el entrenamiento con la velocidad de inferencia de un diseño sin anclajes. Este enfoque híbrido logra una convergencia excelente sin sacrificar la latencia de implementación, lo que lo convierte en una opción potente para procesar grandes flujos de vídeo en analítica de ciudades inteligentes y sistemas de pago automatizados.

Más información sobre YOLOv6

Comparativa de rendimiento#

Al evaluar estos modelos para la inferencia en tiempo real, es fundamental equilibrar los parámetros, los FLOPs y la precisión. A continuación se incluye una evaluación detallada que compara su rendimiento.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

Aunque DAMO-YOLO tiene una ligera ventaja en la categoría pequeña (46,0 mAP frente a 45,0 mAP), YOLOv6-3.0 demuestra una escalabilidad superior y destaca en las categorías mediana y grande, a la vez que mantiene el menor número absoluto de parámetros en su configuración nano.

Cómo elegir entre los dos

Si tu entorno de hardware permite realizar búsquedas automatizadas intensivas para personalizar el backbone, el enfoque NAS de DAMO-YOLO resulta muy eficaz. Sin embargo, si dependes por completo de la aceleración GPU estandarizada (como T4 o A100), las estructuras EfficientRep de YOLOv6 suelen traducirse en un mayor número de FPS brutos.

Casos de uso y recomendaciones#

La elección entre DAMO-YOLO y YOLOv6 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.

Cuándo elegir DAMO-YOLO#

DAMO-YOLO es una buena opción para:

  • Analítica de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con FPS elevados en una infraestructura fija de GPU NVIDIA, donde el rendimiento con lotes de tamaño 1 es la métrica principal.
  • Líneas de fabricación industrial: Escenarios con estrictas limitaciones de latencia de GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
  • Investigación sobre búsqueda de arquitecturas neuronales: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de las redes troncales reparametrizadas eficientes en el rendimiento de detección.

Cuándo elegir YOLOv6#

Se recomienda YOLOv6 para:

  • Despliegues adaptados al hardware industrial: situaciones en las que el diseño adaptado al hardware y la reparametrización eficiente del modelo ofrecen un rendimiento optimizado en el hardware de destino específico.
  • Detección rápida en una sola etapa: aplicaciones que priorizan la velocidad de inferencia bruta en GPU para procesar vídeo en tiempo real en entornos controlados.
  • Integración con el ecosistema de Meituan: equipos que ya trabajan con la pila tecnológica y la infraestructura de despliegue de Meituan.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

La ventaja de Ultralytics: descubre YOLO26#

Aunque tanto DAMO-YOLO como YOLOv6-3.0 son muy capaces, sus ecosistemas fragmentados, sus limitaciones a una sola tarea y sus complejos procesos de implementación plantean dificultades. Para los equipos de ingeniería actuales, los modelos de Ultralytics ofrecen una experiencia de desarrollo mucho mejor, que culmina en el revolucionario YOLO26.

Lanzado en enero de 2026, YOLO26 establece un nuevo estándar para la implementación en edge y en la nube, al optimizar considerablemente los requisitos de memoria y la eficiencia computacional.

¿Por qué elegir YOLO26?#

  1. Diseño integral sin NMS: Basándose en conceptos de YOLOv10, YOLO26 admite inferencia nativa de extremo a extremo que omite el postprocesamiento de supresión no máxima mediante su cabeza opcional uno a uno (nms=False). Esto simplifica considerablemente el código de implementación y reduce la variabilidad de la latencia de inferencia en todos los dispositivos edge.
  2. Optimización superior: YOLO26 emplea el optimizador MuSGD, una combinación de SGD y Muon (inspirada en los modelos de lenguaje grandes) que permite entrenamientos muy estables y una convergencia más rápida.
  3. Versatilidad de hardware: Al implementar la eliminación de DFL (Distribution Focal Loss), se simplifican las cabezas de salida y se mejora la compatibilidad con dispositivos edge. De hecho, YOLO26 consigue una inferencia en CPU hasta un 43 % más rápida, por lo que supera ampliamente a YOLOv6 en entornos edge móviles o de IoT.
  4. Mayor precisión: Gracias a ProgLoss + STAL, YOLO26 mejora drásticamente la detección de objetos pequeños, por lo que es la opción óptima para las imágenes aéreas y la inspección de defectos.
  5. Versatilidad sin igual: A diferencia de los modelos industriales que solo detectan cajas delimitadoras, la familia YOLO26 admite varias tareas, como la clasificación de imágenes, la segmentación de instancias, la estimación de poses y las cajas delimitadoras orientadas (OBB).

Una experiencia de ecosistema fluida#

La Ultralytics Platform transforma todo el ciclo de vida del aprendizaje automático. Entrenar un modelo ya no es un engorroso proceso de destilación en varias etapas. Gracias al aumento automático de datos, al ajuste unificado de hiperparámetros y a las exportaciones con un solo clic a formatos como ONNX, OpenVINO y CoreML, pasarás del conjunto de datos a producción en horas, no en semanas.

Además, los modelos de Ultralytics destacan por su eficiencia de memoria, lo que evita los enormes cuellos de botella de VRAM que afectan a arquitecturas Transformer como RT-DETR.

Ejemplo de código para empezar#

Entrenar y ejecutar inferencias con un modelo de Ultralytics como YOLO26 es muy sencillo. El siguiente script de Python muestra cómo puedes entrenar, ejecutar inferencias y exportar el modelo de inmediato con solo unas pocas líneas de código:

from ultralytics import YOLO

# Carga el modelo nano YOLO26, muy eficiente
model = YOLO("yolo26n.pt")

# Entrena el modelo sin complicaciones con tu conjunto de datos personalizado
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Ejecuta la inferencia en una imagen de muestra
prediction = model("https://ultralytics.com/images/bus.jpg")

# Exporta a TensorRT para obtener el máximo rendimiento en GPU
model.export(format="engine", dynamic=True)

Conclusión#

Tanto DAMO-YOLO como YOLOv6-3.0 son logros de ingeniería impresionantes que amplían los límites de la detección de objetos industrial. Sin embargo, son herramientas muy especializadas que suelen requerir configuraciones complejas y están sujetas a estrictas limitaciones de hardware.

Para los desarrolladores e investigadores que exigen un equilibrio perfecto entre rendimiento, capacidades multitarea y un ecosistema bien mantenido de forma activa, Ultralytics YOLO26 no tiene rival. Al combinar optimizadores inspirados en los LLM con una arquitectura sencilla que admite inferencia sin NMS, YOLO26 simplifica la implementación de IA y ofrece una precisión de vanguardia en entornos edge y en la nube.

Si estás evaluando modelos para un nuevo proyecto de visión artificial, te recomendamos explorar las capacidades del ecosistema Ultralytics YOLO. También puede resultarte útil compararlos con otras arquitecturas, como EfficientDet, o con hitos anteriores, como YOLO11, para comprender plenamente la evolución de la IA de visión en tiempo real.

Colaboradores

Comentarios