Ultralytics YOLO27:
Get Started

YOLOv9 frente a YOLOv6-3.0#

La evolución de la detección de objetos en tiempo real ha estado impulsada por la innovación continua en las arquitecturas de redes neuronales, que optimiza el delicado equilibrio entre la velocidad de inferencia, la precisión y la eficiencia computacional. Para que desarrolladores e investigadores puedan desenvolverse en el saturado panorama de los marcos de visión artificial, es fundamental comparar las principales arquitecturas y elegir la herramienta adecuada para cada tarea.

Esta guía técnica ofrece una comparación detallada de dos modelos muy capaces: YOLOv9, conocido por conservar la información durante el aprendizaje profundo, y YOLOv6-3.0, un modelo diseñado específicamente para aplicaciones industriales.

Descripción general de YOLOv9: máxima conservación de características#

Presentado a principios de 2024, YOLOv9 aborda uno de los desafíos más persistentes de las redes neuronales profundas: la pérdida de información durante el proceso de propagación hacia delante. Al garantizar gradientes fiables y que los mapas de características conserven datos esenciales, lleva la precisión teórica a nuevos límites.

  • Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
  • Organización: Institute of Information Science, Academia Sinica, Taiwán
  • Fecha: 21 de febrero de 2024
  • Enlaces: Artículo de Arxiv, repositorio de GitHub

Arquitectura y metodologías#

YOLOv9 introduce el concepto de información de gradiente programable (PGI) junto con la red de agregación de capas eficiente generalizada (GELAN). PGI aborda el cuello de botella de información mediante una supervisión auxiliar que garantiza que la red principal aprenda características sólidas y fiables sin añadir sobrecarga a la inferencia. Por su parte, GELAN optimiza el uso de parámetros y permite al modelo alcanzar una precisión media promedio (mAP) de vanguardia manteniendo unos costes computacionales asumibles. Esto lo convierte en una opción excepcional para el análisis de imágenes médicas o la detección de objetos extremadamente pequeños, donde la fidelidad de las características es fundamental.

Más información sobre YOLOv9

Descripción general de YOLOv6-3.0: diseñado para la industria a gran escala#

Desarrollado por Meituan, YOLOv6-3.0 (también denominado v3.0) se diseñó desde cero para aplicaciones industriales exigentes. Publicado a principios de 2023, se centra especialmente en la eficiencia del despliegue y ofrece una gama de modelos compatibles con la cuantización que funcionan de forma excelente en hardware edge.

  • Autores: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu y Xiangxiang Chu
  • Organización: Meituan
  • Fecha: 13 de enero de 2023
  • Enlaces: Artículo de Arxiv, repositorio de GitHub

Arquitectura y metodologías#

YOLOv6-3.0 se distingue por sus estrategias RepOptimizer y de entrenamiento asistido por anclas (AAT). El modelo utiliza un diseño de red neuronal adaptado al hardware e inspirado en RepVGG, que permite ejecutarlo a gran velocidad en GPU durante la inferencia mediante la fusión de capas. La actualización 3.0 perfeccionó aún más la arquitectura al introducir un módulo de concatenación bidireccional (BiC) para mejorar la precisión de localización. Gracias a su gran optimización para formatos de despliegue como TensorRT y OpenVINO, YOLOv6-3.0 se utiliza con frecuencia en logística, automatización de la fabricación y entornos de servidores de alto rendimiento.

Más información sobre YOLOv6-3.0

Comparativa de rendimiento#

Al evaluar estos modelos con el conjunto de datos COCO estándar, podemos observar claras diferencias entre la precisión y la velocidad de inferencia bruta.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

Análisis técnico#

Aunque YOLOv6-3.0n se impone en velocidad bruta en hardware T4 (1,17 ms), YOLOv9t alcanza un mAP ligeramente superior (38,3 %) con menos de la mitad de parámetros (2,0 M frente a 4,7 M) y muchos menos FLOPs. Para requisitos complejos de alta precisión, YOLOv9e, de gran tamaño, alcanza un mAP del 55,6 %, lo que demuestra la potencia de la arquitectura PGI en redes profundas.

Prepara tu proyecto para el futuro con YOLO26

Si vas a iniciar un nuevo proyecto de visión artificial, te recomendamos encarecidamente utilizar YOLO26. Publicado en 2026, cuenta con un diseño nativo de extremo a extremo sin NMS (nms=False) que elimina la latencia del posprocesamiento de NMS y ofrece hasta un 43 % más de velocidad de inferencia en CPU.

La ventaja del ecosistema Ultralytics#

Sea cual sea la filosofía arquitectónica que prefieras, implementarla de forma nativa mediante la API Python de Ultralytics te ofrece una experiencia de desarrollo superior.

Facilidad de uso y eficiencia del entrenamiento#

Tradicionalmente, entrenar modelos complejos de aprendizaje profundo requiere una gran cantidad de código repetitivo. La plataforma Ultralytics abstrae estas complejidades. Tanto si ajustas YOLOv9 para la detección de defectos como si exportas YOLOv6 para aplicaciones móviles, el flujo de trabajo es muy coherente.

Además, las arquitecturas de Ultralytics suelen necesitar menos memoria CUDA durante el entrenamiento que los voluminosos modelos basados en Transformer. Esto permite a los desarrolladores utilizar tamaños de lote mayores en GPU de consumo, lo que mejora enormemente la eficiencia del entrenamiento.

from ultralytics import YOLO

# Cambia fácilmente de arquitectura modificando la cadena del archivo del modelo
# model = YOLO("yolov6n.yaml")  # YOLOv6 está disponible como configuración YAML (sin pesos preentrenados)
model = YOLO("yolov9c.pt")

# Entrena el modelo con la ampliación de datos y el almacenamiento en caché integrados
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")

# Exporta a ONNX o TensorRT sin complicaciones
model.export(format="engine", quantize=16)

Versatilidad inigualable en tareas de visión#

Aunque YOLOv6-3.0 está muy optimizado para generar rápidamente cuadros delimitadores, los proyectos modernos de visión artificial suelen requerir un enfoque multitarea. Los modelos de Ultralytics destacan por su enorme versatilidad. Con herramientas como Ultralytics YOLOv8 y el nuevo YOLO26, un único marco gestiona sin problemas la detección de objetos, la segmentación de instancias, la clasificación de imágenes, la estimación de pose y los cuadros delimitadores orientados (OBB).

Presentamos YOLO26: el nuevo estándar#

Para las organizaciones que quieren maximizar tanto el rendimiento como la facilidad de despliegue, YOLO26 representa la convergencia definitiva entre velocidad y precisión.

Sobre la base de los avances de YOLO11, YOLO26 incorpora varias características que cambian las reglas del juego:

  • Optimizador MuSGD: Inspirado en técnicas de entrenamiento de modelos de lenguaje grandes (LLM), como Kimi K2 de Moonshot AI, este optimizador híbrido garantiza un entrenamiento muy estable y una convergencia rápida.
  • Eliminación de DFL: Al eliminar Distribution Focal Loss, YOLO26 simplifica el grafo de exportación y mejora considerablemente la compatibilidad con chips de computación edge de bajo consumo.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, algo fundamental para las operaciones con drones y las aplicaciones del IoT.
  • Mejoras específicas para cada tarea: YOLO26 incluye creación de prototipos nativa multiescala para la segmentación, estimación residual de log-verosimilitud (RLE) para la estimación de pose y algoritmos especializados de pérdida angular para resolver casos límite en la detección de OBB.

Escenarios de despliegue ideales#

En última instancia, la elección de la arquitectura adecuada depende de las limitaciones de tu entorno de producción.

Elige YOLOv6-3.0 si ya tienes una cadena de trabajo en fabricación industrial, dependes mucho de la cuantización y utilizas aceleradores de inferencia especializados para los que necesitas la menor latencia de hardware posible.

Elige YOLOv9 si trabajas en diagnósticos sanitarios complejos o en vigilancia de largo alcance, donde no puedes pasar por alto características sutiles a nivel de píxel.

Sin embargo, para lograr un equilibrio perfecto entre precisión de vanguardia y un despliegue simplificado y sin NMS, Ultralytics YOLO26 es la recomendación definitiva para la ingeniería moderna de visión artificial. Su ciclo de desarrollo activo, su documentación completa y el apoyo de una comunidad dinámica lo convierten en una herramienta indispensable tanto para investigadores como para desarrolladores.

Colaboradores

Comentarios