Ultralytics YOLO27:
Get Started

YOLOv7 frente a YOLO11#

El panorama de la visión artificial ha evolucionado rápidamente en los últimos años. Para los desarrolladores e investigadores que eligen el marco adecuado para la detección de objetos, es fundamental comprender las diferencias arquitectónicas y prácticas entre modelos que han definido distintas generaciones. Esta guía ofrece una comparación técnica detallada entre el avance académico que supuso YOLOv7 y Ultralytics YOLO11, una solución muy perfeccionada y lista para producción.

Orígenes de los modelos y filosofías arquitectónicas#

YOLOv7, publicado el 6 de julio de 2022 por Chien-Yao Wang, Alexey Bochkovskiy y Hong-Yuan Mark Liao, autores del Instituto de Ciencias de la Información de Academia Sinica, introdujo varios conceptos novedosos en el campo. El modelo, descrito en detalle en su artículo de investigación YOLOv7 publicado en arXiv, se centra especialmente en el enfoque «bolsa de ventajas entrenable» y en las redes extendidas de agregación eficiente de capas (E-ELAN). Estas decisiones arquitectónicas se diseñaron específicamente para maximizar la eficiencia de las rutas de gradiente, lo que lo convierte en una potente herramienta para las comparativas académicas en GPU de gama alta.

Más información sobre YOLOv7

YOLO11, desarrollado por Glenn Jocher y Jing Qiu en Ultralytics, se publicó el 27 de septiembre de 2024. YOLO11 deja atrás la complejidad puramente arquitectónica y apuesta por un ecosistema integral que prioriza a los desarrolladores. Disponible en el repositorio de Ultralytics en GitHub, YOLO11 incorpora un diseño optimizado sin anclajes que reduce drásticamente el consumo de memoria tanto durante el entrenamiento como durante la inferencia. Está integrado de forma nativa en la plataforma Ultralytics, lo que ofrece una facilidad de uso incomparable, desde el etiquetado de conjuntos de datos hasta el despliegue en el edge.

Ventaja del ecosistema

Mientras que los repositorios independientes suelen quedar abandonados tras la publicación de un artículo académico, los modelos de Ultralytics reciben actualizaciones continuas que garantizan la compatibilidad a largo plazo con las pilas modernas de aprendizaje automático, como las últimas versiones de PyTorch y los aceleradores de hardware especializados.

Métricas de rendimiento y eficiencia#

Al desplegar modelos en aplicaciones reales, hay que equilibrar la precisión bruta con la velocidad de inferencia y la sobrecarga computacional. A continuación se comparan directamente distintas variantes de YOLOv7 y YOLO11, evaluadas en las pruebas de referencia del conjunto de datos COCO.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Nota: La ausencia de velocidades de CPU para YOLOv7 se debe a que los entornos de prueba heredados no estandarizaban las pruebas de referencia de CPU con ONNX. Se resaltan los mejores valores en categorías comparables.

Análisis de los resultados#

Los datos muestran una clara evolución de la eficiencia. El modelo YOLO11l (Large) alcanza un mAPval superior, del 53,4 %, frente al 51,4 % de YOLOv7l, y utiliza muchos menos parámetros (25,3 M frente a 36,9 M) y bastantes menos FLOPs (87,2 B frente a 104,7 B). Esta reducción de la complejidad computacional permite que YOLO11 funcione más rápido con implementaciones de NVIDIA TensorRT y requiera menos VRAM, por lo que resulta mucho más adecuado para entornos con limitaciones de hardware.

Usabilidad y flujos de trabajo de entrenamiento#

La experiencia del desarrollador es una de las principales diferencias entre los dos marcos.

Entrenar YOLOv7#

El uso de la base de código de código abierto original de YOLOv7 suele requerir clonar el repositorio, resolver las dependencias manualmente y recurrir a argumentos de línea de comandos extensos. Gestionar distintas tareas o exportar a formatos móviles suele implicar modificar scripts del código fuente o utilizar bifurcaciones de terceros.

Entrenamiento de YOLO11#

YOLO11 está profundamente integrado en el paquete Python ultralytics, lo que simplifica el ciclo de vida del aprendizaje automático. Entrenar un modelo de detección de objetos solo requiere unas pocas líneas de código, y el marco gestiona de forma nativa la descarga de datos, el ajuste de hiperparámetros y el almacenamiento en caché.

from ultralytics import YOLO

# Carga un modelo YOLO11 Nano preentrenado para obtener la máxima velocidad
model = YOLO("yolo11n.pt")

# Entrena el modelo con el conjunto de datos de ejemplo COCO8
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Exporta el modelo entrenado al formato ONNX para implementarlo
export_path = model.export(format="onnx")

Además, YOLO11 destaca por su gran versatilidad. Con solo cambiar el sufijo del modelo, los desarrolladores pueden pasar al instante de la detección a la segmentación de instancias, el seguimiento de la estimación de pose o el reconocimiento con cajas delimitadoras orientadas (OBB): un nivel de compatibilidad nativa con múltiples tareas del que YOLOv7 carece.

Exportaciones simplificadas

Exportar YOLO11 a formatos para el edge, como Apple CoreML o los marcos Intel OpenVINO, solo requiere un comando .export() y evita las complejas modificaciones del grafo que suelen necesitar los modelos de generaciones anteriores.

Escenarios de despliegue ideales#

Comprender las ventajas de cada modelo permite determinar sus mejores casos de uso.

Mirada al futuro: el cambio de paradigma de YOLO26#

Aunque YOLO11 representa una solución de vanguardia muy perfeccionada, el campo del aprendizaje automático avanza sin descanso. Para quienes empiezan hoy proyectos de visión artificial desde cero, se recomienda encarecidamente explorar el recién publicado Ultralytics YOLO26.

Publicado en enero de 2026, YOLO26 incorpora varias características revolucionarias que superan tanto a YOLOv7 como a YOLO11:

  • Arquitectura nativa sin NMS: La cabeza opcional uno a uno de YOLO26 (nms=False) elimina la necesidad del posprocesamiento de supresión no máxima. Este diseño de extremo a extremo simplifica las canalizaciones de despliegue y reduce drásticamente la variabilidad de la latencia.
  • Inferencia en CPU hasta un 43 % más rápida: Al eliminar estratégicamente el módulo de pérdida focal de distribución (DFL), YOLO26 se optimiza en gran medida para dispositivos edge y entornos sin GPU dedicada.
  • Integración del optimizador MuSGD: Inspirado en técnicas avanzadas de entrenamiento de LLM de Moonshot AI, este optimizador híbrido garantiza una estabilidad de entrenamiento sin precedentes y una convergencia más rápida.
  • Detección superior de objetos pequeños: La incorporación de las funciones de pérdida ProgLoss y STAL mejora notablemente la precisión al identificar detalles diminutos, algo perfecto para analizar imágenes aéreas tomadas con drones y datos complejos de sensores de IoT.

Para quienes tengan interés en arquitecturas basadas en Transformer o paradigmas alternativos, la documentación de Ultralytics también abarca modelos como el detector Transformer RT-DETR y el modelo de vocabulario abierto YOLO-World.

Comentarios