Ultralytics YOLO27:
Get Started

YOLOv7 frente a EfficientDet#

Elegir la arquitectura de red neuronal óptima es la base de cualquier proyecto de visión artificial que quiera tener éxito. Esta guía ofrece una comparativa técnica detallada entre dos modelos decisivos en la historia de las arquitecturas de detección de objetos: YOLOv7 y EfficientDet. Al examinar sus innovaciones arquitectónicas, metodologías de entrenamiento y escenarios de despliegue ideales, los desarrolladores pueden tomar decisiones fundamentadas. También veremos cómo los avances modernos, en particular el revolucionario Ultralytics YOLO26, han redefinido el estado del arte actual.

Orígenes de los modelos y detalles técnicos#

Ambos modelos fueron desarrollados por destacados equipos de investigación e introdujeron avances importantes en el campo del aprendizaje automático.

YOLOv7

Más información sobre YOLOv7

EfficientDet

Más información sobre EfficientDet

Diferencias arquitectónicas y análisis equilibrado#

Comprender las diferencias estructurales fundamentales entre estas redes es esencial para un despliegue eficaz de modelos.

EfficientDet: escalado compuesto y BiFPN#

Desarrollado dentro del ecosistema TensorFlow, EfficientDet introdujo un enfoque metódico para escalar modelos. En lugar de ampliar o profundizar la red de forma arbitraria, los investigadores de Google utilizaron un método de escalado compuesto que escala de manera uniforme la resolución, la profundidad y la anchura.

Además, EfficientDet introdujo la red piramidal de características bidireccional (BiFPN). Este componente arquitectónico permite fusionar características multiescala de forma sencilla y rápida.

Ventajas: Muy eficiente en cuanto al número de parámetros; alcanza una precisión media promedio (mAP) elevada con menos FLOP que muchos modelos contemporáneos. Desventajas: Depende en gran medida de estrategias de búsqueda heredadas de AutoML. Integrarlo en flujos de trabajo modernos y dinámicos de PyTorch puede resultar complicado, y la latencia en dispositivos Edge suele ser superior a la esperada pese al bajo número de FLOP.

YOLOv7: conjunto de técnicas gratuitas entrenables#

YOLOv7 priorizó la inferencia en tiempo real y la optimización del entrenamiento. Introdujo el concepto de red extendida de agregación eficiente de capas (E-ELAN), que permite que el modelo aprenda continuamente características más diversas sin destruir la ruta de gradiente original. YOLOv7 también empleó una técnica denominada «conjunto de técnicas gratuitas entrenables», que mejora drásticamente la precisión de detección sin aumentar el coste de inferencia.

Ventajas: Velocidades de procesamiento excepcionales y una latencia de inferencia favorable, lo que lo hace ideal para flujos de vídeo con muchos FPS. Desventajas: Aunque es muy capaz, sigue dependiendo de cajas de anclaje y requiere supresión no máxima (NMS) durante el posprocesamiento, lo que puede convertirse en un cuello de botella de latencia en escenas muy concurridas.

Ventajas del ecosistema de Ultralytics

Al evaluar modelos, el ecosistema que los rodea es tan importante como la arquitectura. La Ultralytics Platform integrada ofrece una API unificada, documentación exhaustiva y asistencia activa de la comunidad. Este entorno unificado garantiza un menor uso de memoria durante el entrenamiento que los pesados modelos Transformer, lo que permite crear prototipos con rapidez y realizar un seguimiento de experimentos sin complicaciones.

Métricas de rendimiento y pruebas de referencia#

La tabla siguiente compara las principales métricas de rendimiento para que los desarrolladores puedan evaluar las compensaciones entre velocidad, número de parámetros y precisión.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Como se muestra, aunque EfficientDet-d7 logra un mAP alto, su velocidad con TensorRT queda muy por detrás de la de las variantes de YOLOv7, lo que pone de manifiesto el dominio de estas últimas en la detección de objetos en tiempo real acelerada por GPU.

La evolución de la detección de objetos: YOLO26#

Aunque YOLOv7 y EfficientDet sentaron unas bases fundamentales, el panorama de la IA de visión evoluciona rápidamente. Para las aplicaciones modernas que requieren la máxima eficiencia y precisión, recomendamos encarecidamente actualizar a YOLO26, lanzado en enero de 2026.

YOLO26 aborda las limitaciones inherentes a las generaciones anteriores y ofrece una versatilidad sin precedentes en detección de objetos, segmentación de instancias, clasificación de imágenes y estimación de pose.

Principales innovaciones de YOLO26#

  • Diseño integral sin NMS: YOLO26 ofrece un cabezal opcional uno a uno (nms=False) que omite el posprocesamiento de supresión no máxima (NMS). Este enfoque, introducido inicialmente en YOLOv10, simplifica la lógica de despliegue y garantiza una ejecución constante y de baja latencia, independientemente de la densidad de objetos.
  • Eliminación de DFL: Al eliminar Distribution Focal Loss (DFL), la arquitectura del modelo se simplifica considerablemente, lo que mejora la compatibilidad con entornos de computación en el Edge con recursos muy limitados.
  • Inferencia en CPU hasta un 43 % más rápida: Está muy optimizado para entornos sin GPU dedicada, por lo que es ideal para hardware ligero.
  • Optimizador MuSGD: Inspirado en técnicas de modelos de lenguaje grandes (como Kimi K2 de Moonshot AI), este híbrido de SGD y Muon aporta a la formación en visión artificial la estabilidad y la rápida convergencia propias de los LLM.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, una característica fundamental para las imágenes aéreas y las aplicaciones con drones.
  • Mejoras específicas para cada tarea: Incluye pérdida de segmentación semántica y prototipo multiescala para tareas de segmentación, estimación residual de log-verosimilitud (RLE) para la estimación de pose compleja y una pérdida angular especializada para corregir problemas en los límites de las cajas delimitadoras orientadas (OBB).

Para los equipos que utilizan actualmente sistemas heredados, pasarse a la Ultralytics Platform permite disfrutar de un flujo de trabajo optimizado en el que estos modelos de vanguardia se pueden entrenar y desplegar fácilmente. Los desarrolladores también pueden explorar iteraciones anteriores y sólidas, como YOLO11 y YOLOv8, según sus requisitos específicos de compatibilidad con versiones anteriores.

Entrenamiento optimizado y facilidad de uso#

Una de las características distintivas de los modelos Ultralytics es su extraordinaria facilidad de uso. A diferencia de la compleja configuración de múltiples dependencias que requieren los entornos AutoML de TensorFlow de EfficientDet, Ultralytics ofrece una API sencilla e idiomática de Python.

Este entorno minimiza el uso de memoria CUDA durante el entrenamiento, lo que permite procesar incluso grandes conjuntos de datos de forma eficiente y sin los errores de falta de memoria (OOM) habituales en arquitecturas voluminosas basadas en Transformer.

Ejemplo de código: primeros pasos con Ultralytics#

El siguiente fragmento muestra cómo los desarrolladores pueden aprovechar el paquete Ultralytics para entrenar fácilmente y desde el primer momento un modelo YOLO26 de vanguardia.

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model for object detection
model = YOLO("yolo26n.pt")

# Train the model effortlessly using the integrated Ultralytics ecosystem
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # GPU index; use device='cpu' to train on CPU
    batch=16,
)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the model for edge deployment (e.g., OpenVINO for CPU optimization)
model.export(format="openvino")
Exportación para producción

Los modelos entrenados mediante la API de Ultralytics se pueden exportar al instante a diversos formatos de producción, como OpenVINO u ONNX, lo que garantiza un alto rendimiento en el hardware de destino, sea cual sea.

Casos de uso ideales y aplicaciones reales#

Al diseñar una solución, es imprescindible adaptar las ventajas del modelo al caso de uso específico.

Cuándo utilizar EfficientDet#

EfficientDet sigue siendo una opción para la investigación académica heredada o para entornos vinculados estrictamente al ecosistema de Google Cloud, donde los experimentos de escalado compuesto son el principal objetivo. Sus variantes más pequeñas (d0-d2) resultan útiles cuando el espacio en disco está muy limitado.

Cuándo utilizar YOLOv7#

YOLOv7 destaca en configuraciones heredadas de alto rendimiento, especialmente cuando se prefiere la integración con PyTorch a la de TensorFlow. Sigue utilizándose ampliamente en:

  • Análisis de vídeo: Procesamiento de flujos de seguridad con alta frecuencia de fotogramas y abundante aceleración GPU.
  • Inspección industrial: Detección de defectos en líneas de montaje de fabricación de movimiento rápido.

Cuándo elegir YOLO26#

Para todos los nuevos despliegues, la recomendación indiscutible es YOLO26. Su inigualable equilibrio de rendimiento y su sólido ecosistema con mantenimiento activo lo convierten en la opción óptima para:

  • Ciudades inteligentes y gestión del tráfico: Su diseño sin NMS garantiza una latencia de inferencia constante, fundamental para la coordinación del tráfico en tiempo real.
  • Robótica y sistemas autónomos: El impresionante aumento del 43 % en la velocidad de inferencia en CPU permite que los algoritmos de navegación de los dispositivos integrados respondan con gran rapidez.
  • Vigilancia agrícola y aérea: Utiliza ProgLoss y STAL para identificar con precisión objetos pequeños, como determinados cultivos o animales salvajes, en imágenes tomadas desde gran altitud.

En resumen, aunque EfficientDet y YOLOv7 ofrecen un valioso contexto histórico y utilidad en nichos específicos, los profesionales modernos de la visión artificial obtienen mejores resultados con la arquitectura Ultralytics YOLO26, que resuelve elegantemente los cuellos de botella anteriores y amplía los límites de lo posible en inteligencia artificial.

Comentarios