YOLO Vision 2026:

Análisis comparativo de las opciones de implementación de YOLO26#

YOLO26 es compatible con más de 20 opciones de implementación, cada una optimizada para un tiempo de ejecución, objetivo de hardware o plataforma diferente, desde PyTorch y ONNX hasta TensorRT, OpenVINO, CoreML y formatos dedicados para NPU en el borde. Elegir la opción correcta equilibra la velocidad de inferencia, las restricciones de hardware y la facilidad de integración. Esta guía compara cada opción para que puedas elegir la que mejor se adapte a tu aplicación, y luego pasar a las mejores prácticas de implementación de modelos para desplegarlo de forma fiable.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

La implementación es la etapa en el flujo de trabajo del proyecto de visión artificial donde un modelo entrenado comienza a realizar trabajo real, por lo que el formato al que lo exportas tiene un impacto directo en la velocidad, el costo y la portabilidad.

Cómo seleccionar la opción de implementación adecuada para tu modelo YOLO26#

Cuando sea el momento de implementar tu modelo YOLO26, seleccionar un formato de exportación adecuado es muy importante. Como se detalla en la documentación de exportación de Ultralytics YOLO26, la función model.export() convierte tu modelo entrenado en una variedad de formatos adaptados a diversos entornos y requisitos de rendimiento.

El formato ideal depende del contexto operativo previsto y del hardware de tu modelo.

Sáltate la exportación manual

Para una implementación gestionada sin exportación manual, Ultralytics Platform proporciona puntos de enlace de inferencia listos para usar con escalado automático en 42 regiones globales.

Opciones de implementación de YOLO26#

Aquí tienes una breve descripción de cada formato y cuándo utilizarlo. Para ver el recorrido completo de la exportación, consulta la documentación de exportación; para ver los criterios lado a lado, salta a la tabla de comparación.

  • PyTorch (.pt): El formato nativo de entrenamiento e inferencia, que ofrece la máxima flexibilidad y aceleración por GPU a través de NVIDIA CUDA o AMD ROCm, ideal para investigación y prototipos sin necesidad de un paso de exportación.
  • TorchScript (torchscript): Serializa el modelo para un tiempo de ejecución de C++ sin Python, adecuado para sistemas de producción donde Python no está disponible.
  • ONNX (onnx): Un formato de intercambio independiente de framework con amplio soporte multiplataforma y de hardware a través de ONNX Runtime.
  • OpenVINO (openvino): El kit de herramientas de Intel para una inferencia optimizada en CPU, GPU integradas y NPU de Intel, común en IoT y computación en el borde.
  • TensorRT (engine): El tiempo de ejecución de alto rendimiento de NVIDIA que ofrece inferencia en GPU de primer nivel con optimización FP16 e INT8.
  • CoreML (coreml): El formato en el dispositivo de Apple para iOS, macOS, watchOS y tvOS, que utiliza el Apple Neural Engine.
  • TF SavedModel (saved_model): El formato estándar de TensorFlow para servicios escalables del lado del servidor con TensorFlow Serving.
  • TF GraphDef (pb): Un formato de grafo estático congelado de TensorFlow para entornos que necesitan un grafo de cálculo fijo.
  • TF Edge TPU (edgetpu): Compila modelos .tflite para los aceleradores Google Coral Edge TPU.
  • LiteRT (litert): El tiempo de ejecución en el dispositivo de Google (anteriormente TensorFlow Lite) para inferencia móvil, incrustada y en el navegador a partir de un único modelo .tflite, con soporte para FP32 e INT8 y ejecución en el navegador mediante LiteRT.js.
  • PaddlePaddle (paddle): El framework de aprendizaje automático de Baidu, popular en China, con amplio soporte de hardware.
  • MNN (mnn): Un motor de inferencia ligero y de alto rendimiento optimizado para sistemas móviles e incrustados ARM y x86-64.
  • NCNN (ncnn): Un framework de inferencia ligero y de alto rendimiento adaptado para dispositivos móviles ARM.
  • Sony IMX500 (imx): Exportaciones para el sensor de visión inteligente IMX500 de Sony con procesamiento en el chip, como la Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Apunta a NPU de Rockchip en placas incrustadas con cuantización FP16 e INT8.
  • ExecuTorch (executorch): El tiempo de ejecución nativo en el dispositivo de PyTorch para móviles (iOS y Android) y sistemas incrustados a través de XNNPACK.
  • Axelera AI (axelera): Compila para el AIPU Metis de Axelera (hasta 856 TOPS) a través de PCIe o M.2 para inferencia en el borde de alto rendimiento.
  • DEEPX (deepx): Apunta a hardware NPU DEEPX con cuantización INT8 para inferencia en el borde incrustada.
  • Qualcomm QNN (qnn): Inferencia en el dispositivo en Snapdragon Hexagon NPU, Adreno GPU y CPU a través de la pila de inteligencia artificial de Qualcomm.

La integración con Hailo exporta modelos de detección, segmentación, segmentación semántica, estimación de profundidad, clasificación, pose y OBB de YOLO directamente a Hailo HEF; consulta su tabla de compatibilidad para ver los modelos y objetivos validados. La integración con Ambarella sigue un flujo de trabajo centrado en ONNX y compila las exportaciones ONNX al formato AmbaPB con la cadena de herramientas CVflow de Ambarella para SoC CVflow® como el CV72, utilizando opcionalmente el entrenamiento consciente de la compresión SpongeTorch. La integración con Huawei Ascend compila las exportaciones ONNX al formato sin conexión .om con el compilador CANN ATC para inferencia en FP16 en procesadores Ascend AI.

Comparación de opciones de despliegue#

La siguiente tabla resume las opciones de implementación para modelos YOLO26 en función de los criterios que suelen guiar la elección. Para obtener una visión detallada de cada formato, consulta la documentación de formatos de exportación.

Opción de despliegueBenchmarks de rendimientoCompatibilidad e integraciónSoporte de la comunidad y ecosistemaCasos prácticosMantenimiento y actualizacionesConsideraciones de seguridadAceleración de hardware
PyTorchBuena flexibilidad; puede comprometer el rendimiento brutoExcelente con bibliotecas de PythonAmplios recursos y comunidadInvestigación y prototiposDesarrollo regular y activoDependiente del entorno de despliegueSoporte CUDA para aceleración por GPU
TorchScriptMejor para producción que PyTorchTransición fluida de PyTorch a C++Especializado pero más reducido que PyTorchIndustria donde Python es un cuello de botellaActualizaciones constantes con PyTorchSeguridad mejorada sin Python completoHereda el soporte CUDA de PyTorch
ONNXVariable según el tiempo de ejecuciónAlto en diferentes marcos de trabajoEcosistema amplio, respaldado por muchas organizacionesFlexibilidad entre marcos de MLActualizaciones regulares para nuevas operacionesGarantiza prácticas de conversión y despliegue segurasVarias optimizaciones de hardware
OpenVINOOptimizado para hardware IntelMejor dentro del ecosistema IntelSólido en el campo de la visión artificialIoT y edge con hardware IntelActualizaciones regulares para hardware IntelFunciones robustas para aplicaciones sensiblesAdaptado para hardware Intel
TensorRTDe primer nivel en GPU NVIDIAMejor para hardware NVIDIARed sólida a través de NVIDIAInferencia de vídeo e imagen en tiempo realActualizaciones frecuentes para nuevas GPUÉnfasis en la seguridadDiseñado para GPU NVIDIA
CoreMLOptimizado para hardware Apple en el dispositivoExclusivo para el ecosistema AppleFuerte apoyo de Apple y de la comunidad de desarrolladoresML en el dispositivo en productos AppleActualizaciones regulares de AppleEnfoque en la privacidad y la seguridadApple neural engine y GPU
TF SavedModelEscalable en entornos de servidorAmplia compatibilidad en el ecosistema TensorFlowGran soporte debido a la popularidad de TensorFlowServicio de modelos a escalaActualizaciones regulares de Google y la comunidadFunciones robustas para empresasVarias aceleraciones de hardware
TF GraphDefEstable para grafos de computación estáticosSe integra bien con la infraestructura de TensorFlowRecursos para optimizar grafos estáticosEscenarios que requieren grafos estáticosActualizaciones junto al núcleo de TensorFlowPrácticas de seguridad de TensorFlow establecidasOpciones de aceleración de TensorFlow
TF Edge TPUOptimizado para el hardware Edge TPU de GoogleExclusivo para dispositivos Edge TPUEn crecimiento con recursos de Google y tercerosDispositivos IoT que requieren procesamiento en tiempo realMejoras para el nuevo hardware Edge TPUSeguridad IoT robusta de GoogleDiseñado a medida para Google Coral
LiteRTVelocidad y eficiencia en móviles, dispositivos embebidos y webCompatibilidad con móviles, dispositivos embebidos, edge y navegadoresComunidad sólida, respaldada por GoogleAplicaciones on-device en Android, iOS y webFunciones más recientes de runtime on-deviceInferencia segura on-device y en navegadorAceleración mediante GPU, DSP y WebGPU
PaddlePaddleCompetitivo, fácil de usar y escalableEcosistema Baidu, amplio soporte de aplicacionesCrecimiento rápido, especialmente en ChinaMercado chino y procesamiento de idiomasEnfoque en aplicaciones de IA chinasEnfatiza la privacidad y seguridad de los datosIncluyendo los chips Kunlun de Baidu
MNNAlto rendimiento para dispositivos móvilesSistemas ARM móviles e integrados y CPU X86-64Comunidad de ML móvil/integradoEficiencia de sistemas móvilesMantenimiento de alto rendimiento en dispositivos móvilesVentajas de seguridad en el dispositivoOptimizaciones para CPU y GPU ARM
NCNNOptimizado para dispositivos móviles basados en ARMSistemas ARM móviles e integradosComunidad de ML móvil/integrado pequeña pero activaEficiencia en sistemas Android y ARMMantenimiento de alto rendimiento en ARMVentajas de seguridad en el dispositivoOptimizaciones para CPU y GPU ARM
Sony IMX500Inferencia en el sensor con muy bajo consumoSensor Sony IMX500, Raspberry Pi AI CameraEcosistema Sony AITRIOSIA de borde en cámaraActualizaciones del SDK de Sony y la cadena de herramientas MCTLos datos permanecen en el sensorAcelerador en chip Sony IMX500
Rockchip RKNNOptimizado para NPUs de RockchipPlacas SoC Rockchip (ej. RK3588)Comunidad de desarrolladores de RockchipSBC embebidas y dispositivos de bordeActualizaciones de Rockchip RKNN-ToolkitInferencia local en el dispositivoNPU de Rockchip
ExecuTorchEntorno de ejecución PyTorch eficiente en dispositivoiOS, Android, embebido mediante XNNPACKRespaldado por el proyecto PyTorchAplicaciones móviles y embebidasMantenido junto con PyTorchLa inferencia en el dispositivo mantiene los datos localesBackends XNNPACK y CPU/GPU móviles
Axelera AIMuy alto rendimiento (hasta 856 TOPS)Metis AIPU a través de PCIe o M.2Axelera Voyager SDKInferencia de borde de alto rendimientoActualizaciones del SDK de AxeleraInferencia de borde localAxelera Metis AIPU
DEEPXInferencia de NPU optimizada para INT8Hardware NPU DEEPXHerramientas de desarrollo DEEPX (dx_com, dx_engine)Inferencia de borde embebidaActualizaciones del SDK y entorno de ejecución de DEEPXInferencia local en el dispositivoNPU DEEPX
Qualcomm QNNInferencia rápida en dispositivo SnapdragonSnapdragon Hexagon NPU, Adreno GPU, CPUEcosistema Qualcomm AI HubDispositivos móviles y de borde SnapdragonActualizaciones del stack de IA de Qualcomm (QAIRT)La inferencia en el dispositivo mantiene los datos localesSnapdragon Hexagon NPU

Esta comparación te ofrece una visión general de alto nivel. Para el despliegue, sopesa los requisitos y limitaciones específicos de tu proyecto frente a cada opción y consulta la guía de integración enlazada para el formato que elijas.

Conclusión#

La amplia gama de formatos de exportación de YOLO26 te permite adaptar un modelo a casi cualquier entorno, desde un servidor GPU en la nube hasta una cámara en el borde integrada en el sensor. Una vez que hayas elegido un formato, sigue las mejores prácticas de implementación de modelos para la optimización, la solución de problemas y la seguridad, y apóyate en la comunidad de Ultralytics cuando encuentres algún obstáculo.

FAQ#

  • Ultralytics YOLO26 admite varios formatos de despliegue, cada uno diseñado para entornos y plataformas de hardware específicos. Los formatos clave incluyen:

    • PyTorch para investigación y creación de prototipos, con una excelente integración con Python.
    • TorchScript para entornos de producción donde Python no está disponible.
    • ONNX para compatibilidad multiplataforma y aceleración de hardware.
    • OpenVINO para un rendimiento optimizado en hardware Intel.
    • TensorRT para inferencia de alta velocidad en GPU NVIDIA.

    Cada formato tiene ventajas únicas. Para ver una guía detallada, consulta nuestra documentación del proceso de exportación.

  • Para mejorar la velocidad de inferencia en CPU Intel, puedes desplegar tu modelo YOLO26 usando el kit de herramientas OpenVINO de Intel. OpenVINO ofrece mejoras de rendimiento significativas al optimizar los modelos para aprovechar el hardware de Intel de manera eficiente.

    1. Convierte tu modelo YOLO26 al formato OpenVINO utilizando la función model.export().
    2. Sigue la guía de configuración detallada en la documentación de exportación a Intel OpenVINO.

    Para obtener más información, consulta nuestra entrada de blog.

  • Sí, los modelos YOLO26 se pueden implementar en dispositivos móviles usando LiteRT (anteriormente TensorFlow Lite) y NCNN para Android, y CoreML o LiteRT para iOS. LiteRT es el tiempo de ejecución en el dispositivo de Google para dispositivos móviles e incrustados, y ejecuta el mismo modelo en Android, iOS y el navegador, proporcionando una inferencia eficiente en el dispositivo.

    Ejemplo
    # Export command for NCNN format
    model.export(format="ncnn")

    Para obtener más detalles sobre la implementación de modelos en dispositivos móviles, consulta nuestra guía de integración de LiteRT.

  • Al elegir un formato de despliegue para YOLO26, ten en cuenta los siguientes factores:

    • Rendimiento: Algunos formatos como TensorRT ofrecen velocidades excepcionales en GPU NVIDIA, mientras que OpenVINO está optimizado para hardware Intel.
    • Compatibilidad: ONNX ofrece una amplia compatibilidad en diferentes plataformas.
    • Facilidad de integración: Formatos como CoreML o LiteRT están adaptados a ecosistemas específicos como iOS y Android, respectivamente.
    • Soporte de la comunidad: Formatos como PyTorch y TensorFlow cuentan con amplios recursos y soporte de la comunidad.

    Para realizar un análisis comparativo, consulta nuestra documentación de formatos de exportación.

  • Para implementar modelos YOLO26 en una aplicación web, puedes utilizar LiteRT.js, el tiempo de ejecución web de LiteRT, que permite ejecutar modelos de aprendizaje automático directamente en el navegador y en Node.js. Este enfoque elimina la necesidad de infraestructura de backend y proporciona rendimiento en tiempo real.

    1. Exporta el modelo YOLO26 al formato LiteRT.
    2. Integra el modelo exportado en tu aplicación web usando LiteRT.js.

    Para obtener instrucciones paso a paso, consulta nuestra guía de integración de LiteRT.

Comentarios