Ultralytics YOLO27:

Análisis comparativo de las opciones de despliegue de YOLO26#

YOLO26 admite más de 20 opciones de despliegue, cada una optimizada para un entorno de ejecución, objetivo de hardware o plataforma diferente: desde PyTorch y ONNX hasta TensorRT, OpenVINO, CoreML y formatos específicos para NPU de dispositivos periféricos. Elegir la opción adecuada requiere equilibrar la velocidad de inferencia, las limitaciones del hardware y la facilidad de integración. Esta guía compara todas las opciones para que puedas elegir la más adecuada para tu aplicación y, después, consultar las prácticas recomendadas para el despliegue de modelos para desplegarla de forma fiable.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

El despliegue es la fase del flujo de trabajo de un proyecto de visión artificial en la que un modelo entrenado empieza a realizar trabajo real, por lo que el formato al que lo exportes influye directamente en la velocidad, el coste y la portabilidad.

Cómo seleccionar la opción de despliegue adecuada para tu modelo YOLO26#

Cuando llega el momento de desplegar tu modelo YOLO26, es muy importante seleccionar un formato de exportación adecuado. Como se explica en la documentación de exportación de Ultralytics YOLO26, la función model.export() convierte tu modelo entrenado a diversos formatos adaptados a distintos entornos y requisitos de rendimiento.

El formato ideal depende del contexto operativo previsto para tu modelo y del hardware.

Omite la exportación manual

Para realizar un despliegue gestionado sin exportación manual, Ultralytics Platform proporciona endpoints de inferencia listos para usar, con escalado automático en 42 regiones de todo el mundo.

Opciones de despliegue de YOLO26#

Aquí tienes una breve descripción de cada formato y de cuándo utilizarlo. Para consultar el proceso completo de exportación, visita la documentación de exportación; para ver los criterios comparados, ve directamente a la tabla comparativa.

  • PyTorch (.pt): el formato nativo de entrenamiento e inferencia, que ofrece la máxima flexibilidad y aceleración mediante GPU con NVIDIA CUDA o AMD ROCm, ideal para investigación y creación de prototipos sin necesidad de realizar ningún paso de exportación.
  • TorchScript (torchscript): serializa el modelo para un entorno de ejecución en C++ sin Python, adecuado para sistemas de producción en los que Python no está disponible.
  • ONNX (onnx): un formato de intercambio independiente de cualquier framework, con amplia compatibilidad multiplataforma y de hardware mediante ONNX Runtime.
  • OpenVINO (openvino): el kit de herramientas de Intel para inferencia optimizada en CPU, GPU integradas y NPU de Intel, habitual en IoT y computación periférica.
  • TensorRT (engine): el entorno de ejecución de alto rendimiento de NVIDIA, que ofrece inferencia mediante GPU de primer nivel con optimización FP16 e INT8.
  • CoreML (coreml): el formato de Apple para ejecución en el dispositivo en iOS, macOS, watchOS y tvOS, mediante Apple Neural Engine.
  • TF SavedModel (saved_model): el formato estándar de TensorFlow para servir modelos de forma escalable en el servidor con TensorFlow Serving.
  • TF GraphDef (pb): un formato de TensorFlow basado en un grafo estático congelado para entornos que necesitan un grafo de cálculo fijo.
  • TF Edge TPU (edgetpu): compila modelos .tflite para aceleradores Google Coral Edge TPU.
  • LiteRT (litert): el entorno de ejecución de Google para dispositivos (antes TensorFlow Lite), destinado a la inferencia móvil, integrada y en navegadores a partir de un único modelo .tflite, con compatibilidad con FP32 e INT8 y ejecución en el navegador mediante LiteRT.js.
  • PaddlePaddle (paddle): el framework de deep learning de Baidu, popular en China y con amplia compatibilidad de hardware.
  • MNN (mnn): un motor de inferencia ligero y de alto rendimiento, optimizado para sistemas ARM y x86-64 móviles e integrados.
  • NCNN (ncnn): un framework de inferencia ligero y de alto rendimiento, optimizado para dispositivos móviles ARM.
  • Sony IMX500 (imx): exportaciones para el sensor de visión inteligente Sony IMX500 con procesamiento en el propio chip, como la Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): está destinado a las NPU de Rockchip en placas integradas, con cuantización FP16 e INT8.
  • ExecuTorch (executorch): el entorno de ejecución nativo de PyTorch para dispositivos móviles (iOS y Android) y sistemas integrados mediante XNNPACK.
  • Axelera AI (axelera): compila para la AIPU Metis de Axelera (hasta 856 TOPS) mediante PCIe o M.2 para inferencia periférica de alto rendimiento.
  • DEEPX (deepx): está destinado al hardware NPU de DEEPX, con cuantización INT8 para inferencia periférica integrada.
  • Qualcomm QNN (qnn): inferencia en el dispositivo mediante la NPU Hexagon, la GPU Adreno y la CPU de Snapdragon, a través de la pila de IA de Qualcomm.
  • Core AI (coreai): el nuevo formato .aimodel de Apple para iOS 27 y macOS 27, programado en CPU, GPU y Apple Neural Engine; la exportación requiere macOS 26 o posterior en silicio de Apple.

La integración con Hailo exporta directamente a Hailo HEF modelos YOLO de detección, segmentación, segmentación semántica, estimación de profundidad, clasificación, pose y OBB; consulta su tabla de compatibilidad para ver los modelos y objetivos validados. La integración con Ambarella sigue un flujo de trabajo basado primero en ONNX y compila las exportaciones de ONNX al formato AmbaPB con la cadena de herramientas CVflow de Ambarella para SoC CVflow®, como el CV72, utilizando opcionalmente el entrenamiento con compresión consciente de SpongeTorch. La integración con Huawei Ascend compila las exportaciones de ONNX al formato sin conexión .om con el compilador CANN ATC para inferencia FP16 en procesadores de IA Ascend.

Comparativa de las opciones de despliegue#

La siguiente tabla resume las opciones de despliegue para modelos YOLO26 según los criterios que suelen determinar la elección. Para consultar un análisis detallado de cada formato, visita la documentación de formatos de exportación.

Opción de desplieguePruebas de rendimientoCompatibilidad e integraciónAsistencia de la comunidad y ecosistemaCasos prácticosMantenimiento y actualizacionesConsideraciones de seguridadAceleración de hardware
PyTorchBuena flexibilidad; puede sacrificar rendimiento brutoExcelente con bibliotecas de PythonAmplios recursos y comunidadInvestigación y prototiposDesarrollo periódico y activoDepende del entorno de despliegueCompatibilidad con CUDA para acelerar la GPU
TorchScriptMejor para producción que PyTorchTransición fluida de PyTorch a C++Especializado, pero más limitado que PyTorchEntornos en los que Python es un cuello de botellaActualizaciones coherentes con PyTorchSeguridad mejorada sin Python completoHereda la compatibilidad con CUDA de PyTorch
ONNXVariable según el entorno de ejecuciónAlta entre distintos frameworksAmplio ecosistema, compatible con muchas organizacionesFlexibilidad entre frameworks de MLActualizaciones periódicas para nuevas operacionesAsegúrate de aplicar prácticas seguras de conversión y despliegueDiversas optimizaciones de hardware
OpenVINOOptimizado para hardware de IntelMejor dentro del ecosistema de IntelSólido en el ámbito de la visión artificialIoT y dispositivos periféricos con hardware de IntelActualizaciones periódicas para hardware de IntelFunciones robustas para aplicaciones sensiblesAdaptado al hardware de Intel
TensorRTDe primer nivel en GPU de NVIDIAMejor para hardware de NVIDIARed sólida a través de NVIDIAInferencia de vídeo e imágenes en tiempo realActualizaciones frecuentes para nuevas GPUÉnfasis en la seguridadDiseñado para GPU de NVIDIA
CoreMLOptimizado para hardware de Apple en el dispositivoExclusivo del ecosistema de AppleSólido respaldo de Apple y de la comunidad de desarrolladoresML en el dispositivo en productos de AppleActualizaciones periódicas de AppleEnfoque en la privacidad y la seguridadApple Neural Engine y GPU
TF SavedModelEscalable en entornos de servidorAmplia compatibilidad en el ecosistema de TensorFlowAmplio respaldo gracias a la popularidad de TensorFlowServicio de modelos a gran escalaActualizaciones periódicas de Google y de la comunidadFunciones robustas para empresasDiversas aceleraciones de hardware
TF GraphDefEstable para grafos de cálculo estáticosSe integra bien con la infraestructura de TensorFlowRecursos para optimizar grafos estáticosEscenarios que requieren grafos estáticosActualizaciones junto con el núcleo de TensorFlowPrácticas de seguridad de TensorFlow consolidadasOpciones de aceleración de TensorFlow
TF Edge TPUOptimizado para el hardware Edge TPU de GoogleExclusivo para dispositivos Edge TPUEn crecimiento gracias a los recursos de Google y de tercerosDispositivos IoT que requieren procesamiento en tiempo realMejoras para el nuevo hardware Edge TPULa sólida seguridad IoT de GoogleDiseñado específicamente para Google Coral
LiteRTVelocidad y eficiencia en dispositivos móviles, integrados y webCompatibilidad con dispositivos móviles, integrados, edge y navegadoresComunidad sólida, respaldada por GoogleAplicaciones en el dispositivo para Android, iOS y la webFunciones más recientes de ejecución en el dispositivoInferencia segura en el dispositivo y en el navegadorAceleración mediante GPU, DSP y WebGPU
PaddlePaddleCompetitivo, fácil de usar y escalableEcosistema de Baidu y amplia compatibilidad con aplicacionesCrecimiento rápido, especialmente en ChinaMercado chino y procesamiento del lenguajeEnfoque en aplicaciones de IA chinasDa prioridad a la privacidad y la seguridad de los datosIncluidos los chips Kunlun de Baidu
MNNAlto rendimiento para dispositivos móvilesSistemas ARM móviles e integrados y CPU X86-64Comunidad de ML móvil e integradoEficiencia en sistemas móvilesMantenimiento de un alto rendimiento en dispositivos móvilesVentajas de seguridad en el dispositivoOptimizaciones para CPU y GPU ARM
NCNNOptimizado para dispositivos móviles basados en ARMSistemas ARM móviles e integradosComunidad de ML móvil e integrado pequeña, pero activaEficiencia en sistemas Android y ARMMantenimiento de un alto rendimiento en ARMVentajas de seguridad en el dispositivoOptimizaciones para CPU y GPU ARM
Sony IMX500Inferencia en el sensor con un consumo muy bajoSensor Sony IMX500, Raspberry Pi AI CameraEcosistema Sony AITRIOSIA edge en la cámaraActualizaciones del SDK y la cadena de herramientas MCT de SonyLos datos permanecen en el sensorAcelerador integrado en el chip Sony IMX500
Rockchip RKNNOptimizado para NPU de RockchipPlacas SoC de Rockchip (p. ej., RK3588)Comunidad de desarrolladores de RockchipDispositivos SBC integrados y edgeActualizaciones de Rockchip RKNN-ToolkitInferencia local en el dispositivoNPU de Rockchip
ExecuTorchEntorno de ejecución PyTorch eficiente en el dispositivoiOS, Android e integrados mediante XNNPACKRespaldado por el proyecto PyTorchAplicaciones móviles e integradasMantenido junto con PyTorchLa inferencia en el dispositivo mantiene los datos localesBackends XNNPACK y de CPU/GPU móviles
Axelera AIRendimiento muy elevado (hasta 856 TOPS)Metis AIPU mediante PCIe o M.2SDK Axelera VoyagerInferencia edge de alto rendimientoActualizaciones del SDK de AxeleraInferencia edge localAxelera Metis AIPU
DEEPXInferencia NPU optimizada para INT8Hardware NPU de DEEPXHerramientas para desarrolladores de DEEPX (dx_com, dx_engine)Inferencia edge integradaActualizaciones del SDK y el entorno de ejecución de DEEPXInferencia local en el dispositivoNPU de DEEPX
Qualcomm QNNInferencia rápida en el dispositivo con SnapdragonNPU Snapdragon Hexagon, GPU Adreno, CPUEcosistema Qualcomm AI HubDispositivos Snapdragon móviles y edgeActualizaciones de la pila de IA de Qualcomm (QAIRT)La inferencia en el dispositivo mantiene los datos localesNPU Snapdragon Hexagon
HailoInferencia INT8 HEF en NPU de HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler y HailoRTCámaras, robots y sistemas perimetrales industrialesLanzamientos de Hailo DFC y HailoRTInferencia local en el dispositivoNPU de Hailo
Huawei AscendMayor rendimiento en el núcleo de Ascend AI CorePlacas Atlas y OrangePi AIProEcosistema Huawei CANNInferencia perimetral en NPU de AscendLanzamientos de CANN y ATCInferencia local en el dispositivoAscend AI Core
Core AIOptimizado para silicio de AppleiOS 27 y macOS 27; la exportación requiere macOS 26+Marco de Apple; aún no disponible en los SDKs de iOS/FlutterML en el dispositivo en plataformas Apple de próxima generaciónVinculado a los lanzamientos del sistema operativo de Apple; actualmente en fase betaLa inferencia en el dispositivo mantiene los datos localesApple Neural Engine, GPU y CPU

Esta comparación te ofrece una visión general. Para el despliegue, sopesa los requisitos y las limitaciones específicos de tu proyecto frente a cada opción y consulta la guía de integración enlazada correspondiente al formato que elijas.

Conclusión#

La amplia variedad de formatos de exportación de YOLO26 te permite adaptar un modelo a casi cualquier entorno, desde un servidor GPU en la nube hasta una cámara edge con inferencia en el sensor. Cuando hayas elegido un formato, sigue las buenas prácticas de despliegue de modelos para la optimización, la resolución de problemas y la seguridad, y recurre a la comunidad de Ultralytics cuando encuentres algún obstáculo.

Preguntas frecuentes#

  • Ultralytics YOLO26 admite varios formatos de despliegue, cada uno diseñado para entornos y plataformas de hardware específicos. Entre los formatos principales se incluyen:

    • PyTorch para investigación y creación de prototipos, con una excelente integración con Python.
    • TorchScript para entornos de producción en los que Python no está disponible.
    • ONNX para compatibilidad multiplataforma y aceleración de hardware.
    • OpenVINO para un rendimiento optimizado en hardware Intel.
    • TensorRT para inferencia de alta velocidad en GPU NVIDIA.

    Cada formato ofrece ventajas únicas. Para consultar un recorrido detallado, visita nuestra documentación del proceso de exportación.

  • Para mejorar la velocidad de inferencia en CPU Intel, puedes desplegar tu modelo YOLO26 mediante el kit de herramientas OpenVINO de Intel. OpenVINO ofrece importantes mejoras de rendimiento al optimizar los modelos para aprovechar el hardware Intel de forma eficiente.

    1. Convierte tu modelo YOLO26 al formato OpenVINO mediante la función model.export().
    2. Sigue la guía de configuración detallada de la documentación de exportación de Intel OpenVINO.

    Para obtener más información, consulta nuestra publicación del blog.

  • Sí, los modelos YOLO26 se pueden desplegar en dispositivos móviles usando LiteRT (anteriormente TensorFlow Lite) y NCNN en Android, y CoreML o LiteRT en iOS. LiteRT es el runtime en el dispositivo de Google para dispositivos móviles e integrados, y ejecuta el mismo modelo en Android, iOS y el navegador, ofreciendo una inferencia eficiente en el dispositivo.

    Ejemplo
    # Export command for NCNN format
    model.export(format="ncnn")

    Para obtener más información sobre el despliegue de modelos en dispositivos móviles, consulta nuestra guía de integración de LiteRT.

  • Al elegir un formato de despliegue para YOLO26, ten en cuenta los siguientes factores:

    • Rendimiento: Algunos formatos, como TensorRT, ofrecen velocidades excepcionales en GPU NVIDIA, mientras que OpenVINO está optimizado para hardware Intel.
    • Compatibilidad: ONNX ofrece una amplia compatibilidad entre distintas plataformas.
    • Facilidad de integración: Formatos como CoreML o LiteRT están diseñados para ecosistemas específicos como iOS y Android, respectivamente.
    • Compatibilidad de la comunidad: Formatos como PyTorch y TensorFlow cuentan con amplios recursos y soporte de la comunidad.

    Para consultar un análisis comparativo, revisa nuestra documentación sobre formatos de exportación.

  • Para desplegar modelos YOLO26 en una aplicación web, puedes usar LiteRT.js, el runtime web de LiteRT, que permite ejecutar modelos de aprendizaje automático directamente en el navegador y en Node.js. Este enfoque elimina la necesidad de infraestructura de backend y ofrece rendimiento en tiempo real.

    1. Exporta el modelo YOLO26 al formato LiteRT.
    2. Integra el modelo exportado en tu aplicación web usando LiteRT.js.

    Para consultar instrucciones paso a paso, revisa nuestra guía de integración de LiteRT.

Comentarios