Análisis comparativo de las opciones de despliegue de YOLO26#
YOLO26 admite más de 20 opciones de despliegue, cada una optimizada para un entorno de ejecución, objetivo de hardware o plataforma diferente: desde PyTorch y ONNX hasta TensorRT, OpenVINO, CoreML y formatos específicos para NPU de dispositivos periféricos. Elegir la opción adecuada requiere equilibrar la velocidad de inferencia, las limitaciones del hardware y la facilidad de integración. Esta guía compara todas las opciones para que puedas elegir la más adecuada para tu aplicación y, después, consultar las prácticas recomendadas para el despliegue de modelos para desplegarla de forma fiable.
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
El despliegue es la fase del flujo de trabajo de un proyecto de visión artificial en la que un modelo entrenado empieza a realizar trabajo real, por lo que el formato al que lo exportes influye directamente en la velocidad, el coste y la portabilidad.
Cómo seleccionar la opción de despliegue adecuada para tu modelo YOLO26#
Cuando llega el momento de desplegar tu modelo YOLO26, es muy importante seleccionar un formato de exportación adecuado. Como se explica en la documentación de exportación de Ultralytics YOLO26, la función model.export() convierte tu modelo entrenado a diversos formatos adaptados a distintos entornos y requisitos de rendimiento.
El formato ideal depende del contexto operativo previsto para tu modelo y del hardware.
Para realizar un despliegue gestionado sin exportación manual, Ultralytics Platform proporciona endpoints de inferencia listos para usar, con escalado automático en 42 regiones de todo el mundo.
Opciones de despliegue de YOLO26#
Aquí tienes una breve descripción de cada formato y de cuándo utilizarlo. Para consultar el proceso completo de exportación, visita la documentación de exportación; para ver los criterios comparados, ve directamente a la tabla comparativa.
- PyTorch (
.pt): el formato nativo de entrenamiento e inferencia, que ofrece la máxima flexibilidad y aceleración mediante GPU con NVIDIA CUDA o AMD ROCm, ideal para investigación y creación de prototipos sin necesidad de realizar ningún paso de exportación. - TorchScript (
torchscript): serializa el modelo para un entorno de ejecución en C++ sin Python, adecuado para sistemas de producción en los que Python no está disponible. - ONNX (
onnx): un formato de intercambio independiente de cualquier framework, con amplia compatibilidad multiplataforma y de hardware mediante ONNX Runtime. - OpenVINO (
openvino): el kit de herramientas de Intel para inferencia optimizada en CPU, GPU integradas y NPU de Intel, habitual en IoT y computación periférica. - TensorRT (
engine): el entorno de ejecución de alto rendimiento de NVIDIA, que ofrece inferencia mediante GPU de primer nivel con optimización FP16 e INT8. - CoreML (
coreml): el formato de Apple para ejecución en el dispositivo en iOS, macOS, watchOS y tvOS, mediante Apple Neural Engine. - TF SavedModel (
saved_model): el formato estándar de TensorFlow para servir modelos de forma escalable en el servidor con TensorFlow Serving. - TF GraphDef (
pb): un formato de TensorFlow basado en un grafo estático congelado para entornos que necesitan un grafo de cálculo fijo. - TF Edge TPU (
edgetpu): compila modelos.tflitepara aceleradores Google Coral Edge TPU. - LiteRT (
litert): el entorno de ejecución de Google para dispositivos (antes TensorFlow Lite), destinado a la inferencia móvil, integrada y en navegadores a partir de un único modelo.tflite, con compatibilidad con FP32 e INT8 y ejecución en el navegador mediante LiteRT.js. - PaddlePaddle (
paddle): el framework de deep learning de Baidu, popular en China y con amplia compatibilidad de hardware. - MNN (
mnn): un motor de inferencia ligero y de alto rendimiento, optimizado para sistemas ARM y x86-64 móviles e integrados. - NCNN (
ncnn): un framework de inferencia ligero y de alto rendimiento, optimizado para dispositivos móviles ARM. - Sony IMX500 (
imx): exportaciones para el sensor de visión inteligente Sony IMX500 con procesamiento en el propio chip, como la Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): está destinado a las NPU de Rockchip en placas integradas, con cuantización FP16 e INT8. - ExecuTorch (
executorch): el entorno de ejecución nativo de PyTorch para dispositivos móviles (iOS y Android) y sistemas integrados mediante XNNPACK. - Axelera AI (
axelera): compila para la AIPU Metis de Axelera (hasta 856 TOPS) mediante PCIe o M.2 para inferencia periférica de alto rendimiento. - DEEPX (
deepx): está destinado al hardware NPU de DEEPX, con cuantización INT8 para inferencia periférica integrada. - Qualcomm QNN (
qnn): inferencia en el dispositivo mediante la NPU Hexagon, la GPU Adreno y la CPU de Snapdragon, a través de la pila de IA de Qualcomm. - Core AI (
coreai): el nuevo formato.aimodelde Apple para iOS 27 y macOS 27, programado en CPU, GPU y Apple Neural Engine; la exportación requiere macOS 26 o posterior en silicio de Apple.
La integración con Hailo exporta directamente a Hailo HEF modelos YOLO de detección, segmentación, segmentación semántica, estimación de profundidad, clasificación, pose y OBB; consulta su tabla de compatibilidad para ver los modelos y objetivos validados. La integración con Ambarella sigue un flujo de trabajo basado primero en ONNX y compila las exportaciones de ONNX al formato AmbaPB con la cadena de herramientas CVflow de Ambarella para SoC CVflow®, como el CV72, utilizando opcionalmente el entrenamiento con compresión consciente de SpongeTorch. La integración con Huawei Ascend compila las exportaciones de ONNX al formato sin conexión .om con el compilador CANN ATC para inferencia FP16 en procesadores de IA Ascend.
Comparativa de las opciones de despliegue#
La siguiente tabla resume las opciones de despliegue para modelos YOLO26 según los criterios que suelen determinar la elección. Para consultar un análisis detallado de cada formato, visita la documentación de formatos de exportación.
| Opción de despliegue | Pruebas de rendimiento | Compatibilidad e integración | Asistencia de la comunidad y ecosistema | Casos prácticos | Mantenimiento y actualizaciones | Consideraciones de seguridad | Aceleración de hardware |
|---|---|---|---|---|---|---|---|
| PyTorch | Buena flexibilidad; puede sacrificar rendimiento bruto | Excelente con bibliotecas de Python | Amplios recursos y comunidad | Investigación y prototipos | Desarrollo periódico y activo | Depende del entorno de despliegue | Compatibilidad con CUDA para acelerar la GPU |
| TorchScript | Mejor para producción que PyTorch | Transición fluida de PyTorch a C++ | Especializado, pero más limitado que PyTorch | Entornos en los que Python es un cuello de botella | Actualizaciones coherentes con PyTorch | Seguridad mejorada sin Python completo | Hereda la compatibilidad con CUDA de PyTorch |
| ONNX | Variable según el entorno de ejecución | Alta entre distintos frameworks | Amplio ecosistema, compatible con muchas organizaciones | Flexibilidad entre frameworks de ML | Actualizaciones periódicas para nuevas operaciones | Asegúrate de aplicar prácticas seguras de conversión y despliegue | Diversas optimizaciones de hardware |
| OpenVINO | Optimizado para hardware de Intel | Mejor dentro del ecosistema de Intel | Sólido en el ámbito de la visión artificial | IoT y dispositivos periféricos con hardware de Intel | Actualizaciones periódicas para hardware de Intel | Funciones robustas para aplicaciones sensibles | Adaptado al hardware de Intel |
| TensorRT | De primer nivel en GPU de NVIDIA | Mejor para hardware de NVIDIA | Red sólida a través de NVIDIA | Inferencia de vídeo e imágenes en tiempo real | Actualizaciones frecuentes para nuevas GPU | Énfasis en la seguridad | Diseñado para GPU de NVIDIA |
| CoreML | Optimizado para hardware de Apple en el dispositivo | Exclusivo del ecosistema de Apple | Sólido respaldo de Apple y de la comunidad de desarrolladores | ML en el dispositivo en productos de Apple | Actualizaciones periódicas de Apple | Enfoque en la privacidad y la seguridad | Apple Neural Engine y GPU |
| TF SavedModel | Escalable en entornos de servidor | Amplia compatibilidad en el ecosistema de TensorFlow | Amplio respaldo gracias a la popularidad de TensorFlow | Servicio de modelos a gran escala | Actualizaciones periódicas de Google y de la comunidad | Funciones robustas para empresas | Diversas aceleraciones de hardware |
| TF GraphDef | Estable para grafos de cálculo estáticos | Se integra bien con la infraestructura de TensorFlow | Recursos para optimizar grafos estáticos | Escenarios que requieren grafos estáticos | Actualizaciones junto con el núcleo de TensorFlow | Prácticas de seguridad de TensorFlow consolidadas | Opciones de aceleración de TensorFlow |
| TF Edge TPU | Optimizado para el hardware Edge TPU de Google | Exclusivo para dispositivos Edge TPU | En crecimiento gracias a los recursos de Google y de terceros | Dispositivos IoT que requieren procesamiento en tiempo real | Mejoras para el nuevo hardware Edge TPU | La sólida seguridad IoT de Google | Diseñado específicamente para Google Coral |
| LiteRT | Velocidad y eficiencia en dispositivos móviles, integrados y web | Compatibilidad con dispositivos móviles, integrados, edge y navegadores | Comunidad sólida, respaldada por Google | Aplicaciones en el dispositivo para Android, iOS y la web | Funciones más recientes de ejecución en el dispositivo | Inferencia segura en el dispositivo y en el navegador | Aceleración mediante GPU, DSP y WebGPU |
| PaddlePaddle | Competitivo, fácil de usar y escalable | Ecosistema de Baidu y amplia compatibilidad con aplicaciones | Crecimiento rápido, especialmente en China | Mercado chino y procesamiento del lenguaje | Enfoque en aplicaciones de IA chinas | Da prioridad a la privacidad y la seguridad de los datos | Incluidos los chips Kunlun de Baidu |
| MNN | Alto rendimiento para dispositivos móviles | Sistemas ARM móviles e integrados y CPU X86-64 | Comunidad de ML móvil e integrado | Eficiencia en sistemas móviles | Mantenimiento de un alto rendimiento en dispositivos móviles | Ventajas de seguridad en el dispositivo | Optimizaciones para CPU y GPU ARM |
| NCNN | Optimizado para dispositivos móviles basados en ARM | Sistemas ARM móviles e integrados | Comunidad de ML móvil e integrado pequeña, pero activa | Eficiencia en sistemas Android y ARM | Mantenimiento de un alto rendimiento en ARM | Ventajas de seguridad en el dispositivo | Optimizaciones para CPU y GPU ARM |
| Sony IMX500 | Inferencia en el sensor con un consumo muy bajo | Sensor Sony IMX500, Raspberry Pi AI Camera | Ecosistema Sony AITRIOS | IA edge en la cámara | Actualizaciones del SDK y la cadena de herramientas MCT de Sony | Los datos permanecen en el sensor | Acelerador integrado en el chip Sony IMX500 |
| Rockchip RKNN | Optimizado para NPU de Rockchip | Placas SoC de Rockchip (p. ej., RK3588) | Comunidad de desarrolladores de Rockchip | Dispositivos SBC integrados y edge | Actualizaciones de Rockchip RKNN-Toolkit | Inferencia local en el dispositivo | NPU de Rockchip |
| ExecuTorch | Entorno de ejecución PyTorch eficiente en el dispositivo | iOS, Android e integrados mediante XNNPACK | Respaldado por el proyecto PyTorch | Aplicaciones móviles e integradas | Mantenido junto con PyTorch | La inferencia en el dispositivo mantiene los datos locales | Backends XNNPACK y de CPU/GPU móviles |
| Axelera AI | Rendimiento muy elevado (hasta 856 TOPS) | Metis AIPU mediante PCIe o M.2 | SDK Axelera Voyager | Inferencia edge de alto rendimiento | Actualizaciones del SDK de Axelera | Inferencia edge local | Axelera Metis AIPU |
| DEEPX | Inferencia NPU optimizada para INT8 | Hardware NPU de DEEPX | Herramientas para desarrolladores de DEEPX (dx_com, dx_engine) | Inferencia edge integrada | Actualizaciones del SDK y el entorno de ejecución de DEEPX | Inferencia local en el dispositivo | NPU de DEEPX |
| Qualcomm QNN | Inferencia rápida en el dispositivo con Snapdragon | NPU Snapdragon Hexagon, GPU Adreno, CPU | Ecosistema Qualcomm AI Hub | Dispositivos Snapdragon móviles y edge | Actualizaciones de la pila de IA de Qualcomm (QAIRT) | La inferencia en el dispositivo mantiene los datos locales | NPU Snapdragon Hexagon |
| Hailo | Inferencia INT8 HEF en NPU de Hailo | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler y HailoRT | Cámaras, robots y sistemas perimetrales industriales | Lanzamientos de Hailo DFC y HailoRT | Inferencia local en el dispositivo | NPU de Hailo |
| Huawei Ascend | Mayor rendimiento en el núcleo de Ascend AI Core | Placas Atlas y OrangePi AIPro | Ecosistema Huawei CANN | Inferencia perimetral en NPU de Ascend | Lanzamientos de CANN y ATC | Inferencia local en el dispositivo | Ascend AI Core |
| Core AI | Optimizado para silicio de Apple | iOS 27 y macOS 27; la exportación requiere macOS 26+ | Marco de Apple; aún no disponible en los SDKs de iOS/Flutter | ML en el dispositivo en plataformas Apple de próxima generación | Vinculado a los lanzamientos del sistema operativo de Apple; actualmente en fase beta | La inferencia en el dispositivo mantiene los datos locales | Apple Neural Engine, GPU y CPU |
Esta comparación te ofrece una visión general. Para el despliegue, sopesa los requisitos y las limitaciones específicos de tu proyecto frente a cada opción y consulta la guía de integración enlazada correspondiente al formato que elijas.
Conclusión#
La amplia variedad de formatos de exportación de YOLO26 te permite adaptar un modelo a casi cualquier entorno, desde un servidor GPU en la nube hasta una cámara edge con inferencia en el sensor. Cuando hayas elegido un formato, sigue las buenas prácticas de despliegue de modelos para la optimización, la resolución de problemas y la seguridad, y recurre a la comunidad de Ultralytics cuando encuentres algún obstáculo.
Preguntas frecuentes#
Ultralytics YOLO26 admite varios formatos de despliegue, cada uno diseñado para entornos y plataformas de hardware específicos. Entre los formatos principales se incluyen:
- PyTorch para investigación y creación de prototipos, con una excelente integración con Python.
- TorchScript para entornos de producción en los que Python no está disponible.
- ONNX para compatibilidad multiplataforma y aceleración de hardware.
- OpenVINO para un rendimiento optimizado en hardware Intel.
- TensorRT para inferencia de alta velocidad en GPU NVIDIA.
Cada formato ofrece ventajas únicas. Para consultar un recorrido detallado, visita nuestra documentación del proceso de exportación.
Para mejorar la velocidad de inferencia en CPU Intel, puedes desplegar tu modelo YOLO26 mediante el kit de herramientas OpenVINO de Intel. OpenVINO ofrece importantes mejoras de rendimiento al optimizar los modelos para aprovechar el hardware Intel de forma eficiente.
- Convierte tu modelo YOLO26 al formato OpenVINO mediante la función
model.export(). - Sigue la guía de configuración detallada de la documentación de exportación de Intel OpenVINO.
Para obtener más información, consulta nuestra publicación del blog.
- Convierte tu modelo YOLO26 al formato OpenVINO mediante la función
Sí, los modelos YOLO26 se pueden desplegar en dispositivos móviles usando LiteRT (anteriormente TensorFlow Lite) y NCNN en Android, y CoreML o LiteRT en iOS. LiteRT es el runtime en el dispositivo de Google para dispositivos móviles e integrados, y ejecuta el mismo modelo en Android, iOS y el navegador, ofreciendo una inferencia eficiente en el dispositivo.
Ejemplo# Export command for NCNN format model.export(format="ncnn")Para obtener más información sobre el despliegue de modelos en dispositivos móviles, consulta nuestra guía de integración de LiteRT.
Al elegir un formato de despliegue para YOLO26, ten en cuenta los siguientes factores:
- Rendimiento: Algunos formatos, como TensorRT, ofrecen velocidades excepcionales en GPU NVIDIA, mientras que OpenVINO está optimizado para hardware Intel.
- Compatibilidad: ONNX ofrece una amplia compatibilidad entre distintas plataformas.
- Facilidad de integración: Formatos como CoreML o LiteRT están diseñados para ecosistemas específicos como iOS y Android, respectivamente.
- Compatibilidad de la comunidad: Formatos como PyTorch y TensorFlow cuentan con amplios recursos y soporte de la comunidad.
Para consultar un análisis comparativo, revisa nuestra documentación sobre formatos de exportación.
Para desplegar modelos YOLO26 en una aplicación web, puedes usar LiteRT.js, el runtime web de LiteRT, que permite ejecutar modelos de aprendizaje automático directamente en el navegador y en Node.js. Este enfoque elimina la necesidad de infraestructura de backend y ofrece rendimiento en tiempo real.
- Exporta el modelo YOLO26 al formato LiteRT.
- Integra el modelo exportado en tu aplicación web usando LiteRT.js.
Para consultar instrucciones paso a paso, revisa nuestra guía de integración de LiteRT.