Análisis comparativo de las opciones de implementación de YOLO26#
YOLO26 es compatible con más de 20 opciones de implementación, cada una optimizada para un tiempo de ejecución, objetivo de hardware o plataforma diferente, desde PyTorch y ONNX hasta TensorRT, OpenVINO, CoreML y formatos dedicados para NPU en el borde. Elegir la opción correcta equilibra la velocidad de inferencia, las restricciones de hardware y la facilidad de integración. Esta guía compara cada opción para que puedas elegir la que mejor se adapte a tu aplicación, y luego pasar a las mejores prácticas de implementación de modelos para desplegarlo de forma fiable.
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
La implementación es la etapa en el flujo de trabajo del proyecto de visión artificial donde un modelo entrenado comienza a realizar trabajo real, por lo que el formato al que lo exportas tiene un impacto directo en la velocidad, el costo y la portabilidad.
Cómo seleccionar la opción de implementación adecuada para tu modelo YOLO26#
Cuando sea el momento de implementar tu modelo YOLO26, seleccionar un formato de exportación adecuado es muy importante. Como se detalla en la documentación de exportación de Ultralytics YOLO26, la función model.export() convierte tu modelo entrenado en una variedad de formatos adaptados a diversos entornos y requisitos de rendimiento.
El formato ideal depende del contexto operativo previsto y del hardware de tu modelo.
Para una implementación gestionada sin exportación manual, Ultralytics Platform proporciona puntos de enlace de inferencia listos para usar con escalado automático en 42 regiones globales.
Opciones de implementación de YOLO26#
Aquí tienes una breve descripción de cada formato y cuándo utilizarlo. Para ver el recorrido completo de la exportación, consulta la documentación de exportación; para ver los criterios lado a lado, salta a la tabla de comparación.
- PyTorch (
.pt): El formato nativo de entrenamiento e inferencia, que ofrece la máxima flexibilidad y aceleración por GPU a través de NVIDIA CUDA o AMD ROCm, ideal para investigación y prototipos sin necesidad de un paso de exportación. - TorchScript (
torchscript): Serializa el modelo para un tiempo de ejecución de C++ sin Python, adecuado para sistemas de producción donde Python no está disponible. - ONNX (
onnx): Un formato de intercambio independiente de framework con amplio soporte multiplataforma y de hardware a través de ONNX Runtime. - OpenVINO (
openvino): El kit de herramientas de Intel para una inferencia optimizada en CPU, GPU integradas y NPU de Intel, común en IoT y computación en el borde. - TensorRT (
engine): El tiempo de ejecución de alto rendimiento de NVIDIA que ofrece inferencia en GPU de primer nivel con optimización FP16 e INT8. - CoreML (
coreml): El formato en el dispositivo de Apple para iOS, macOS, watchOS y tvOS, que utiliza el Apple Neural Engine. - TF SavedModel (
saved_model): El formato estándar de TensorFlow para servicios escalables del lado del servidor con TensorFlow Serving. - TF GraphDef (
pb): Un formato de grafo estático congelado de TensorFlow para entornos que necesitan un grafo de cálculo fijo. - TF Edge TPU (
edgetpu): Compila modelos.tflitepara los aceleradores Google Coral Edge TPU. - LiteRT (
litert): El tiempo de ejecución en el dispositivo de Google (anteriormente TensorFlow Lite) para inferencia móvil, incrustada y en el navegador a partir de un único modelo.tflite, con soporte para FP32 e INT8 y ejecución en el navegador mediante LiteRT.js. - PaddlePaddle (
paddle): El framework de aprendizaje automático de Baidu, popular en China, con amplio soporte de hardware. - MNN (
mnn): Un motor de inferencia ligero y de alto rendimiento optimizado para sistemas móviles e incrustados ARM y x86-64. - NCNN (
ncnn): Un framework de inferencia ligero y de alto rendimiento adaptado para dispositivos móviles ARM. - Sony IMX500 (
imx): Exportaciones para el sensor de visión inteligente IMX500 de Sony con procesamiento en el chip, como la Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): Apunta a NPU de Rockchip en placas incrustadas con cuantización FP16 e INT8. - ExecuTorch (
executorch): El tiempo de ejecución nativo en el dispositivo de PyTorch para móviles (iOS y Android) y sistemas incrustados a través de XNNPACK. - Axelera AI (
axelera): Compila para el AIPU Metis de Axelera (hasta 856 TOPS) a través de PCIe o M.2 para inferencia en el borde de alto rendimiento. - DEEPX (
deepx): Apunta a hardware NPU DEEPX con cuantización INT8 para inferencia en el borde incrustada. - Qualcomm QNN (
qnn): Inferencia en el dispositivo en Snapdragon Hexagon NPU, Adreno GPU y CPU a través de la pila de inteligencia artificial de Qualcomm.
La integración con Hailo exporta modelos de detección, segmentación, segmentación semántica, estimación de profundidad, clasificación, pose y OBB de YOLO directamente a Hailo HEF; consulta su tabla de compatibilidad para ver los modelos y objetivos validados. La integración con Ambarella sigue un flujo de trabajo centrado en ONNX y compila las exportaciones ONNX al formato AmbaPB con la cadena de herramientas CVflow de Ambarella para SoC CVflow® como el CV72, utilizando opcionalmente el entrenamiento consciente de la compresión SpongeTorch. La integración con Huawei Ascend compila las exportaciones ONNX al formato sin conexión .om con el compilador CANN ATC para inferencia en FP16 en procesadores Ascend AI.
Comparación de opciones de despliegue#
La siguiente tabla resume las opciones de implementación para modelos YOLO26 en función de los criterios que suelen guiar la elección. Para obtener una visión detallada de cada formato, consulta la documentación de formatos de exportación.
| Opción de despliegue | Benchmarks de rendimiento | Compatibilidad e integración | Soporte de la comunidad y ecosistema | Casos prácticos | Mantenimiento y actualizaciones | Consideraciones de seguridad | Aceleración de hardware |
|---|---|---|---|---|---|---|---|
| PyTorch | Buena flexibilidad; puede comprometer el rendimiento bruto | Excelente con bibliotecas de Python | Amplios recursos y comunidad | Investigación y prototipos | Desarrollo regular y activo | Dependiente del entorno de despliegue | Soporte CUDA para aceleración por GPU |
| TorchScript | Mejor para producción que PyTorch | Transición fluida de PyTorch a C++ | Especializado pero más reducido que PyTorch | Industria donde Python es un cuello de botella | Actualizaciones constantes con PyTorch | Seguridad mejorada sin Python completo | Hereda el soporte CUDA de PyTorch |
| ONNX | Variable según el tiempo de ejecución | Alto en diferentes marcos de trabajo | Ecosistema amplio, respaldado por muchas organizaciones | Flexibilidad entre marcos de ML | Actualizaciones regulares para nuevas operaciones | Garantiza prácticas de conversión y despliegue seguras | Varias optimizaciones de hardware |
| OpenVINO | Optimizado para hardware Intel | Mejor dentro del ecosistema Intel | Sólido en el campo de la visión artificial | IoT y edge con hardware Intel | Actualizaciones regulares para hardware Intel | Funciones robustas para aplicaciones sensibles | Adaptado para hardware Intel |
| TensorRT | De primer nivel en GPU NVIDIA | Mejor para hardware NVIDIA | Red sólida a través de NVIDIA | Inferencia de vídeo e imagen en tiempo real | Actualizaciones frecuentes para nuevas GPU | Énfasis en la seguridad | Diseñado para GPU NVIDIA |
| CoreML | Optimizado para hardware Apple en el dispositivo | Exclusivo para el ecosistema Apple | Fuerte apoyo de Apple y de la comunidad de desarrolladores | ML en el dispositivo en productos Apple | Actualizaciones regulares de Apple | Enfoque en la privacidad y la seguridad | Apple neural engine y GPU |
| TF SavedModel | Escalable en entornos de servidor | Amplia compatibilidad en el ecosistema TensorFlow | Gran soporte debido a la popularidad de TensorFlow | Servicio de modelos a escala | Actualizaciones regulares de Google y la comunidad | Funciones robustas para empresas | Varias aceleraciones de hardware |
| TF GraphDef | Estable para grafos de computación estáticos | Se integra bien con la infraestructura de TensorFlow | Recursos para optimizar grafos estáticos | Escenarios que requieren grafos estáticos | Actualizaciones junto al núcleo de TensorFlow | Prácticas de seguridad de TensorFlow establecidas | Opciones de aceleración de TensorFlow |
| TF Edge TPU | Optimizado para el hardware Edge TPU de Google | Exclusivo para dispositivos Edge TPU | En crecimiento con recursos de Google y terceros | Dispositivos IoT que requieren procesamiento en tiempo real | Mejoras para el nuevo hardware Edge TPU | Seguridad IoT robusta de Google | Diseñado a medida para Google Coral |
| LiteRT | Velocidad y eficiencia en móviles, dispositivos embebidos y web | Compatibilidad con móviles, dispositivos embebidos, edge y navegadores | Comunidad sólida, respaldada por Google | Aplicaciones on-device en Android, iOS y web | Funciones más recientes de runtime on-device | Inferencia segura on-device y en navegador | Aceleración mediante GPU, DSP y WebGPU |
| PaddlePaddle | Competitivo, fácil de usar y escalable | Ecosistema Baidu, amplio soporte de aplicaciones | Crecimiento rápido, especialmente en China | Mercado chino y procesamiento de idiomas | Enfoque en aplicaciones de IA chinas | Enfatiza la privacidad y seguridad de los datos | Incluyendo los chips Kunlun de Baidu |
| MNN | Alto rendimiento para dispositivos móviles | Sistemas ARM móviles e integrados y CPU X86-64 | Comunidad de ML móvil/integrado | Eficiencia de sistemas móviles | Mantenimiento de alto rendimiento en dispositivos móviles | Ventajas de seguridad en el dispositivo | Optimizaciones para CPU y GPU ARM |
| NCNN | Optimizado para dispositivos móviles basados en ARM | Sistemas ARM móviles e integrados | Comunidad de ML móvil/integrado pequeña pero activa | Eficiencia en sistemas Android y ARM | Mantenimiento de alto rendimiento en ARM | Ventajas de seguridad en el dispositivo | Optimizaciones para CPU y GPU ARM |
| Sony IMX500 | Inferencia en el sensor con muy bajo consumo | Sensor Sony IMX500, Raspberry Pi AI Camera | Ecosistema Sony AITRIOS | IA de borde en cámara | Actualizaciones del SDK de Sony y la cadena de herramientas MCT | Los datos permanecen en el sensor | Acelerador en chip Sony IMX500 |
| Rockchip RKNN | Optimizado para NPUs de Rockchip | Placas SoC Rockchip (ej. RK3588) | Comunidad de desarrolladores de Rockchip | SBC embebidas y dispositivos de borde | Actualizaciones de Rockchip RKNN-Toolkit | Inferencia local en el dispositivo | NPU de Rockchip |
| ExecuTorch | Entorno de ejecución PyTorch eficiente en dispositivo | iOS, Android, embebido mediante XNNPACK | Respaldado por el proyecto PyTorch | Aplicaciones móviles y embebidas | Mantenido junto con PyTorch | La inferencia en el dispositivo mantiene los datos locales | Backends XNNPACK y CPU/GPU móviles |
| Axelera AI | Muy alto rendimiento (hasta 856 TOPS) | Metis AIPU a través de PCIe o M.2 | Axelera Voyager SDK | Inferencia de borde de alto rendimiento | Actualizaciones del SDK de Axelera | Inferencia de borde local | Axelera Metis AIPU |
| DEEPX | Inferencia de NPU optimizada para INT8 | Hardware NPU DEEPX | Herramientas de desarrollo DEEPX (dx_com, dx_engine) | Inferencia de borde embebida | Actualizaciones del SDK y entorno de ejecución de DEEPX | Inferencia local en el dispositivo | NPU DEEPX |
| Qualcomm QNN | Inferencia rápida en dispositivo Snapdragon | Snapdragon Hexagon NPU, Adreno GPU, CPU | Ecosistema Qualcomm AI Hub | Dispositivos móviles y de borde Snapdragon | Actualizaciones del stack de IA de Qualcomm (QAIRT) | La inferencia en el dispositivo mantiene los datos locales | Snapdragon Hexagon NPU |
Esta comparación te ofrece una visión general de alto nivel. Para el despliegue, sopesa los requisitos y limitaciones específicos de tu proyecto frente a cada opción y consulta la guía de integración enlazada para el formato que elijas.
Conclusión#
La amplia gama de formatos de exportación de YOLO26 te permite adaptar un modelo a casi cualquier entorno, desde un servidor GPU en la nube hasta una cámara en el borde integrada en el sensor. Una vez que hayas elegido un formato, sigue las mejores prácticas de implementación de modelos para la optimización, la solución de problemas y la seguridad, y apóyate en la comunidad de Ultralytics cuando encuentres algún obstáculo.
FAQ#
Ultralytics YOLO26 admite varios formatos de despliegue, cada uno diseñado para entornos y plataformas de hardware específicos. Los formatos clave incluyen:
- PyTorch para investigación y creación de prototipos, con una excelente integración con Python.
- TorchScript para entornos de producción donde Python no está disponible.
- ONNX para compatibilidad multiplataforma y aceleración de hardware.
- OpenVINO para un rendimiento optimizado en hardware Intel.
- TensorRT para inferencia de alta velocidad en GPU NVIDIA.
Cada formato tiene ventajas únicas. Para ver una guía detallada, consulta nuestra documentación del proceso de exportación.
Para mejorar la velocidad de inferencia en CPU Intel, puedes desplegar tu modelo YOLO26 usando el kit de herramientas OpenVINO de Intel. OpenVINO ofrece mejoras de rendimiento significativas al optimizar los modelos para aprovechar el hardware de Intel de manera eficiente.
- Convierte tu modelo YOLO26 al formato OpenVINO utilizando la función
model.export(). - Sigue la guía de configuración detallada en la documentación de exportación a Intel OpenVINO.
Para obtener más información, consulta nuestra entrada de blog.
- Convierte tu modelo YOLO26 al formato OpenVINO utilizando la función
Sí, los modelos YOLO26 se pueden implementar en dispositivos móviles usando LiteRT (anteriormente TensorFlow Lite) y NCNN para Android, y CoreML o LiteRT para iOS. LiteRT es el tiempo de ejecución en el dispositivo de Google para dispositivos móviles e incrustados, y ejecuta el mismo modelo en Android, iOS y el navegador, proporcionando una inferencia eficiente en el dispositivo.
Ejemplo# Export command for NCNN format model.export(format="ncnn")Para obtener más detalles sobre la implementación de modelos en dispositivos móviles, consulta nuestra guía de integración de LiteRT.
Al elegir un formato de despliegue para YOLO26, ten en cuenta los siguientes factores:
- Rendimiento: Algunos formatos como TensorRT ofrecen velocidades excepcionales en GPU NVIDIA, mientras que OpenVINO está optimizado para hardware Intel.
- Compatibilidad: ONNX ofrece una amplia compatibilidad en diferentes plataformas.
- Facilidad de integración: Formatos como CoreML o LiteRT están adaptados a ecosistemas específicos como iOS y Android, respectivamente.
- Soporte de la comunidad: Formatos como PyTorch y TensorFlow cuentan con amplios recursos y soporte de la comunidad.
Para realizar un análisis comparativo, consulta nuestra documentación de formatos de exportación.
Para implementar modelos YOLO26 en una aplicación web, puedes utilizar LiteRT.js, el tiempo de ejecución web de LiteRT, que permite ejecutar modelos de aprendizaje automático directamente en el navegador y en Node.js. Este enfoque elimina la necesidad de infraestructura de backend y proporciona rendimiento en tiempo real.
- Exporta el modelo YOLO26 al formato LiteRT.
- Integra el modelo exportado en tu aplicación web usando LiteRT.js.
Para obtener instrucciones paso a paso, consulta nuestra guía de integración de LiteRT.