Análisis comparativo de las opciones de implementación de YOLO26#
YOLO26 admite más de 20 opciones de implementación, cada una optimizada para un entorno de ejecución, un destino de hardware o una plataforma distintos: desde PyTorch y ONNX hasta TensorRT, OpenVINO, CoreML y formatos específicos para NPU de borde. Elegir la opción adecuada implica encontrar un equilibrio entre la velocidad de inferencia, las limitaciones del hardware y la facilidad de integración. Esta guía compara todas las opciones para que elijas la más adecuada para tu aplicación y, después, puedas consultar las prácticas recomendadas para la implementación de modelos e implementarla de forma fiable.
Ver: Cómo elegir el mejor formato de implementación de Ultralytics YOLO26 para tu proyecto | TensorRT | OpenVINO 🚀
La implementación es la fase del flujo de trabajo de un proyecto de visión artificial en la que un modelo entrenado empieza a realizar tareas reales, por lo que el formato al que lo exportes afecta directamente a la velocidad, el coste y la portabilidad.
Cómo elegir la opción de implementación adecuada para tu modelo YOLO26#
Cuando llegue el momento de implementar tu modelo YOLO26, es muy importante seleccionar un formato de exportación adecuado. Tal como se explica en la documentación de exportación de Ultralytics YOLO26, la función model.export() convierte el modelo entrenado a diversos formatos adaptados a distintos entornos y requisitos de rendimiento.
El formato ideal depende del contexto operativo previsto para el modelo y del hardware.
Para implementar modelos mediante un servicio gestionado sin exportarlos manualmente, Ultralytics Platform ofrece puntos de conexión de inferencia listos para usar, con escalado automático en 42 regiones de todo el mundo.
Opciones de implementación de YOLO26#
A continuación se ofrece una breve descripción de cada formato y de cuándo conviene utilizarlo. Para ver el proceso completo de exportación, consulta la documentación de exportación; para comparar los criterios en paralelo, ve a la tabla comparativa.
- PyTorch (
.pt): El formato nativo de entrenamiento e inferencia, que ofrece la máxima flexibilidad y aceleración GPU mediante NVIDIA CUDA o AMD ROCm. Es ideal para la investigación y la creación de prototipos, ya que no requiere ningún paso de exportación. - TorchScript (
torchscript): Serializa el modelo para ejecutarlo en C++ sin Python; es adecuado para sistemas de producción en los que Python no está disponible. - ONNX (
onnx): Formato de intercambio independiente de los frameworks, con amplia compatibilidad entre plataformas y hardware mediante ONNX Runtime, incluidas las GPU NVIDIA a través de CUDA y las GPU AMD mediante MIGraphX. - OpenVINO (
openvino): Kit de herramientas de Intel para optimizar la inferencia en CPU Intel, GPU integradas y NPU; es habitual en IoT y computación en el borde. - TensorRT (
engine): Entorno de ejecución de alto rendimiento de NVIDIA que ofrece inferencia GPU de primer nivel con optimización FP16 e INT8. - CoreML (
coreml): Formato de Apple para ejecutar modelos en dispositivos iOS, macOS, watchOS y tvOS, que utiliza Apple Neural Engine. - Core AI (
coreai): Nuevo formato.aimodelde Apple para iOS 27 y macOS 27, con programación de tareas en CPU, GPU y Apple Neural Engine; para exportar se necesita macOS 26 o posterior en Apple silicon, o Linux x86_64 con glibc 2.34 o posterior, y Python 3.11 a 3.14. - TF SavedModel (
saved_model): Formato estándar de TensorFlow para servir modelos de forma escalable en el servidor con TensorFlow Serving. - TF GraphDef (
pb): Formato de TensorFlow con un grafo estático congelado, para entornos que necesitan un grafo de cálculo fijo. - TF Edge TPU (
edgetpu): Compila modelos.tflitepara los aceleradores Google Coral Edge TPU. - LiteRT (
litert): Entorno de ejecución de Google en el dispositivo (antes TensorFlow Lite) para inferencia móvil, integrada y en navegador a partir de un único modelo.tflite, con compatibilidad con FP32 e INT8 y ejecución en el navegador mediante LiteRT.js. - PaddlePaddle (
paddle): Framework de aprendizaje profundo de Baidu, popular en China y compatible con una amplia variedad de hardware. - MNN (
mnn): Motor de inferencia ligero y de alto rendimiento, optimizado para sistemas móviles e integrados ARM y x86-64. - NCNN (
ncnn): Framework de inferencia ligero y de alto rendimiento, optimizado para dispositivos móviles ARM. - Sony IMX500 (
imx): Exporta modelos para el sensor de visión inteligente IMX500 de Sony, con procesamiento en el chip, como la cámara Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): Diseñado para las NPU Rockchip de placas integradas, con cuantización FP16 e INT8. - ExecuTorch (
executorch): Entorno de ejecución nativo de PyTorch en el dispositivo para móviles (iOS y Android) y sistemas integrados mediante XNNPACK. - Axelera AI (
axelera): Compila para la AIPU Metis de Axelera (hasta 856 TOPS) mediante PCIe o M.2, para ofrecer inferencia de alto rendimiento en el borde. - DEEPX (
deepx): Diseñado para el hardware NPU de DEEPX, con cuantización INT8 para inferencia integrada en el borde. - Qualcomm QNN (
qnn): Inferencia en el dispositivo con la NPU Snapdragon Hexagon, la GPU Adreno y la CPU mediante la pila de IA de Qualcomm.
La integración de Hailo exporta directamente a Hailo HEF los modelos YOLO de detección, segmentación, segmentación semántica, estimación de profundidad, clasificación, pose y OBB; consulta su tabla de compatibilidad para ver los modelos y destinos validados. La integración de Ambarella sigue un flujo de trabajo basado primero en ONNX y compila las exportaciones ONNX al formato AmbaPB con la cadena de herramientas CVflow de Ambarella para SoC CVflow®, como el CV72; puede usar opcionalmente el entrenamiento con reconocimiento de compresión SpongeTorch. La integración de Huawei Ascend compila las exportaciones ONNX al formato sin conexión .om con el compilador CANN ATC para la inferencia FP16 en procesadores Ascend AI. La integración de AMD Xilinx cuantiza las exportaciones ONNX con AMD Quark para las NPU de Versal AI Edge Series Gen 2, que el proveedor de ejecución Vitis AI compila en un modelo .rai.
Comparación de las opciones de implementación#
La tabla siguiente resume las opciones de implementación de los modelos YOLO26 según los criterios que suelen determinar la elección. Para conocer cada formato en profundidad, consulta la documentación sobre formatos de exportación.
| Opción de implementación | Pruebas de rendimiento | Compatibilidad e integración | Asistencia de la comunidad y ecosistema | Casos prácticos | Mantenimiento y actualizaciones | Consideraciones de seguridad | Aceleración de hardware |
|---|---|---|---|---|---|---|---|
| PyTorch | Buena flexibilidad; puede implicar una reducción del rendimiento bruto | Excelente con bibliotecas Python | Amplios recursos y comunidad | Investigación y prototipos | Desarrollo periódico y activo | Depende del entorno de implementación | Compatibilidad con CUDA para acelerar la GPU |
| TorchScript | Más adecuado para producción que PyTorch | Transición fluida de PyTorch a C++ | Especializado, pero más limitado que PyTorch | Sectores en los que Python supone un cuello de botella | Actualizaciones coherentes con PyTorch | Mayor seguridad sin depender por completo de Python | Hereda la compatibilidad con CUDA de PyTorch |
| ONNX | Variable según el entorno de ejecución | Alta entre distintos frameworks | Ecosistema amplio, respaldado por muchas organizaciones | Flexibilidad entre frameworks de ML | Actualizaciones periódicas para nuevas operaciones | Asegúrate de seguir prácticas seguras de conversión e implementación | Diversas optimizaciones de hardware |
| OpenVINO | Optimizado para hardware Intel | Óptimo dentro del ecosistema Intel | Sólido en el ámbito de la visión artificial | IoT y edge con hardware de Intel | Actualizaciones periódicas para hardware de Intel | Funciones robustas para aplicaciones sensibles | Adaptado al hardware de Intel |
| TensorRT | Rendimiento de primer nivel en GPU NVIDIA | Ideal para hardware de NVIDIA | Amplia red de contactos a través de NVIDIA | Inferencia de vídeo e imágenes en tiempo real | Actualizaciones frecuentes para las nuevas GPU | Énfasis en la seguridad | Diseñado para GPU NVIDIA |
| CoreML | Optimizado para hardware Apple en el dispositivo | Exclusivo del ecosistema Apple | Sólido respaldo de Apple y de los desarrolladores | ML en el dispositivo en productos Apple | Actualizaciones periódicas de Apple | Prioriza la privacidad y la seguridad | Motor neuronal y GPU de Apple |
| Core AI | Optimizado para Apple silicon | iOS 27 y macOS 27; exportación en macOS 26+ con Apple silicon o Linux x86_64 (glibc 2.34+), Python 3.11-3.14 | Framework de Apple; activación opcional en los SDK de iOS/Flutter | ML en el dispositivo en las plataformas Apple de próxima generación | Vinculado a las versiones del sistema operativo de Apple; actualmente en beta | La inferencia en el dispositivo mantiene los datos en local | Neural Engine, GPU y CPU de Apple |
| TF SavedModel | Escalable en entornos de servidor | Amplia compatibilidad con el ecosistema TensorFlow | Amplio respaldo gracias a la popularidad de TensorFlow | Servicio de modelos a gran escala | Actualizaciones periódicas de Google y la comunidad | Funciones robustas para empresas | Diversas aceleraciones de hardware |
| TF GraphDef | Estable para grafos de computación estáticos | Se integra bien con la infraestructura de TensorFlow | Recursos para optimizar grafos estáticos | Escenarios que requieren grafos estáticos | Actualizaciones junto con el núcleo de TensorFlow | Prácticas de seguridad consolidadas de TensorFlow | Opciones de aceleración de TensorFlow |
| TF Edge TPU | Optimizado para el hardware Edge TPU de Google | Exclusivo para dispositivos Edge TPU | Crece gracias a los recursos de Google y de terceros | Dispositivos IoT que requieren procesamiento en tiempo real | Mejoras para el nuevo hardware Edge TPU | Seguridad IoT robusta de Google | Diseñado específicamente para Google Coral |
| LiteRT | Velocidad y eficiencia en móviles, sistemas integrados y web | Compatibilidad con móviles, sistemas integrados, edge y navegadores | Comunidad sólida, con el respaldo de Google | Aplicaciones en el dispositivo para Android, iOS y web | Funciones más recientes del entorno de ejecución en el dispositivo | Inferencia segura en el dispositivo y en el navegador | Aceleración mediante GPU, DSP y WebGPU |
| PaddlePaddle | Competitivo, fácil de usar y escalable | Ecosistema de Baidu y amplia compatibilidad con aplicaciones | Crecimiento rápido, especialmente en China | Procesamiento del mercado y el idioma chinos | Enfoque en aplicaciones de IA chinas | Prioriza la privacidad y la seguridad de los datos | Incluye los chips Kunlun de Baidu |
| MNN | Alto rendimiento para dispositivos móviles | Sistemas ARM móviles e integrados y CPU X86-64 | Comunidad de ML móvil e integrado | Eficiencia en sistemas móviles | Mantenimiento de alto rendimiento en dispositivos móviles | Ventajas de seguridad en el dispositivo | Optimizaciones para CPU y GPU ARM |
| NCNN | Optimizado para dispositivos móviles basados en ARM | Sistemas ARM móviles e integrados | Comunidad de ML móvil e integrado, pequeña pero activa | Eficiencia en sistemas Android y ARM | Mantenimiento de alto rendimiento en ARM | Ventajas de seguridad en el dispositivo | Optimizaciones para CPU y GPU ARM |
| Sony IMX500 | Inferencia en el sensor con un consumo muy bajo | Sensor Sony IMX500, cámara Raspberry Pi AI Camera | Ecosistema Sony AITRIOS | IA edge en la cámara | Actualizaciones del SDK de Sony y de la cadena de herramientas MCT | Los datos permanecen en el sensor | Acelerador integrado en el chip Sony IMX500 |
| Rockchip RKNN | Optimizado para NPU de Rockchip | Placas SoC Rockchip (p. ej., RK3588) | Comunidad de desarrolladores de Rockchip | Dispositivos edge y SBC integrados | Actualizaciones de Rockchip RKNN-Toolkit | Inferencia local en el dispositivo | NPU de Rockchip |
| ExecuTorch | Entorno de ejecución PyTorch eficiente en el dispositivo | iOS, Android y sistemas integrados mediante XNNPACK | Respaldado por el proyecto PyTorch | Aplicaciones móviles e integradas | Mantenimiento coordinado con PyTorch | La inferencia en el dispositivo mantiene los datos en local | XNNPACK y backends de CPU/GPU para móviles |
| Axelera AI | Rendimiento muy alto (hasta 856 TOPS) | Metis AIPU mediante PCIe o M.2 | SDK Axelera Voyager | Inferencia edge de alto rendimiento | Actualizaciones del SDK de Axelera | Inferencia edge local | AIPU Metis de Axelera |
| DEEPX | Inferencia en NPU optimizada para INT8 | Hardware NPU de DEEPX | Herramientas para desarrolladores de DEEPX (dx_com, dx_engine) | Inferencia edge integrada | Actualizaciones del SDK y el entorno de ejecución de DEEPX | Inferencia local en el dispositivo | NPU de DEEPX |
| Qualcomm QNN | Inferencia rápida en el dispositivo con Snapdragon | NPU Hexagon de Snapdragon, GPU Adreno y CPU | Ecosistema Qualcomm AI Hub | Dispositivos Snapdragon móviles y edge | Actualizaciones de la pila de IA de Qualcomm (QAIRT) | La inferencia en el dispositivo mantiene los datos en local | NPU Hexagon de Snapdragon |
| Hailo | Inferencia HEF INT8 en NPU Hailo | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler y HailoRT | Cámaras, robots y sistemas edge industriales | Versiones de Hailo DFC y HailoRT | Inferencia local en el dispositivo | NPU de Hailo |
| Huawei Ascend | Mayor rendimiento en Ascend AI Core | Placas Atlas y OrangePi AIPro | Ecosistema Huawei CANN | Inferencia edge en NPU Ascend | Versiones de CANN y ATC | Inferencia local en el dispositivo | Ascend AI Core |
| AMD Xilinx | Inferencia INT8 en las NPU de Versal AI Edge Gen 2 | Versal AI Edge Series Gen 2 (VEK385) | AMD Vitis AI y Quark | Visión integrada en SoC adaptativos | Versiones de Vitis AI y Quark | Inferencia local en el dispositivo | NPU Versal AI Engine |
Esta comparación te ofrece una visión general. Para la implementación, sopesa los requisitos y las limitaciones concretos de tu proyecto en relación con cada opción y consulta la guía de integración enlazada para el formato que elijas.
Conclusión#
La amplia variedad de formatos de exportación de YOLO26 te permite adaptar un modelo a casi cualquier entorno, desde un servidor en la nube con GPU hasta una cámara edge con sensor. Cuando hayas elegido un formato, sigue las prácticas recomendadas para implementar modelos en materia de optimización, resolución de problemas y seguridad, y recurre a la comunidad de Ultralytics cuando te encuentres con algún problema.
Preguntas frecuentes#
Ultralytics YOLO26 admite varios formatos de implementación, cada uno diseñado para entornos y plataformas de hardware específicos. Entre los formatos principales se incluyen:
- PyTorch para investigación y creación de prototipos, con una integración excelente con Python.
- TorchScript para entornos de producción en los que Python no está disponible.
- ONNX para compatibilidad multiplataforma y aceleración por hardware.
- OpenVINO para un rendimiento optimizado en hardware Intel.
- TensorRT para inferencias de alta velocidad en GPU NVIDIA.
Cada formato ofrece ventajas propias. Para ver una explicación detallada, consulta nuestra documentación sobre el proceso de exportación.
Para aumentar la velocidad de inferencia en CPU Intel, puedes implementar tu modelo YOLO26 con el kit de herramientas OpenVINO de Intel. OpenVINO ofrece mejoras de rendimiento considerables al optimizar los modelos para aprovechar el hardware Intel de forma eficiente.
- Convierte tu modelo YOLO26 al formato OpenVINO con la función
model.export(). - Sigue la guía detallada de configuración de la documentación sobre la exportación a Intel OpenVINO.
Para obtener más información, consulta nuestra publicación del blog.
- Convierte tu modelo YOLO26 al formato OpenVINO con la función
Sí, puedes implementar modelos YOLO26 en dispositivos móviles con LiteRT (anteriormente TensorFlow Lite) y NCNN para Android, y con CoreML o LiteRT para iOS. LiteRT es el entorno de ejecución de Google en el dispositivo para móviles y dispositivos integrados, y ejecuta el mismo modelo en Android, iOS y el navegador, lo que permite realizar inferencias eficientes en el dispositivo.
Ejemplofrom ultralytics import YOLO model = YOLO("yolo26n.pt") # Comando de exportación al formato NCNN model.export(format="ncnn")Para obtener más información sobre cómo implementar modelos en dispositivos móviles, consulta nuestra guía de integración de LiteRT.
Al elegir un formato de implementación para YOLO26, ten en cuenta los siguientes factores:
- Rendimiento: algunos formatos, como TensorRT, ofrecen velocidades excepcionales en GPU NVIDIA, mientras que OpenVINO está optimizado para hardware Intel.
- Compatibilidad: ONNX ofrece una amplia compatibilidad con distintas plataformas.
- Facilidad de integración: formatos como CoreML o LiteRT están adaptados a ecosistemas específicos, como iOS y Android, respectivamente.
- Asistencia de la comunidad: formatos como PyTorch y TensorFlow cuentan con amplios recursos y asistencia de la comunidad.
Para ver un análisis comparativo, consulta nuestra documentación sobre formatos de exportación.
Para implementar modelos YOLO26 en una aplicación web, puedes usar LiteRT.js, el entorno de ejecución web de LiteRT, que permite ejecutar modelos de aprendizaje automático directamente en el navegador y en Node.js. Este método elimina la necesidad de infraestructura de backend y ofrece rendimiento en tiempo real.
- Exporta el modelo YOLO26 al formato LiteRT.
- Integra el modelo exportado en tu aplicación web con LiteRT.js.
Para ver las instrucciones paso a paso, consulta nuestra guía de integración de LiteRT.