Ultralytics YOLO27:
Get Started

Análisis comparativo de las opciones de implementación de YOLO26#

YOLO26 admite más de 20 opciones de implementación, cada una optimizada para un entorno de ejecución, un destino de hardware o una plataforma distintos: desde PyTorch y ONNX hasta TensorRT, OpenVINO, CoreML y formatos específicos para NPU de borde. Elegir la opción adecuada implica encontrar un equilibrio entre la velocidad de inferencia, las limitaciones del hardware y la facilidad de integración. Esta guía compara todas las opciones para que elijas la más adecuada para tu aplicación y, después, puedas consultar las prácticas recomendadas para la implementación de modelos e implementarla de forma fiable.



Ver: Cómo elegir el mejor formato de implementación de Ultralytics YOLO26 para tu proyecto | TensorRT | OpenVINO 🚀

La implementación es la fase del flujo de trabajo de un proyecto de visión artificial en la que un modelo entrenado empieza a realizar tareas reales, por lo que el formato al que lo exportes afecta directamente a la velocidad, el coste y la portabilidad.

Cómo elegir la opción de implementación adecuada para tu modelo YOLO26#

Cuando llegue el momento de implementar tu modelo YOLO26, es muy importante seleccionar un formato de exportación adecuado. Tal como se explica en la documentación de exportación de Ultralytics YOLO26, la función model.export() convierte el modelo entrenado a diversos formatos adaptados a distintos entornos y requisitos de rendimiento.

El formato ideal depende del contexto operativo previsto para el modelo y del hardware.

Omite la exportación manual

Para implementar modelos mediante un servicio gestionado sin exportarlos manualmente, Ultralytics Platform ofrece puntos de conexión de inferencia listos para usar, con escalado automático en 42 regiones de todo el mundo.

Opciones de implementación de YOLO26#

A continuación se ofrece una breve descripción de cada formato y de cuándo conviene utilizarlo. Para ver el proceso completo de exportación, consulta la documentación de exportación; para comparar los criterios en paralelo, ve a la tabla comparativa.

  • PyTorch (.pt): El formato nativo de entrenamiento e inferencia, que ofrece la máxima flexibilidad y aceleración GPU mediante NVIDIA CUDA o AMD ROCm. Es ideal para la investigación y la creación de prototipos, ya que no requiere ningún paso de exportación.
  • TorchScript (torchscript): Serializa el modelo para ejecutarlo en C++ sin Python; es adecuado para sistemas de producción en los que Python no está disponible.
  • ONNX (onnx): Formato de intercambio independiente de los frameworks, con amplia compatibilidad entre plataformas y hardware mediante ONNX Runtime, incluidas las GPU NVIDIA a través de CUDA y las GPU AMD mediante MIGraphX.
  • OpenVINO (openvino): Kit de herramientas de Intel para optimizar la inferencia en CPU Intel, GPU integradas y NPU; es habitual en IoT y computación en el borde.
  • TensorRT (engine): Entorno de ejecución de alto rendimiento de NVIDIA que ofrece inferencia GPU de primer nivel con optimización FP16 e INT8.
  • CoreML (coreml): Formato de Apple para ejecutar modelos en dispositivos iOS, macOS, watchOS y tvOS, que utiliza Apple Neural Engine.
  • Core AI (coreai): Nuevo formato .aimodel de Apple para iOS 27 y macOS 27, con programación de tareas en CPU, GPU y Apple Neural Engine; para exportar se necesita macOS 26 o posterior en Apple silicon, o Linux x86_64 con glibc 2.34 o posterior, y Python 3.11 a 3.14.
  • TF SavedModel (saved_model): Formato estándar de TensorFlow para servir modelos de forma escalable en el servidor con TensorFlow Serving.
  • TF GraphDef (pb): Formato de TensorFlow con un grafo estático congelado, para entornos que necesitan un grafo de cálculo fijo.
  • TF Edge TPU (edgetpu): Compila modelos .tflite para los aceleradores Google Coral Edge TPU.
  • LiteRT (litert): Entorno de ejecución de Google en el dispositivo (antes TensorFlow Lite) para inferencia móvil, integrada y en navegador a partir de un único modelo .tflite, con compatibilidad con FP32 e INT8 y ejecución en el navegador mediante LiteRT.js.
  • PaddlePaddle (paddle): Framework de aprendizaje profundo de Baidu, popular en China y compatible con una amplia variedad de hardware.
  • MNN (mnn): Motor de inferencia ligero y de alto rendimiento, optimizado para sistemas móviles e integrados ARM y x86-64.
  • NCNN (ncnn): Framework de inferencia ligero y de alto rendimiento, optimizado para dispositivos móviles ARM.
  • Sony IMX500 (imx): Exporta modelos para el sensor de visión inteligente IMX500 de Sony, con procesamiento en el chip, como la cámara Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Diseñado para las NPU Rockchip de placas integradas, con cuantización FP16 e INT8.
  • ExecuTorch (executorch): Entorno de ejecución nativo de PyTorch en el dispositivo para móviles (iOS y Android) y sistemas integrados mediante XNNPACK.
  • Axelera AI (axelera): Compila para la AIPU Metis de Axelera (hasta 856 TOPS) mediante PCIe o M.2, para ofrecer inferencia de alto rendimiento en el borde.
  • DEEPX (deepx): Diseñado para el hardware NPU de DEEPX, con cuantización INT8 para inferencia integrada en el borde.
  • Qualcomm QNN (qnn): Inferencia en el dispositivo con la NPU Snapdragon Hexagon, la GPU Adreno y la CPU mediante la pila de IA de Qualcomm.

La integración de Hailo exporta directamente a Hailo HEF los modelos YOLO de detección, segmentación, segmentación semántica, estimación de profundidad, clasificación, pose y OBB; consulta su tabla de compatibilidad para ver los modelos y destinos validados. La integración de Ambarella sigue un flujo de trabajo basado primero en ONNX y compila las exportaciones ONNX al formato AmbaPB con la cadena de herramientas CVflow de Ambarella para SoC CVflow®, como el CV72; puede usar opcionalmente el entrenamiento con reconocimiento de compresión SpongeTorch. La integración de Huawei Ascend compila las exportaciones ONNX al formato sin conexión .om con el compilador CANN ATC para la inferencia FP16 en procesadores Ascend AI. La integración de AMD Xilinx cuantiza las exportaciones ONNX con AMD Quark para las NPU de Versal AI Edge Series Gen 2, que el proveedor de ejecución Vitis AI compila en un modelo .rai.

Comparación de las opciones de implementación#

La tabla siguiente resume las opciones de implementación de los modelos YOLO26 según los criterios que suelen determinar la elección. Para conocer cada formato en profundidad, consulta la documentación sobre formatos de exportación.

Opción de implementaciónPruebas de rendimientoCompatibilidad e integraciónAsistencia de la comunidad y ecosistemaCasos prácticosMantenimiento y actualizacionesConsideraciones de seguridadAceleración de hardware
PyTorchBuena flexibilidad; puede implicar una reducción del rendimiento brutoExcelente con bibliotecas PythonAmplios recursos y comunidadInvestigación y prototiposDesarrollo periódico y activoDepende del entorno de implementaciónCompatibilidad con CUDA para acelerar la GPU
TorchScriptMás adecuado para producción que PyTorchTransición fluida de PyTorch a C++Especializado, pero más limitado que PyTorchSectores en los que Python supone un cuello de botellaActualizaciones coherentes con PyTorchMayor seguridad sin depender por completo de PythonHereda la compatibilidad con CUDA de PyTorch
ONNXVariable según el entorno de ejecuciónAlta entre distintos frameworksEcosistema amplio, respaldado por muchas organizacionesFlexibilidad entre frameworks de MLActualizaciones periódicas para nuevas operacionesAsegúrate de seguir prácticas seguras de conversión e implementaciónDiversas optimizaciones de hardware
OpenVINOOptimizado para hardware IntelÓptimo dentro del ecosistema IntelSólido en el ámbito de la visión artificialIoT y edge con hardware de IntelActualizaciones periódicas para hardware de IntelFunciones robustas para aplicaciones sensiblesAdaptado al hardware de Intel
TensorRTRendimiento de primer nivel en GPU NVIDIAIdeal para hardware de NVIDIAAmplia red de contactos a través de NVIDIAInferencia de vídeo e imágenes en tiempo realActualizaciones frecuentes para las nuevas GPUÉnfasis en la seguridadDiseñado para GPU NVIDIA
CoreMLOptimizado para hardware Apple en el dispositivoExclusivo del ecosistema AppleSólido respaldo de Apple y de los desarrolladoresML en el dispositivo en productos AppleActualizaciones periódicas de ApplePrioriza la privacidad y la seguridadMotor neuronal y GPU de Apple
Core AIOptimizado para Apple siliconiOS 27 y macOS 27; exportación en macOS 26+ con Apple silicon o Linux x86_64 (glibc 2.34+), Python 3.11-3.14Framework de Apple; activación opcional en los SDK de iOS/FlutterML en el dispositivo en las plataformas Apple de próxima generaciónVinculado a las versiones del sistema operativo de Apple; actualmente en betaLa inferencia en el dispositivo mantiene los datos en localNeural Engine, GPU y CPU de Apple
TF SavedModelEscalable en entornos de servidorAmplia compatibilidad con el ecosistema TensorFlowAmplio respaldo gracias a la popularidad de TensorFlowServicio de modelos a gran escalaActualizaciones periódicas de Google y la comunidadFunciones robustas para empresasDiversas aceleraciones de hardware
TF GraphDefEstable para grafos de computación estáticosSe integra bien con la infraestructura de TensorFlowRecursos para optimizar grafos estáticosEscenarios que requieren grafos estáticosActualizaciones junto con el núcleo de TensorFlowPrácticas de seguridad consolidadas de TensorFlowOpciones de aceleración de TensorFlow
TF Edge TPUOptimizado para el hardware Edge TPU de GoogleExclusivo para dispositivos Edge TPUCrece gracias a los recursos de Google y de tercerosDispositivos IoT que requieren procesamiento en tiempo realMejoras para el nuevo hardware Edge TPUSeguridad IoT robusta de GoogleDiseñado específicamente para Google Coral
LiteRTVelocidad y eficiencia en móviles, sistemas integrados y webCompatibilidad con móviles, sistemas integrados, edge y navegadoresComunidad sólida, con el respaldo de GoogleAplicaciones en el dispositivo para Android, iOS y webFunciones más recientes del entorno de ejecución en el dispositivoInferencia segura en el dispositivo y en el navegadorAceleración mediante GPU, DSP y WebGPU
PaddlePaddleCompetitivo, fácil de usar y escalableEcosistema de Baidu y amplia compatibilidad con aplicacionesCrecimiento rápido, especialmente en ChinaProcesamiento del mercado y el idioma chinosEnfoque en aplicaciones de IA chinasPrioriza la privacidad y la seguridad de los datosIncluye los chips Kunlun de Baidu
MNNAlto rendimiento para dispositivos móvilesSistemas ARM móviles e integrados y CPU X86-64Comunidad de ML móvil e integradoEficiencia en sistemas móvilesMantenimiento de alto rendimiento en dispositivos móvilesVentajas de seguridad en el dispositivoOptimizaciones para CPU y GPU ARM
NCNNOptimizado para dispositivos móviles basados en ARMSistemas ARM móviles e integradosComunidad de ML móvil e integrado, pequeña pero activaEficiencia en sistemas Android y ARMMantenimiento de alto rendimiento en ARMVentajas de seguridad en el dispositivoOptimizaciones para CPU y GPU ARM
Sony IMX500Inferencia en el sensor con un consumo muy bajoSensor Sony IMX500, cámara Raspberry Pi AI CameraEcosistema Sony AITRIOSIA edge en la cámaraActualizaciones del SDK de Sony y de la cadena de herramientas MCTLos datos permanecen en el sensorAcelerador integrado en el chip Sony IMX500
Rockchip RKNNOptimizado para NPU de RockchipPlacas SoC Rockchip (p. ej., RK3588)Comunidad de desarrolladores de RockchipDispositivos edge y SBC integradosActualizaciones de Rockchip RKNN-ToolkitInferencia local en el dispositivoNPU de Rockchip
ExecuTorchEntorno de ejecución PyTorch eficiente en el dispositivoiOS, Android y sistemas integrados mediante XNNPACKRespaldado por el proyecto PyTorchAplicaciones móviles e integradasMantenimiento coordinado con PyTorchLa inferencia en el dispositivo mantiene los datos en localXNNPACK y backends de CPU/GPU para móviles
Axelera AIRendimiento muy alto (hasta 856 TOPS)Metis AIPU mediante PCIe o M.2SDK Axelera VoyagerInferencia edge de alto rendimientoActualizaciones del SDK de AxeleraInferencia edge localAIPU Metis de Axelera
DEEPXInferencia en NPU optimizada para INT8Hardware NPU de DEEPXHerramientas para desarrolladores de DEEPX (dx_com, dx_engine)Inferencia edge integradaActualizaciones del SDK y el entorno de ejecución de DEEPXInferencia local en el dispositivoNPU de DEEPX
Qualcomm QNNInferencia rápida en el dispositivo con SnapdragonNPU Hexagon de Snapdragon, GPU Adreno y CPUEcosistema Qualcomm AI HubDispositivos Snapdragon móviles y edgeActualizaciones de la pila de IA de Qualcomm (QAIRT)La inferencia en el dispositivo mantiene los datos en localNPU Hexagon de Snapdragon
HailoInferencia HEF INT8 en NPU HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler y HailoRTCámaras, robots y sistemas edge industrialesVersiones de Hailo DFC y HailoRTInferencia local en el dispositivoNPU de Hailo
Huawei AscendMayor rendimiento en Ascend AI CorePlacas Atlas y OrangePi AIProEcosistema Huawei CANNInferencia edge en NPU AscendVersiones de CANN y ATCInferencia local en el dispositivoAscend AI Core
AMD XilinxInferencia INT8 en las NPU de Versal AI Edge Gen 2Versal AI Edge Series Gen 2 (VEK385)AMD Vitis AI y QuarkVisión integrada en SoC adaptativosVersiones de Vitis AI y QuarkInferencia local en el dispositivoNPU Versal AI Engine

Esta comparación te ofrece una visión general. Para la implementación, sopesa los requisitos y las limitaciones concretos de tu proyecto en relación con cada opción y consulta la guía de integración enlazada para el formato que elijas.

Conclusión#

La amplia variedad de formatos de exportación de YOLO26 te permite adaptar un modelo a casi cualquier entorno, desde un servidor en la nube con GPU hasta una cámara edge con sensor. Cuando hayas elegido un formato, sigue las prácticas recomendadas para implementar modelos en materia de optimización, resolución de problemas y seguridad, y recurre a la comunidad de Ultralytics cuando te encuentres con algún problema.

Preguntas frecuentes#

  • Ultralytics YOLO26 admite varios formatos de implementación, cada uno diseñado para entornos y plataformas de hardware específicos. Entre los formatos principales se incluyen:

    • PyTorch para investigación y creación de prototipos, con una integración excelente con Python.
    • TorchScript para entornos de producción en los que Python no está disponible.
    • ONNX para compatibilidad multiplataforma y aceleración por hardware.
    • OpenVINO para un rendimiento optimizado en hardware Intel.
    • TensorRT para inferencias de alta velocidad en GPU NVIDIA.

    Cada formato ofrece ventajas propias. Para ver una explicación detallada, consulta nuestra documentación sobre el proceso de exportación.

  • Para aumentar la velocidad de inferencia en CPU Intel, puedes implementar tu modelo YOLO26 con el kit de herramientas OpenVINO de Intel. OpenVINO ofrece mejoras de rendimiento considerables al optimizar los modelos para aprovechar el hardware Intel de forma eficiente.

    1. Convierte tu modelo YOLO26 al formato OpenVINO con la función model.export().
    2. Sigue la guía detallada de configuración de la documentación sobre la exportación a Intel OpenVINO.

    Para obtener más información, consulta nuestra publicación del blog.

  • Sí, puedes implementar modelos YOLO26 en dispositivos móviles con LiteRT (anteriormente TensorFlow Lite) y NCNN para Android, y con CoreML o LiteRT para iOS. LiteRT es el entorno de ejecución de Google en el dispositivo para móviles y dispositivos integrados, y ejecuta el mismo modelo en Android, iOS y el navegador, lo que permite realizar inferencias eficientes en el dispositivo.

    Ejemplo
    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    
    # Comando de exportación al formato NCNN
    model.export(format="ncnn")

    Para obtener más información sobre cómo implementar modelos en dispositivos móviles, consulta nuestra guía de integración de LiteRT.

  • Al elegir un formato de implementación para YOLO26, ten en cuenta los siguientes factores:

    • Rendimiento: algunos formatos, como TensorRT, ofrecen velocidades excepcionales en GPU NVIDIA, mientras que OpenVINO está optimizado para hardware Intel.
    • Compatibilidad: ONNX ofrece una amplia compatibilidad con distintas plataformas.
    • Facilidad de integración: formatos como CoreML o LiteRT están adaptados a ecosistemas específicos, como iOS y Android, respectivamente.
    • Asistencia de la comunidad: formatos como PyTorch y TensorFlow cuentan con amplios recursos y asistencia de la comunidad.

    Para ver un análisis comparativo, consulta nuestra documentación sobre formatos de exportación.

  • Para implementar modelos YOLO26 en una aplicación web, puedes usar LiteRT.js, el entorno de ejecución web de LiteRT, que permite ejecutar modelos de aprendizaje automático directamente en el navegador y en Node.js. Este método elimina la necesidad de infraestructura de backend y ofrece rendimiento en tiempo real.

    1. Exporta el modelo YOLO26 al formato LiteRT.
    2. Integra el modelo exportado en tu aplicación web con LiteRT.js.

    Para ver las instrucciones paso a paso, consulta nuestra guía de integración de LiteRT.

Comentarios