Ultralytics YOLO27:
Get Started

Análise comparativa das opções de implantação do YOLO26#

O YOLO26 oferece suporte a mais de 20 opções de implantação, cada uma ajustada a um ambiente de execução, destino de hardware ou plataforma diferente — de PyTorch e ONNX a TensorRT, OpenVINO, CoreML e formatos específicos para NPU de borda. A escolha certa equilibra a velocidade de inferência, as limitações de hardware e a facilidade de integração. Este guia compara todas as opções para ajudar você a escolher a mais adequada à sua aplicação e, em seguida, consultar as práticas recomendadas para implantação de modelos e implantá-la com confiabilidade.



Assista: Como escolher o melhor formato de implantação do Ultralytics YOLO26 para o seu projeto | TensorRT | OpenVINO 🚀

A implantação é a etapa do fluxo de trabalho do projeto de visão computacional em que um modelo treinado começa a realizar trabalho de verdade; por isso, o formato para o qual você exporta tem impacto direto na velocidade, no custo e na portabilidade.

Como escolher a opção de implantação certa para seu modelo YOLO26#

Quando chegar a hora de implantar seu modelo YOLO26, é muito importante selecionar um formato de exportação adequado. Conforme descrito na documentação de exportação do Ultralytics YOLO26, a função model.export() converte seu modelo treinado em vários formatos adaptados a diferentes ambientes e requisitos de desempenho.

O formato ideal depende do contexto operacional previsto para o modelo e do hardware.

Ignore a exportação manual

Para implantar de forma gerenciada, sem exportação manual, a Ultralytics Platform oferece endpoints de inferência prontos para uso, com escalonamento automático em 42 regiões globais.

Opções de implantação do YOLO26#

Veja uma breve descrição de cada formato e quando usá-lo. Para ver o passo a passo completo da exportação, consulte a documentação de exportação; para comparar os critérios lado a lado, acesse a tabela comparativa.

  • PyTorch (.pt): O formato nativo de treinamento e inferência, que oferece máxima flexibilidade e aceleração por GPU via NVIDIA CUDA ou AMD ROCm — ideal para pesquisa e prototipagem, sem necessidade de exportação.
  • TorchScript (torchscript): Serializa o modelo para um ambiente de execução C++ sem Python, adequado a sistemas de produção nos quais Python não está disponível.
  • ONNX (onnx): Formato de intercâmbio independente de framework, com amplo suporte a diferentes plataformas e hardwares por meio do ONNX Runtime, incluindo GPUs NVIDIA via CUDA e GPUs AMD via MIGraphX.
  • OpenVINO (openvino): Kit de ferramentas da Intel para inferência otimizada em CPUs, GPUs integradas e NPUs Intel, comum em IoT e computação de borda.
  • TensorRT (engine): Ambiente de execução de alto desempenho da NVIDIA que oferece inferência de ponta em GPU com otimização FP16 e INT8.
  • CoreML (coreml): Formato da Apple para execução no dispositivo em iOS, macOS, watchOS e tvOS, que utiliza o Apple Neural Engine.
  • Core AI (coreai): Novo formato .aimodel da Apple para iOS 27 e macOS 27, com execução em CPU, GPU e Apple Neural Engine; a exportação requer macOS 26 ou posterior em Apple silicon, ou Linux x86_64 com glibc 2.34 ou posterior, com Python 3.11 a 3.14.
  • TF SavedModel (saved_model): Formato padrão do TensorFlow para disponibilização escalável no servidor com TensorFlow Serving.
  • TF GraphDef (pb): Formato TensorFlow de grafo estático congelado para ambientes que precisam de um grafo computacional fixo.
  • TF Edge TPU (edgetpu): Compila modelos .tflite para aceleradores Google Coral Edge TPU.
  • LiteRT (litert): Ambiente de execução no dispositivo do Google (anteriormente TensorFlow Lite) para inferência em dispositivos móveis, embarcados e navegadores a partir de um único modelo .tflite, com suporte a FP32 e INT8 e execução no navegador via LiteRT.js.
  • PaddlePaddle (paddle): Framework de aprendizado profundo da Baidu, popular na China e com amplo suporte a hardware.
  • MNN (mnn): Mecanismo de inferência leve e de alto desempenho, otimizado para sistemas móveis e embarcados ARM e x86-64.
  • NCNN (ncnn): Framework de inferência leve e de alto desempenho, otimizado para dispositivos móveis ARM.
  • Sony IMX500 (imx): Exporta modelos para o sensor inteligente de visão IMX500 da Sony, com processamento no chip, como a Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Destinado a NPUs Rockchip em placas embarcadas, com quantização FP16 e INT8.
  • ExecuTorch (executorch): Ambiente de execução nativo no dispositivo do PyTorch para dispositivos móveis (iOS e Android) e sistemas embarcados via XNNPACK.
  • Axelera AI (axelera): Compila para a AIPU Metis da Axelera (até 856 TOPS) via PCIe ou M.2, para inferência de borda de alto desempenho.
  • DEEPX (deepx): Destinado a hardware NPU DEEPX com quantização INT8 para inferência embarcada na borda.
  • Qualcomm QNN (qnn): Inferência no dispositivo em NPU Snapdragon Hexagon, GPU Adreno e CPU por meio da pilha de IA da Qualcomm.

A integração com Hailo exporta diretamente para Hailo HEF modelos YOLO de detecção, segmentação, segmentação semântica, estimativa de profundidade, classificação, pose e OBB; consulte a tabela de compatibilidade para ver os modelos e destinos validados. A integração com Ambarella segue um fluxo de trabalho baseado primeiro em ONNX e compila exportações ONNX para o formato AmbaPB com a toolchain CVflow da Ambarella, destinada a SoCs CVflow® como o CV72, podendo usar o treinamento com reconhecimento de compressão SpongeTorch. A integração com Huawei Ascend compila exportações ONNX para o formato offline .om com o compilador CANN ATC, para inferência FP16 em processadores de IA Ascend. A integração com AMD Xilinx quantiza exportações ONNX com AMD Quark para NPUs Versal AI Edge Series Gen 2, que o Vitis AI Execution Provider compila em um modelo .rai.

Comparação das opções de implantação#

A tabela a seguir resume as opções de implantação para modelos YOLO26 de acordo com os critérios que normalmente orientam a escolha. Para uma análise aprofundada de cada formato, consulte a documentação dos formatos de exportação.

Opção de implantaçãoTestes de desempenhoCompatibilidade e integraçãoSuporte da comunidade e ecossistemaEstudos de casoManutenção e atualizaçõesConsiderações de segurançaAceleração de hardware
PyTorchBoa flexibilidade; pode haver concessões no desempenho brutoExcelente com bibliotecas PythonRecursos abrangentes e comunidade ativaPesquisa e protótiposDesenvolvimento regular e ativoDepende do ambiente de implantaçãoSuporte a CUDA para aceleração por GPU
TorchScriptMais adequado à produção do que PyTorchTransição simples de PyTorch para C++Especializado, mas mais limitado que PyTorchSetores em que Python é um gargaloAtualizações consistentes com PyTorchSegurança aprimorada sem Python completoHerda o suporte a CUDA do PyTorch
ONNXVariável conforme o ambiente de execuçãoAmpla em diferentes frameworksEcossistema abrangente, com suporte de muitas organizaçõesFlexibilidade entre frameworks de MLAtualizações regulares para novas operaçõesGaranta práticas seguras de conversão e implantaçãoDiversas otimizações de hardware
OpenVINOOtimizado para hardware IntelMelhor dentro do ecossistema IntelConsolidado no campo da visão computacionalIoT e edge com hardware IntelAtualizações regulares para hardware IntelRecursos robustos para aplicações sensíveisAdaptado para hardware Intel
TensorRTDesempenho de ponta em GPUs NVIDIAIdeal para hardware NVIDIAAmpla rede de contatos por meio da NVIDIAInferência de vídeo e imagens em tempo realAtualizações frequentes para novas GPUsÊnfase na segurançaProjetado para GPUs NVIDIA
CoreMLOtimizado para hardware Apple no próprio dispositivoExclusivo do ecossistema AppleForte suporte da Apple e de desenvolvedoresML no próprio dispositivo em produtos AppleAtualizações regulares da AppleFoco em privacidade e segurançaNeural Engine e GPU da Apple
Core AIOtimizado para Apple siliconiOS 27 e macOS 27; exportação no macOS 26+ com Apple silicon ou no Linux x86_64 (glibc 2.34+), Python 3.11-3.14Framework da Apple; ativação opcional nos SDKs do iOS/FlutterML no próprio dispositivo nas plataformas Apple de próxima geraçãoVinculado aos lançamentos de sistemas operacionais da Apple; atualmente em versão betaA inferência no próprio dispositivo mantém os dados localmenteNeural Engine, GPU e CPU da Apple
TF SavedModelEscalável em ambientes de servidorAmpla compatibilidade com o ecossistema TensorFlowAmplo suporte devido à popularidade do TensorFlowServir modelos em grande escalaAtualizações regulares do Google e da comunidadeRecursos robustos para empresasVárias opções de aceleração por hardware
TF GraphDefEstável para grafos de computação estáticosIntegra-se bem à infraestrutura do TensorFlowRecursos para otimizar grafos estáticosCenários que exigem grafos estáticosAtualizações em conjunto com o núcleo do TensorFlowPráticas de segurança consolidadas do TensorFlowOpções de aceleração do TensorFlow
TF Edge TPUOtimizado para o hardware Edge TPU do GoogleExclusivo para dispositivos Edge TPUCresce com recursos do Google e de terceirosDispositivos IoT que exigem processamento em tempo realMelhorias para o novo hardware Edge TPUSegurança robusta de IoT do GoogleProjetado sob medida para o Google Coral
LiteRTVelocidade e eficiência em dispositivos móveis, sistemas embarcados e na webCompatibilidade com dispositivos móveis, sistemas embarcados, edge e navegadoresComunidade robusta, com apoio do GoogleAplicativos no próprio dispositivo para Android, iOS e webRecursos mais recentes do runtime no próprio dispositivoInferência segura no próprio dispositivo e no navegadorAceleração por GPU, DSP e WebGPU
PaddlePaddleCompetitivo, fácil de usar e escalávelEcossistema Baidu, amplo suporte a aplicaçõesEm rápido crescimento, especialmente na ChinaMercado chinês e processamento de idiomasFoco em aplicações de IA chinesasDá ênfase à privacidade e à segurança dos dadosInclui os chips Kunlun da Baidu
MNNAlto desempenho para dispositivos móveisSistemas ARM móveis e embarcados e CPU X86-64Comunidade de ML móvel e embarcadaEficiência em sistemas móveisManutenção de alto desempenho em dispositivos móveisVantagens de segurança no próprio dispositivoOtimizações para CPUs e GPUs ARM
NCNNOtimizado para dispositivos móveis baseados em ARMSistemas ARM móveis e embarcadosComunidade de ML móvel e embarcada de nicho, mas ativaEficiência em sistemas Android e ARMManutenção de alto desempenho em ARMVantagens de segurança no próprio dispositivoOtimizações para CPUs e GPUs ARM
Sony IMX500Inferência no sensor com consumo de energia muito baixoSensor Sony IMX500, câmera Raspberry Pi AIEcossistema Sony AITRIOSIA de edge na câmeraAtualizações do SDK da Sony e da cadeia de ferramentas MCTOs dados permanecem no sensorAcelerador integrado ao chip Sony IMX500
Rockchip RKNNOtimizado para NPUs RockchipPlacas SoC Rockchip (por exemplo, RK3588)Comunidade de desenvolvedores RockchipDispositivos SBC embarcados e de edgeAtualizações do Rockchip RKNN-ToolkitInferência local no próprio dispositivoNPU Rockchip
ExecuTorchRuntime PyTorch eficiente no próprio dispositivoiOS, Android e sistemas embarcados via XNNPACKCom o apoio do projeto PyTorchAplicativos móveis e embarcadosMantido em conjunto com o PyTorchA inferência no próprio dispositivo mantém os dados localmenteXNNPACK e backends de CPU/GPU para dispositivos móveis
Axelera AIVazão muito alta (até 856 TOPS)Metis AIPU via PCIe ou M.2Axelera Voyager SDKInferência de edge com alta vazãoAtualizações do SDK da AxeleraInferência de borda localAIPU Metis da Axelera
DEEPXInferência de NPU otimizada para INT8Hardware de NPU da DEEPXFerramentas para desenvolvedores da DEEPX (dx_com, dx_engine)Inferência de borda embarcadaAtualizações do SDK e do ambiente de execução da DEEPXInferência local no próprio dispositivoNPU da DEEPX
Qualcomm QNNInferência rápida no dispositivo SnapdragonNPU Hexagon, GPU Adreno e CPU do SnapdragonEcossistema Qualcomm AI HubDispositivos Snapdragon móveis e de bordaAtualizações da pilha de IA da Qualcomm (QAIRT)A inferência no próprio dispositivo mantém os dados localmenteNPU Hexagon do Snapdragon
HailoInferência de HEF INT8 em NPUs HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler e HailoRTCâmeras, robôs e sistemas industriais de bordaLançamentos do Hailo DFC e do HailoRTInferência local no próprio dispositivoNPU Hailo
Huawei AscendMaior taxa de transferência no Ascend AI CorePlacas Atlas e OrangePi AIProEcossistema CANN da HuaweiInferência de borda em NPUs AscendLançamentos do CANN e do ATCInferência local no próprio dispositivoAscend AI Core
AMD XilinxInferência INT8 em NPUs Versal AI Edge Gen 2Versal AI Edge Series Gen 2 (VEK385)AMD Vitis AI e QuarkVisão computacional integrada em SoCs adaptativosVersões do Vitis AI e QuarkInferência local no próprio dispositivoNPU do AMD Versal AI Engine

Esta comparação oferece uma visão geral. Para a implantação, avalie os requisitos e as limitações específicos do seu projeto em relação a cada opção e consulte o guia de integração vinculado ao formato escolhido.

Conclusão#

A ampla variedade de formatos de exportação do YOLO26 permite adaptar um modelo a praticamente qualquer ambiente, desde um servidor de GPU na nuvem até uma câmera de borda com sensor integrado. Depois de escolher um formato, siga as práticas recomendadas para implantação de modelos para otimização, solução de problemas e segurança, e conte com a comunidade Ultralytics quando encontrar algum obstáculo.

Perguntas frequentes#

  • O Ultralytics YOLO26 oferece suporte a vários formatos de implantação, cada um projetado para ambientes e plataformas de hardware específicos. Os principais formatos incluem:

    • PyTorch para pesquisa e prototipagem, com excelente integração com Python.
    • TorchScript para ambientes de produção nos quais Python não está disponível.
    • ONNX para compatibilidade entre plataformas e aceleração de hardware.
    • OpenVINO para desempenho otimizado em hardware Intel.
    • TensorRT para inferência de alta velocidade em GPUs NVIDIA.

    Cada formato tem vantagens próprias. Para ver um passo a passo detalhado, consulte a documentação do processo de exportação.

  • Para aumentar a velocidade de inferência em CPUs Intel, você pode implantar seu modelo YOLO26 usando o kit de ferramentas OpenVINO da Intel. O OpenVINO oferece ganhos significativos de desempenho ao otimizar os modelos para aproveitar o hardware Intel com eficiência.

    1. Converta seu modelo YOLO26 para o formato OpenVINO usando a função model.export().
    2. Siga o guia detalhado de configuração na documentação de exportação do Intel OpenVINO.

    Para saber mais, confira nossa publicação no blog.

  • Sim, os modelos YOLO26 podem ser implantados em dispositivos móveis usando LiteRT (anteriormente TensorFlow Lite) e NCNN para Android, e CoreML ou LiteRT para iOS. O LiteRT é o ambiente de execução no dispositivo do Google para dispositivos móveis e embarcados e executa o mesmo modelo no Android, iOS e navegador, oferecendo inferência eficiente no dispositivo.

    Exemplo
    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    
    # Comentário para o comando de exportação no formato NCNN
    model.export(format="ncnn")

    Para obter mais detalhes sobre a implantação de modelos em dispositivos móveis, consulte nosso guia de integração do LiteRT.

  • Ao escolher um formato de implantação para o YOLO26, considere os seguintes fatores:

    • Desempenho: Alguns formatos, como o TensorRT, oferecem velocidades excepcionais em GPUs NVIDIA, enquanto o OpenVINO é otimizado para hardware Intel.
    • Compatibilidade: O ONNX oferece ampla compatibilidade entre diferentes plataformas.
    • Facilidade de integração: Formatos como CoreML ou LiteRT são adaptados a ecossistemas específicos, como iOS e Android, respectivamente.
    • Suporte da comunidade: Formatos como PyTorch e TensorFlow contam com amplos recursos e suporte da comunidade.

    Para uma análise comparativa, consulte nossa documentação sobre formatos de exportação.

  • Para implantar modelos YOLO26 em uma aplicação web, você pode usar o LiteRT.js, o ambiente de execução web do LiteRT, que permite executar modelos de aprendizado de máquina diretamente no navegador e no Node.js. Essa abordagem elimina a necessidade de infraestrutura de back-end e oferece desempenho em tempo real.

    1. Exporte o modelo YOLO26 para o formato LiteRT.
    2. Integre o modelo exportado à sua aplicação web usando o LiteRT.js.

    Para ver instruções passo a passo, consulte nosso guia de integração do LiteRT.

Comentários