YOLO Vision 2026:

Análise Comparativa das Opções de Implementação do YOLO26#

O YOLO26 suporta mais de 20 opções de implantação, cada uma otimizada para um tempo de execução, alvo de hardware ou plataforma diferente — desde PyTorch e ONNX até TensorRT, OpenVINO, CoreML e formatos dedicados de NPU de borda. Escolher a opção certa equilibra velocidade de inferência, restrições de hardware e facilidade de integração. Este guia compara todas as opções para que possas escolher a melhor opção para a tua aplicação, avançando depois para as boas práticas de implantação de modelos para os implantar de forma fiável.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

A implantação é a etapa no fluxo de trabalho do projeto de visão computacional em que um modelo treinado começa a realizar trabalho real, pelo que o formato para o qual o exportas tem um impacto direto na velocidade, custo e portabilidade.

Como Selecionar a Opção de Implementação Certa para o teu Modelo YOLO26#

Quando chegar o momento de implantar o teu modelo YOLO26, selecionar um formato de exportação adequado é muito importante. Conforme descrito na documentação de exportação do Ultralytics YOLO26, a função model.export() converte o teu modelo treinado numa variedade de formatos adaptados a diversos ambientes e requisitos de desempenho.

O formato ideal depende do contexto operacional pretendido para o teu modelo e do hardware.

Ignora a exportação manual

Para uma implantação gerida sem exportação manual, a Ultralytics Platform fornece endpoints de inferência prontos a usar com autoscaling em 42 regiões globais.

Opções de Implementação do YOLO26#

Aqui tens uma breve descrição de cada formato e de quando deves utilizá-lo. Para o passo a passo completo de exportação, consulta a documentação de exportação; para os critérios lado a lado, vai diretamente para a tabela de comparação.

  • PyTorch (.pt): O formato nativo de treino e inferência, que oferece máxima flexibilidade e aceleração por GPU através de NVIDIA CUDA ou AMD ROCm — ideal para investigação e prototipagem sem necessidade de passo de exportação.
  • TorchScript (torchscript): Serializa o modelo para um runtime de C++ sem Python, adequado para sistemas de produção onde o Python não está disponível.
  • ONNX (onnx): Um formato de intercâmbio agnóstico de framework com amplo suporte multiplataforma e de hardware através do ONNX Runtime.
  • OpenVINO (openvino): O kit de ferramentas da Intel para inferência otimizada em CPUs Intel, GPUs integradas e NPUs, comum em IoT e computação de borda.
  • TensorRT (engine): O runtime de alto desempenho da NVIDIA que oferece inferência em GPU de topo com otimização FP16 e INT8.
  • CoreML (coreml): O formato no dispositivo da Apple para iOS, macOS, watchOS e tvOS, utilizando o Apple Neural Engine.
  • TF SavedModel (saved_model): O formato padrão do TensorFlow para servir aplicações do lado do servidor de forma escalável com o TensorFlow Serving.
  • TF GraphDef (pb): Um formato de grafo estático e congelado do TensorFlow para ambientes que necessitam de um grafo de computação fixo.
  • TF Edge TPU (edgetpu): Compila modelos .tflite para aceleradores Google Coral Edge TPU.
  • LiteRT (litert): O runtime no dispositivo da Google (anteriormente TensorFlow Lite) para inferência em dispositivos móveis, embarcados e no navegador a partir de um único modelo .tflite, com suporte para FP32 e INT8 e execução no navegador através do LiteRT.js.
  • PaddlePaddle (paddle): O framework de aprendizagem profunda da Baidu, popular na China, com amplo suporte de hardware.
  • MNN (mnn): Um motor de inferência leve e de alto desempenho otimizado para sistemas móveis e embarcados ARM e x86-64.
  • NCNN (ncnn): Um framework de inferência leve e de alto desempenho otimizado para dispositivos móveis ARM.
  • Sony IMX500 (imx): Exportações para o sensor de visão inteligente IMX500 da Sony com processamento no chip, como a Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Direcionado a NPUs Rockchip em placas embarcadas com quantização FP16 e INT8.
  • ExecuTorch (executorch): O runtime nativo no dispositivo do PyTorch para dispositivos móveis (iOS e Android) e sistemas embarcados através do XNNPACK.
  • Axelera AI (axelera): Compila para o AIPU Metis da Axelera (até 856 TOPS) através de PCIe ou M.2 para inferência de borda de alto rendimento.
  • DEEPX (deepx): Direcionado a hardware NPU DEEPX com quantização INT8 para inferência de borda embarcada.
  • Qualcomm QNN (qnn): Inferência no dispositivo em Snapdragon Hexagon NPU, Adreno GPU e CPU através da stack de IA da Qualcomm.

A integração Hailo exporta modelos de deteção, segmentação, segmentação semântica, estimativa de profundidade, classificação, pose e OBB do YOLO diretamente para HEF da Hailo; consulta a respetiva tabela de compatibilidade para modelos e alvos validados. A integração Ambarella segue um fluxo de trabalho com foco no ONNX e compila exportações ONNX para o formato AmbaPB com a toolchain CVflow da Ambarella para SoCs CVflow® como o CV72, utilizando opcionalmente o treino consciente de compressão SpongeTorch. A integração Huawei Ascend compila exportações ONNX para o formato offline .om com o compilador CANN ATC para inferência em FP16 em Processadores de IA Ascend.

Comparação das Opções de Implantação#

A tabela seguinte resume as opções de implantação para modelos YOLO26 de acordo com os critérios que normalmente determinam a escolha. Para uma análise detalhada de cada formato, consulta a documentação de formatos de exportação.

Opção de ImplantaçãoBenchmarks de DesempenhoCompatibilidade e IntegraçãoSuporte da Comunidade e EcossistemaEstudos de CasoManutenção e AtualizaçõesConsiderações de SegurançaAceleração de Hardware
PyTorchBoa flexibilidade; pode sacrificar o desempenho brutoExcelente com bibliotecas PythonRecursos extensos e comunidadePesquisa e protótiposDesenvolvimento regular e ativoDependente do ambiente de implantaçãoSuporte CUDA para aceleração de GPU
TorchScriptMelhor para produção do que o PyTorchTransição suave do PyTorch para C++Especializado, mas mais restrito que o PyTorchIndústria onde o Python é um gargaloAtualizações consistentes com PyTorchSegurança aprimorada sem o Python completoHerda suporte CUDA do PyTorch
ONNXVariável dependendo do runtimeAlta em diferentes estruturasEcossistema amplo, suportado por muitas organizaçõesFlexibilidade entre estruturas de MLAtualizações regulares para novas operaçõesGaranta práticas seguras de conversão e implantaçãoVárias otimizações de hardware
OpenVINOOtimizado para hardware IntelMelhor dentro do ecossistema IntelSólido no domínio de visão computacionalIoT e borda com hardware IntelAtualizações regulares para hardware IntelRecursos robustos para aplicações sensíveisAdaptado para hardware Intel
TensorRTNível superior em GPUs NVIDIAMelhor para hardware NVIDIARede forte através da NVIDIAInferência de vídeo e imagem em tempo realAtualizações frequentes para novas GPUsÊnfase na segurançaProjetado para GPUs NVIDIA
CoreMLOtimizado para hardware Apple no dispositivoExclusivo para o ecossistema AppleForte suporte da Apple e da comunidade de desenvolvedoresML no dispositivo em produtos AppleAtualizações regulares da AppleFoco em privacidade e segurançaApple neural engine e GPU
TF SavedModelEscalável em ambientes de servidorAmpla compatibilidade no ecossistema TensorFlowGrande suporte devido à popularidade do TensorFlowServindo modelos em escalaAtualizações regulares pelo Google e pela comunidadeRecursos robustos para empresasVárias acelerações de hardware
TF GraphDefEstável para grafos de computação estáticosIntegra-se bem com a infraestrutura TensorFlowRecursos para otimização de grafos estáticosCenários que requerem grafos estáticosAtualizações junto com o núcleo do TensorFlowPráticas de segurança estabelecidas do TensorFlowOpções de aceleração do TensorFlow
TF Edge TPUOtimizado para o hardware Edge TPU do GoogleExclusivo para dispositivos Edge TPUCrescendo com recursos do Google e de terceirosDispositivos IoT que requerem processamento em tempo realMelhorias para o novo hardware Edge TPUSegurança de IoT robusta do GoogleProjetado sob medida para o Google Coral
LiteRTVelocidade e eficiência em dispositivos móveis/embarcados/webSuporte a dispositivos móveis, embarcados, edge e navegadoresComunidade robusta, com o respaldo do GoogleAplicativos on-device em Android, iOS e webRecursos mais recentes de runtime on-deviceInferência segura on-device e no navegadorAceleração por GPU, DSP e WebGPU
PaddlePaddleCompetitivo, fácil de usar e escalávelEcossistema Baidu, amplo suporte a aplicaçõesCrescimento rápido, especialmente na ChinaMercado chinês e processamento de linguagemFoco em aplicações de IA chinesasEnfatiza a privacidade e segurança de dadosIncluindo chips Kunlun da Baidu
MNNAlto desempenho para dispositivos móveisSistemas ARM móveis e embarcados e CPU X86-64Comunidade de ML móvel/embarcadaEficiência de sistemas móveisManutenção de alto desempenho em dispositivos móveisVantagens de segurança no dispositivoOtimizações de CPUs e GPUs ARM
NCNNOtimizado para dispositivos móveis baseados em ARMSistemas ARM móveis e embarcadosComunidade de ML móvel/embarcada de nicho, porém ativaEficiência de sistemas Android e ARMManutenção de alto desempenho em ARMVantagens de segurança no dispositivoOtimizações de CPUs e GPUs ARM
Sony IMX500Inferência no sensor com consumo de energia muito baixoSensor Sony IMX500, Raspberry Pi AI CameraEcossistema Sony AITRIOSIA de borda na câmaraAtualizações do SDK da Sony e cadeia de ferramentas MCTOs dados permanecem no sensorAcelerador no chip Sony IMX500
Rockchip RKNNOtimizado para NPUs RockchipPlacas SoC Rockchip (ex: RK3588)Comunidade de programadores RockchipSBC embebidas e dispositivos de bordaAtualizações do Rockchip RKNN-ToolkitInferência local no dispositivoNPU Rockchip
ExecuTorchTempo de execução PyTorch eficiente no dispositivoiOS, Android, embebido via XNNPACKApoiado pelo projeto PyTorchAplicações móveis e embebidasMantido em paralelo com o PyTorchInferência no dispositivo mantém os dados locaisBackends de CPU/GPU móveis e XNNPACK
Axelera AIRendimento muito elevado (até 856 TOPS)Metis AIPU via PCIe ou M.2Axelera Voyager SDKInferência de borda de alto rendimentoAtualizações do SDK da AxeleraInferência de borda localAxelera Metis AIPU
DEEPXInferência de NPU otimizada para INT8Hardware NPU DEEPXFerramentas de desenvolvimento DEEPX (dx_com, dx_engine)Inferência de borda embebidaAtualizações do SDK e tempo de execução da DEEPXInferência local no dispositivoNPU DEEPX
Qualcomm QNNInferência rápida no dispositivo SnapdragonSnapdragon Hexagon NPU, Adreno GPU, CPUEcossistema Qualcomm AI HubDispositivos Snapdragon móveis e de bordaAtualizações da stack de IA da Qualcomm (QAIRT)Inferência no dispositivo mantém os dados locaisNPU Snapdragon Hexagon

Esta comparação dá-te uma visão geral de alto nível. Para a implantação, avalia os requisitos e restrições específicos do teu projeto face a cada opção e consulta o guia de integração linkado para o formato que escolheres.

Conclusão#

A ampla gama de formatos de exportação do YOLO26 permite-te adaptar um modelo a quase qualquer ambiente, desde um servidor GPU na nuvem até uma câmara de borda com sensor integrado. Assim que escolheres um formato, segue as boas práticas de implantação de modelos para otimização, resolução de problemas e segurança, e conta com a comunidade Ultralytics sempre que tiveres alguma dificuldade.

FAQ#

  • O Ultralytics YOLO26 suporta vários formatos de implantação, cada um projetado para ambientes e plataformas de hardware específicos. Os principais formatos incluem:

    • PyTorch para pesquisa e prototipagem, com excelente integração com Python.
    • TorchScript para ambientes de produção onde o Python não está disponível.
    • ONNX para compatibilidade entre plataformas e aceleração de hardware.
    • OpenVINO para desempenho otimizado em hardware Intel.
    • TensorRT para inferência de alta velocidade em GPUs NVIDIA.

    Cada formato tem vantagens únicas. Para um guia passo a passo detalhado, consulta a nossa documentação do processo de exportação.

  • Para melhorar a velocidade de inferência em CPUs Intel, você pode implantar seu modelo YOLO26 usando o kit de ferramentas OpenVINO da Intel. O OpenVINO oferece aumentos significativos de desempenho ao otimizar modelos para aproveitar o hardware Intel de forma eficiente.

    1. Converte o teu modelo YOLO26 para o formato OpenVINO utilizando a função model.export().
    2. Segue o guia de configuração detalhado na documentação de exportação do Intel OpenVINO.

    Para mais perspetivas, consulta a nossa publicação no blog.

  • Sim, os modelos YOLO26 podem ser implantados em dispositivos móveis utilizando LiteRT (anteriormente TensorFlow Lite) e NCNN para Android, e CoreML ou LiteRT para iOS. O LiteRT é o runtime no dispositivo da Google para dispositivos móveis e embarcados e executa o mesmo modelo em Android, iOS e no navegador, proporcionando uma inferência eficiente no dispositivo.

    Exemplo
    # Export command for NCNN format
    model.export(format="ncnn")

    Para mais detalhes sobre a implantação de modelos em dispositivos móveis, consulta o nosso guia de integração do LiteRT.

  • Ao escolher um formato de implantação para o YOLO26, considere os seguintes fatores:

    • Desempenho: Alguns formatos como o TensorRT oferecem velocidades excepcionais em GPUs NVIDIA, enquanto o OpenVINO é otimizado para hardware Intel.
    • Compatibilidade: O ONNX oferece ampla compatibilidade entre diferentes plataformas.
    • Facilidade de Integração: Formatos como CoreML ou LiteRT são adaptados para ecossistemas específicos como iOS e Android, respectivamente.
    • Suporte da Comunidade: Formatos como PyTorch e TensorFlow possuem extensos recursos e suporte da comunidade.

    Para uma análise comparativa, consulta a nossa documentação de formatos de exportação.

  • Para implantar modelos YOLO26 numa aplicação web, podes utilizar o LiteRT.js, o runtime web do LiteRT, que permite executar modelos de aprendizagem automática diretamente no navegador e no Node.js. Esta abordagem elimina a necessidade de infraestrutura de backend e oferece desempenho em tempo real.

    1. Exporte o modelo YOLO26 para o formato LiteRT.
    2. Integre o modelo exportado em sua aplicação web usando o LiteRT.js.

    Para obteres instruções passo a passo, consulta o nosso guia de integração do LiteRT.

Comentários