Ultralytics YOLO27:

Análise comparativa das opções de implementação do YOLO26#

O YOLO26 é compatível com mais de 20 opções de implementação, cada uma otimizada para um runtime, destino de hardware ou plataforma diferente — desde PyTorch e ONNX até TensorRT, OpenVINO, CoreML e formatos dedicados para NPU de edge. Escolher a opção certa exige equilibrar a velocidade de inferência, as limitações do hardware e a facilidade de integração. Este guia compara todas as opções para que possas escolher a mais adequada à tua aplicação e, em seguida, consultar as melhores práticas de implementação de modelos para fazer uma implementação fiável.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

A implementação é a etapa do fluxo de trabalho de um projeto de visão computacional em que um modelo treinado começa a realizar trabalho real, pelo que o formato para o qual exportas tem um impacto direto na velocidade, no custo e na portabilidade.

Como selecionar a opção de implementação certa para o teu modelo YOLO26#

Quando chegar o momento de implementar o teu modelo YOLO26, é muito importante selecionar um formato de exportação adequado. Conforme descrito na documentação de exportação do Ultralytics YOLO26, a função model.export() converte o teu modelo treinado numa variedade de formatos adaptados a diferentes ambientes e requisitos de desempenho.

O formato ideal depende do contexto operacional pretendido para o teu modelo e do hardware.

Ignora a exportação manual

Para uma implementação gerida sem exportação manual, a Ultralytics Platform disponibiliza endpoints de inferência prontos a utilizar, com escalabilidade automática em 42 regiões globais.

Opções de implementação do YOLO26#

Segue-se uma breve descrição de cada formato e das situações em que deves utilizá-lo. Para consultar o guia completo de exportação, vê a documentação de exportação; para conhecer os critérios lado a lado, consulta a tabela de comparação.

  • PyTorch (.pt): o formato nativo de treino e inferência, que oferece a máxima flexibilidade e aceleração de GPU através de NVIDIA CUDA ou AMD ROCm — ideal para investigação e prototipagem, sem necessidade de uma etapa de exportação.
  • TorchScript (torchscript): serializa o modelo para um runtime C++ sem Python, adequado para sistemas de produção onde Python não está disponível.
  • ONNX (onnx): um formato de intercâmbio independente de framework, com amplo suporte multiplataforma e de hardware através do ONNX Runtime.
  • OpenVINO (openvino): o toolkit da Intel para inferência otimizada em CPUs Intel, GPUs integradas e NPUs, comum em IoT e computação de edge.
  • TensorRT (engine): o runtime de alto desempenho da NVIDIA, que oferece inferência de GPU de topo com otimização FP16 e INT8.
  • CoreML (coreml): o formato da Apple para execução no dispositivo em iOS, macOS, watchOS e tvOS, utilizando o Apple Neural Engine.
  • TF SavedModel (saved_model): o formato padrão do TensorFlow para disponibilização escalável no lado do servidor com o TensorFlow Serving.
  • TF GraphDef (pb): um formato TensorFlow de grafo estático congelado para ambientes que necessitam de um grafo de computação fixo.
  • TF Edge TPU (edgetpu): compila modelos .tflite para aceleradores Google Coral Edge TPU.
  • LiteRT (litert): o runtime da Google para execução no dispositivo (anteriormente TensorFlow Lite), destinado à inferência em dispositivos móveis, sistemas incorporados e navegadores a partir de um único modelo .tflite, com suporte para FP32 e INT8 e execução no navegador através do LiteRT.js.
  • PaddlePaddle (paddle): o framework de deep learning da Baidu, popular na China, com amplo suporte de hardware.
  • MNN (mnn): um motor de inferência leve e de alto desempenho, otimizado para sistemas ARM e x86-64 móveis e incorporados.
  • NCNN (ncnn): um framework de inferência leve e de alto desempenho, otimizado para dispositivos ARM móveis.
  • Sony IMX500 (imx): exportações para o sensor de visão inteligente IMX500 da Sony, com processamento no chip, como a Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): destina-se a NPUs Rockchip em placas incorporadas, com quantização FP16 e INT8.
  • ExecuTorch (executorch): o runtime nativo no dispositivo do PyTorch para sistemas móveis (iOS e Android) e incorporados através do XNNPACK.
  • Axelera AI (axelera): compila para a AIPU Metis da Axelera (até 856 TOPS) através de PCIe ou M.2, para inferência de edge de alto débito.
  • DEEPX (deepx): destina-se a hardware NPU DEEPX, com quantização INT8 para inferência de edge incorporada.
  • Qualcomm QNN (qnn): inferência no dispositivo em NPU Hexagon Snapdragon, GPU Adreno e CPU através da stack de IA da Qualcomm.
  • Core AI (coreai): o novo formato .aimodel da Apple para o iOS 27 e macOS 27, programado para CPU, GPU e Apple Neural Engine; a exportação precisa do macOS 26 ou posterior em silício Apple.

A integração Hailo exporta modelos YOLO de deteção, segmentação, segmentação semântica, estimativa de profundidade, classificação, pose e OBB diretamente para Hailo HEF; consulta a sua tabela de compatibilidade para ver os modelos e destinos validados. A integração Ambarella segue um fluxo de trabalho baseado primeiro em ONNX e compila exportações ONNX para o formato AmbaPB com o toolchain CVflow da Ambarella para SoCs CVflow®, como o CV72, utilizando opcionalmente treino com consciência de compressão SpongeTorch. A integração Huawei Ascend compila exportações ONNX para o formato offline .om com o compilador CANN ATC, para inferência FP16 em Ascend AI Processors.

Comparação das opções de implementação#

A tabela seguinte resume as opções de implementação para modelos YOLO26 segundo os critérios que normalmente orientam a escolha. Para uma análise detalhada de cada formato, consulta a documentação dos formatos de exportação.

Opção de implementaçãoBenchmarks de desempenhoCompatibilidade e integraçãoSuporte da comunidade e ecossistemaEstudos de casoManutenção e atualizaçõesConsiderações de segurançaAceleração de hardware
PyTorchBoa flexibilidade; pode implicar um compromisso no desempenho brutoExcelente com bibliotecas PythonRecursos e comunidade abrangentesInvestigação e protótiposDesenvolvimento regular e ativoDepende do ambiente de implementaçãoSuporte CUDA para aceleração de GPU
TorchScriptMelhor para produção do que PyTorchTransição simples de PyTorch para C++Especializado, mas mais limitado do que PyTorchSetores em que Python é um obstáculoAtualizações consistentes com PyTorchSegurança melhorada sem Python completoHerda o suporte CUDA do PyTorch
ONNXVariável consoante o runtimeElevada entre diferentes frameworksEcossistema abrangente, com suporte de muitas organizaçõesFlexibilidade entre frameworks de MLAtualizações regulares para novas operaçõesGarante práticas seguras de conversão e implementaçãoVárias otimizações de hardware
OpenVINOOtimizado para hardware IntelMelhor no ecossistema IntelSólido no domínio da visão computacionalIoT e edge com hardware IntelAtualizações regulares para hardware IntelFuncionalidades robustas para aplicações sensíveisAdaptado para hardware Intel
TensorRTDe topo em GPUs NVIDIAMelhor para hardware NVIDIARede forte através da NVIDIAInferência de vídeo e imagem em tempo realAtualizações frequentes para novas GPUsÊnfase na segurançaConcebido para GPUs NVIDIA
CoreMLOtimizado para hardware Apple no dispositivoExclusivo do ecossistema AppleForte suporte da Apple e dos programadoresML no dispositivo em produtos AppleAtualizações regulares da AppleFoco na privacidade e na segurançaApple Neural Engine e GPU
TF SavedModelEscalável em ambientes de servidorAmpla compatibilidade no ecossistema TensorFlowAmplo suporte devido à popularidade do TensorFlowDisponibilização de modelos em escalaAtualizações regulares da Google e da comunidadeFuncionalidades robustas para empresasVárias acelerações de hardware
TF GraphDefEstável para grafos de computação estáticosIntegra-se bem com a infraestrutura do TensorFlowRecursos para otimizar grafos estáticosCenários que exigem grafos estáticosAtualizações em conjunto com o núcleo do TensorFlowPráticas de segurança do TensorFlow consolidadasOpções de aceleração do TensorFlow
TF Edge TPUOtimizado para o hardware Edge TPU da GoogleExclusivo para dispositivos Edge TPUEm crescimento com recursos da Google e de terceirosDispositivos IoT que exigem processamento em tempo realMelhorias para o novo hardware Edge TPUSegurança robusta de IoT da GoogleProjetado especificamente para o Google Coral
LiteRTVelocidade e eficiência em dispositivos móveis, incorporados e na WebSuporte para dispositivos móveis, incorporados, de edge e navegadoresComunidade robusta, com apoio da GoogleAplicações no dispositivo em Android, iOS e na WebFuncionalidades mais recentes do runtime no dispositivoInferência segura no dispositivo e no navegadorAceleração por GPU, DSP e WebGPU
PaddlePaddleCompetitivo, fácil de utilizar e escalávelEcossistema da Baidu, com amplo suporte a aplicaçõesEm rápido crescimento, especialmente na ChinaMercado chinês e processamento de linguagemFoco em aplicações de IA chinesasDá ênfase à privacidade e à segurança dos dadosIncluindo os chips Kunlun da Baidu
MNNAlto desempenho para dispositivos móveisSistemas ARM móveis e incorporados e CPU X86-64Comunidade de ML móvel e incorporadoEficiência em sistemas móveisManutenção de alto desempenho em dispositivos móveisVantagens de segurança no dispositivoOtimizações para CPUs e GPUs ARM
NCNNOtimizado para dispositivos móveis baseados em ARMSistemas ARM móveis e incorporadosComunidade de ML móvel e incorporado pequena, mas ativaEficiência em sistemas Android e ARMManutenção de alto desempenho em ARMVantagens de segurança no dispositivoOtimizações para CPUs e GPUs ARM
Sony IMX500Inferência no sensor com consumo de energia muito baixoSensor Sony IMX500, Raspberry Pi AI CameraEcossistema Sony AITRIOSIA de edge na câmaraAtualizações do SDK da Sony e da cadeia de ferramentas MCTOs dados permanecem no sensorAcelerador integrado no chip Sony IMX500
Rockchip RKNNOtimizado para NPUs RockchipPlacas SoC Rockchip (por exemplo, RK3588)Comunidade de programadores RockchipSBC incorporados e dispositivos de edgeAtualizações do Rockchip RKNN-ToolkitInferência local no dispositivoNPU Rockchip
ExecuTorchRuntime PyTorch eficiente no dispositivoiOS, Android e sistemas incorporados através do XNNPACKCom o apoio do projeto PyTorchAplicações móveis e incorporadasMantido em conjunto com o PyTorchA inferência no dispositivo mantém os dados localmenteBackends XNNPACK e de CPU/GPU móveis
Axelera AIThroughput muito elevado (até 856 TOPS)Metis AIPU através de PCIe ou M.2SDK Axelera VoyagerInferência de edge com elevado throughputAtualizações do SDK AxeleraInferência de edge localAxelera Metis AIPU
DEEPXInferência em NPU otimizada para INT8Hardware NPU DEEPXFerramentas de desenvolvimento DEEPX (dx_com, dx_engine)Inferência de edge incorporadaAtualizações do SDK e do runtime DEEPXInferência local no dispositivoNPU DEEPX
Qualcomm QNNInferência rápida no dispositivo com SnapdragonNPU Snapdragon Hexagon, GPU Adreno, CPUEcossistema Qualcomm AI HubDispositivos móveis e de edge com SnapdragonAtualizações da stack de IA da Qualcomm (QAIRT)A inferência no dispositivo mantém os dados localmenteNPU Snapdragon Hexagon
HailoInferência INT8 HEF em NPUs HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler e HailoRTCâmeras, robôs, sistemas de borda industriaisLançamentos do Hailo DFC e HailoRTInferência local no dispositivoNPU Hailo
Huawei AscendMaior taxa de transferência no Ascend AI CorePlacas Atlas e OrangePi AIProEcossistema Huawei CANNInferência de borda em NPUs AscendLançamentos do CANN e ATCInferência local no dispositivoAscend AI Core
Core AIOtimizado para silício AppleiOS 27 e macOS 27; exportação precisa do macOS 26+Framework da Apple; ainda não está nos SDKs iOS/FlutterML no dispositivo em plataformas Apple de próxima geraçãoVinc. ao lançamento de sistemas operacionais da Apple; atualmente em betaA inferência no dispositivo mantém os dados localmenteApple Neural Engine, GPU e CPU

Esta comparação oferece uma visão geral. Para a implementação, compara os requisitos e as restrições específicos do teu projeto com cada opção e consulta o guia de integração associado ao formato que escolheres.

Conclusão#

A vasta gama de formatos de exportação do YOLO26 permite adaptar um modelo a praticamente qualquer ambiente, desde um servidor cloud com GPU até uma câmara de edge com inferência no sensor. Depois de escolheres um formato, segue as melhores práticas de implementação de modelos para otimização, resolução de problemas e segurança, e recorre à comunidade Ultralytics quando encontrares um obstáculo.

Perguntas frequentes#

  • O Ultralytics YOLO26 suporta vários formatos de implementação, cada um concebido para ambientes e plataformas de hardware específicos. Os principais formatos incluem:

    • PyTorch para investigação e prototipagem, com excelente integração com Python.
    • TorchScript para ambientes de produção onde Python não está disponível.
    • ONNX para compatibilidade entre plataformas e aceleração de hardware.
    • OpenVINO para desempenho otimizado em hardware Intel.
    • TensorRT para inferência de alta velocidade em GPUs NVIDIA.

    Cada formato tem vantagens únicas. Para um guia detalhado, consulta a nossa documentação do processo de exportação.

  • Para aumentares a velocidade de inferência em CPUs Intel, podes implementar o teu modelo YOLO26 utilizando o toolkit OpenVINO da Intel. O OpenVINO proporciona melhorias significativas de desempenho ao otimizar os modelos para tirar partido do hardware Intel de forma eficiente.

    1. Converte o teu modelo YOLO26 para o formato OpenVINO utilizando a função model.export().
    2. Segue o guia de configuração detalhado na documentação de exportação do Intel OpenVINO.

    Para obteres mais informações, consulta a nossa publicação no blogue.

  • Sim, os modelos YOLO26 podem ser implementados em dispositivos móveis usando LiteRT (anteriormente TensorFlow Lite) e NCNN para Android, e CoreML ou LiteRT para iOS. O LiteRT é o runtime no dispositivo da Google para dispositivos móveis e incorporados e executa o mesmo modelo no Android, iOS e navegador, proporcionando inferência eficiente no dispositivo.

    Exemplo
    # Export command for NCNN format
    model.export(format="ncnn")

    Para obter mais detalhes sobre a implementação de modelos em dispositivos móveis, consulta o nosso guia de integração do LiteRT.

  • Ao escolher um formato de implementação para YOLO26, considera os seguintes fatores:

    • Desempenho: Alguns formatos, como o TensorRT, proporcionam velocidades excecionais em GPUs NVIDIA, enquanto o OpenVINO é otimizado para hardware Intel.
    • Compatibilidade: O ONNX oferece ampla compatibilidade entre diferentes plataformas.
    • Facilidade de integração: Formatos como o CoreML ou o LiteRT são adaptados a ecossistemas específicos, como iOS e Android, respetivamente.
    • Suporte da comunidade: Formatos como o PyTorch e o TensorFlow dispõem de amplos recursos e suporte da comunidade.

    Para uma análise comparativa, consulta a nossa documentação sobre formatos de exportação.

  • Para implementar modelos YOLO26 numa aplicação web, podes usar o LiteRT.js, o runtime web do LiteRT, que permite executar modelos de aprendizagem automática diretamente no navegador e no Node.js. Esta abordagem elimina a necessidade de infraestrutura de backend e proporciona desempenho em tempo real.

    1. Exporta o modelo YOLO26 para o formato LiteRT.
    2. Integra o modelo exportado na tua aplicação web usando o LiteRT.js.

    Para obter instruções passo a passo, consulta o nosso guia de integração do LiteRT.

Comentários