Análise comparativa das opções de implantação do YOLO26#
O YOLO26 oferece suporte a mais de 20 opções de implantação, cada uma ajustada a um ambiente de execução, destino de hardware ou plataforma diferente — de PyTorch e ONNX a TensorRT, OpenVINO, CoreML e formatos específicos para NPU de borda. A escolha certa equilibra a velocidade de inferência, as limitações de hardware e a facilidade de integração. Este guia compara todas as opções para ajudar você a escolher a mais adequada à sua aplicação e, em seguida, consultar as práticas recomendadas para implantação de modelos e implantá-la com confiabilidade.
Assista: Como escolher o melhor formato de implantação do Ultralytics YOLO26 para o seu projeto | TensorRT | OpenVINO 🚀
A implantação é a etapa do fluxo de trabalho do projeto de visão computacional em que um modelo treinado começa a realizar trabalho de verdade; por isso, o formato para o qual você exporta tem impacto direto na velocidade, no custo e na portabilidade.
Como escolher a opção de implantação certa para seu modelo YOLO26#
Quando chegar a hora de implantar seu modelo YOLO26, é muito importante selecionar um formato de exportação adequado. Conforme descrito na documentação de exportação do Ultralytics YOLO26, a função model.export() converte seu modelo treinado em vários formatos adaptados a diferentes ambientes e requisitos de desempenho.
O formato ideal depende do contexto operacional previsto para o modelo e do hardware.
Para implantar de forma gerenciada, sem exportação manual, a Ultralytics Platform oferece endpoints de inferência prontos para uso, com escalonamento automático em 42 regiões globais.
Opções de implantação do YOLO26#
Veja uma breve descrição de cada formato e quando usá-lo. Para ver o passo a passo completo da exportação, consulte a documentação de exportação; para comparar os critérios lado a lado, acesse a tabela comparativa.
- PyTorch (
.pt): O formato nativo de treinamento e inferência, que oferece máxima flexibilidade e aceleração por GPU via NVIDIA CUDA ou AMD ROCm — ideal para pesquisa e prototipagem, sem necessidade de exportação. - TorchScript (
torchscript): Serializa o modelo para um ambiente de execução C++ sem Python, adequado a sistemas de produção nos quais Python não está disponível. - ONNX (
onnx): Formato de intercâmbio independente de framework, com amplo suporte a diferentes plataformas e hardwares por meio do ONNX Runtime, incluindo GPUs NVIDIA via CUDA e GPUs AMD via MIGraphX. - OpenVINO (
openvino): Kit de ferramentas da Intel para inferência otimizada em CPUs, GPUs integradas e NPUs Intel, comum em IoT e computação de borda. - TensorRT (
engine): Ambiente de execução de alto desempenho da NVIDIA que oferece inferência de ponta em GPU com otimização FP16 e INT8. - CoreML (
coreml): Formato da Apple para execução no dispositivo em iOS, macOS, watchOS e tvOS, que utiliza o Apple Neural Engine. - Core AI (
coreai): Novo formato.aimodelda Apple para iOS 27 e macOS 27, com execução em CPU, GPU e Apple Neural Engine; a exportação requer macOS 26 ou posterior em Apple silicon, ou Linux x86_64 com glibc 2.34 ou posterior, com Python 3.11 a 3.14. - TF SavedModel (
saved_model): Formato padrão do TensorFlow para disponibilização escalável no servidor com TensorFlow Serving. - TF GraphDef (
pb): Formato TensorFlow de grafo estático congelado para ambientes que precisam de um grafo computacional fixo. - TF Edge TPU (
edgetpu): Compila modelos.tflitepara aceleradores Google Coral Edge TPU. - LiteRT (
litert): Ambiente de execução no dispositivo do Google (anteriormente TensorFlow Lite) para inferência em dispositivos móveis, embarcados e navegadores a partir de um único modelo.tflite, com suporte a FP32 e INT8 e execução no navegador via LiteRT.js. - PaddlePaddle (
paddle): Framework de aprendizado profundo da Baidu, popular na China e com amplo suporte a hardware. - MNN (
mnn): Mecanismo de inferência leve e de alto desempenho, otimizado para sistemas móveis e embarcados ARM e x86-64. - NCNN (
ncnn): Framework de inferência leve e de alto desempenho, otimizado para dispositivos móveis ARM. - Sony IMX500 (
imx): Exporta modelos para o sensor inteligente de visão IMX500 da Sony, com processamento no chip, como a Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): Destinado a NPUs Rockchip em placas embarcadas, com quantização FP16 e INT8. - ExecuTorch (
executorch): Ambiente de execução nativo no dispositivo do PyTorch para dispositivos móveis (iOS e Android) e sistemas embarcados via XNNPACK. - Axelera AI (
axelera): Compila para a AIPU Metis da Axelera (até 856 TOPS) via PCIe ou M.2, para inferência de borda de alto desempenho. - DEEPX (
deepx): Destinado a hardware NPU DEEPX com quantização INT8 para inferência embarcada na borda. - Qualcomm QNN (
qnn): Inferência no dispositivo em NPU Snapdragon Hexagon, GPU Adreno e CPU por meio da pilha de IA da Qualcomm.
A integração com Hailo exporta diretamente para Hailo HEF modelos YOLO de detecção, segmentação, segmentação semântica, estimativa de profundidade, classificação, pose e OBB; consulte a tabela de compatibilidade para ver os modelos e destinos validados. A integração com Ambarella segue um fluxo de trabalho baseado primeiro em ONNX e compila exportações ONNX para o formato AmbaPB com a toolchain CVflow da Ambarella, destinada a SoCs CVflow® como o CV72, podendo usar o treinamento com reconhecimento de compressão SpongeTorch. A integração com Huawei Ascend compila exportações ONNX para o formato offline .om com o compilador CANN ATC, para inferência FP16 em processadores de IA Ascend. A integração com AMD Xilinx quantiza exportações ONNX com AMD Quark para NPUs Versal AI Edge Series Gen 2, que o Vitis AI Execution Provider compila em um modelo .rai.
Comparação das opções de implantação#
A tabela a seguir resume as opções de implantação para modelos YOLO26 de acordo com os critérios que normalmente orientam a escolha. Para uma análise aprofundada de cada formato, consulte a documentação dos formatos de exportação.
| Opção de implantação | Testes de desempenho | Compatibilidade e integração | Suporte da comunidade e ecossistema | Estudos de caso | Manutenção e atualizações | Considerações de segurança | Aceleração de hardware |
|---|---|---|---|---|---|---|---|
| PyTorch | Boa flexibilidade; pode haver concessões no desempenho bruto | Excelente com bibliotecas Python | Recursos abrangentes e comunidade ativa | Pesquisa e protótipos | Desenvolvimento regular e ativo | Depende do ambiente de implantação | Suporte a CUDA para aceleração por GPU |
| TorchScript | Mais adequado à produção do que PyTorch | Transição simples de PyTorch para C++ | Especializado, mas mais limitado que PyTorch | Setores em que Python é um gargalo | Atualizações consistentes com PyTorch | Segurança aprimorada sem Python completo | Herda o suporte a CUDA do PyTorch |
| ONNX | Variável conforme o ambiente de execução | Ampla em diferentes frameworks | Ecossistema abrangente, com suporte de muitas organizações | Flexibilidade entre frameworks de ML | Atualizações regulares para novas operações | Garanta práticas seguras de conversão e implantação | Diversas otimizações de hardware |
| OpenVINO | Otimizado para hardware Intel | Melhor dentro do ecossistema Intel | Consolidado no campo da visão computacional | IoT e edge com hardware Intel | Atualizações regulares para hardware Intel | Recursos robustos para aplicações sensíveis | Adaptado para hardware Intel |
| TensorRT | Desempenho de ponta em GPUs NVIDIA | Ideal para hardware NVIDIA | Ampla rede de contatos por meio da NVIDIA | Inferência de vídeo e imagens em tempo real | Atualizações frequentes para novas GPUs | Ênfase na segurança | Projetado para GPUs NVIDIA |
| CoreML | Otimizado para hardware Apple no próprio dispositivo | Exclusivo do ecossistema Apple | Forte suporte da Apple e de desenvolvedores | ML no próprio dispositivo em produtos Apple | Atualizações regulares da Apple | Foco em privacidade e segurança | Neural Engine e GPU da Apple |
| Core AI | Otimizado para Apple silicon | iOS 27 e macOS 27; exportação no macOS 26+ com Apple silicon ou no Linux x86_64 (glibc 2.34+), Python 3.11-3.14 | Framework da Apple; ativação opcional nos SDKs do iOS/Flutter | ML no próprio dispositivo nas plataformas Apple de próxima geração | Vinculado aos lançamentos de sistemas operacionais da Apple; atualmente em versão beta | A inferência no próprio dispositivo mantém os dados localmente | Neural Engine, GPU e CPU da Apple |
| TF SavedModel | Escalável em ambientes de servidor | Ampla compatibilidade com o ecossistema TensorFlow | Amplo suporte devido à popularidade do TensorFlow | Servir modelos em grande escala | Atualizações regulares do Google e da comunidade | Recursos robustos para empresas | Várias opções de aceleração por hardware |
| TF GraphDef | Estável para grafos de computação estáticos | Integra-se bem à infraestrutura do TensorFlow | Recursos para otimizar grafos estáticos | Cenários que exigem grafos estáticos | Atualizações em conjunto com o núcleo do TensorFlow | Práticas de segurança consolidadas do TensorFlow | Opções de aceleração do TensorFlow |
| TF Edge TPU | Otimizado para o hardware Edge TPU do Google | Exclusivo para dispositivos Edge TPU | Cresce com recursos do Google e de terceiros | Dispositivos IoT que exigem processamento em tempo real | Melhorias para o novo hardware Edge TPU | Segurança robusta de IoT do Google | Projetado sob medida para o Google Coral |
| LiteRT | Velocidade e eficiência em dispositivos móveis, sistemas embarcados e na web | Compatibilidade com dispositivos móveis, sistemas embarcados, edge e navegadores | Comunidade robusta, com apoio do Google | Aplicativos no próprio dispositivo para Android, iOS e web | Recursos mais recentes do runtime no próprio dispositivo | Inferência segura no próprio dispositivo e no navegador | Aceleração por GPU, DSP e WebGPU |
| PaddlePaddle | Competitivo, fácil de usar e escalável | Ecossistema Baidu, amplo suporte a aplicações | Em rápido crescimento, especialmente na China | Mercado chinês e processamento de idiomas | Foco em aplicações de IA chinesas | Dá ênfase à privacidade e à segurança dos dados | Inclui os chips Kunlun da Baidu |
| MNN | Alto desempenho para dispositivos móveis | Sistemas ARM móveis e embarcados e CPU X86-64 | Comunidade de ML móvel e embarcada | Eficiência em sistemas móveis | Manutenção de alto desempenho em dispositivos móveis | Vantagens de segurança no próprio dispositivo | Otimizações para CPUs e GPUs ARM |
| NCNN | Otimizado para dispositivos móveis baseados em ARM | Sistemas ARM móveis e embarcados | Comunidade de ML móvel e embarcada de nicho, mas ativa | Eficiência em sistemas Android e ARM | Manutenção de alto desempenho em ARM | Vantagens de segurança no próprio dispositivo | Otimizações para CPUs e GPUs ARM |
| Sony IMX500 | Inferência no sensor com consumo de energia muito baixo | Sensor Sony IMX500, câmera Raspberry Pi AI | Ecossistema Sony AITRIOS | IA de edge na câmera | Atualizações do SDK da Sony e da cadeia de ferramentas MCT | Os dados permanecem no sensor | Acelerador integrado ao chip Sony IMX500 |
| Rockchip RKNN | Otimizado para NPUs Rockchip | Placas SoC Rockchip (por exemplo, RK3588) | Comunidade de desenvolvedores Rockchip | Dispositivos SBC embarcados e de edge | Atualizações do Rockchip RKNN-Toolkit | Inferência local no próprio dispositivo | NPU Rockchip |
| ExecuTorch | Runtime PyTorch eficiente no próprio dispositivo | iOS, Android e sistemas embarcados via XNNPACK | Com o apoio do projeto PyTorch | Aplicativos móveis e embarcados | Mantido em conjunto com o PyTorch | A inferência no próprio dispositivo mantém os dados localmente | XNNPACK e backends de CPU/GPU para dispositivos móveis |
| Axelera AI | Vazão muito alta (até 856 TOPS) | Metis AIPU via PCIe ou M.2 | Axelera Voyager SDK | Inferência de edge com alta vazão | Atualizações do SDK da Axelera | Inferência de borda local | AIPU Metis da Axelera |
| DEEPX | Inferência de NPU otimizada para INT8 | Hardware de NPU da DEEPX | Ferramentas para desenvolvedores da DEEPX (dx_com, dx_engine) | Inferência de borda embarcada | Atualizações do SDK e do ambiente de execução da DEEPX | Inferência local no próprio dispositivo | NPU da DEEPX |
| Qualcomm QNN | Inferência rápida no dispositivo Snapdragon | NPU Hexagon, GPU Adreno e CPU do Snapdragon | Ecossistema Qualcomm AI Hub | Dispositivos Snapdragon móveis e de borda | Atualizações da pilha de IA da Qualcomm (QAIRT) | A inferência no próprio dispositivo mantém os dados localmente | NPU Hexagon do Snapdragon |
| Hailo | Inferência de HEF INT8 em NPUs Hailo | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler e HailoRT | Câmeras, robôs e sistemas industriais de borda | Lançamentos do Hailo DFC e do HailoRT | Inferência local no próprio dispositivo | NPU Hailo |
| Huawei Ascend | Maior taxa de transferência no Ascend AI Core | Placas Atlas e OrangePi AIPro | Ecossistema CANN da Huawei | Inferência de borda em NPUs Ascend | Lançamentos do CANN e do ATC | Inferência local no próprio dispositivo | Ascend AI Core |
| AMD Xilinx | Inferência INT8 em NPUs Versal AI Edge Gen 2 | Versal AI Edge Series Gen 2 (VEK385) | AMD Vitis AI e Quark | Visão computacional integrada em SoCs adaptativos | Versões do Vitis AI e Quark | Inferência local no próprio dispositivo | NPU do AMD Versal AI Engine |
Esta comparação oferece uma visão geral. Para a implantação, avalie os requisitos e as limitações específicos do seu projeto em relação a cada opção e consulte o guia de integração vinculado ao formato escolhido.
Conclusão#
A ampla variedade de formatos de exportação do YOLO26 permite adaptar um modelo a praticamente qualquer ambiente, desde um servidor de GPU na nuvem até uma câmera de borda com sensor integrado. Depois de escolher um formato, siga as práticas recomendadas para implantação de modelos para otimização, solução de problemas e segurança, e conte com a comunidade Ultralytics quando encontrar algum obstáculo.
Perguntas frequentes#
O Ultralytics YOLO26 oferece suporte a vários formatos de implantação, cada um projetado para ambientes e plataformas de hardware específicos. Os principais formatos incluem:
- PyTorch para pesquisa e prototipagem, com excelente integração com Python.
- TorchScript para ambientes de produção nos quais Python não está disponível.
- ONNX para compatibilidade entre plataformas e aceleração de hardware.
- OpenVINO para desempenho otimizado em hardware Intel.
- TensorRT para inferência de alta velocidade em GPUs NVIDIA.
Cada formato tem vantagens próprias. Para ver um passo a passo detalhado, consulte a documentação do processo de exportação.
Para aumentar a velocidade de inferência em CPUs Intel, você pode implantar seu modelo YOLO26 usando o kit de ferramentas OpenVINO da Intel. O OpenVINO oferece ganhos significativos de desempenho ao otimizar os modelos para aproveitar o hardware Intel com eficiência.
- Converta seu modelo YOLO26 para o formato OpenVINO usando a função
model.export(). - Siga o guia detalhado de configuração na documentação de exportação do Intel OpenVINO.
Para saber mais, confira nossa publicação no blog.
- Converta seu modelo YOLO26 para o formato OpenVINO usando a função
Sim, os modelos YOLO26 podem ser implantados em dispositivos móveis usando LiteRT (anteriormente TensorFlow Lite) e NCNN para Android, e CoreML ou LiteRT para iOS. O LiteRT é o ambiente de execução no dispositivo do Google para dispositivos móveis e embarcados e executa o mesmo modelo no Android, iOS e navegador, oferecendo inferência eficiente no dispositivo.
Exemplofrom ultralytics import YOLO model = YOLO("yolo26n.pt") # Comentário para o comando de exportação no formato NCNN model.export(format="ncnn")Para obter mais detalhes sobre a implantação de modelos em dispositivos móveis, consulte nosso guia de integração do LiteRT.
Ao escolher um formato de implantação para o YOLO26, considere os seguintes fatores:
- Desempenho: Alguns formatos, como o TensorRT, oferecem velocidades excepcionais em GPUs NVIDIA, enquanto o OpenVINO é otimizado para hardware Intel.
- Compatibilidade: O ONNX oferece ampla compatibilidade entre diferentes plataformas.
- Facilidade de integração: Formatos como CoreML ou LiteRT são adaptados a ecossistemas específicos, como iOS e Android, respectivamente.
- Suporte da comunidade: Formatos como PyTorch e TensorFlow contam com amplos recursos e suporte da comunidade.
Para uma análise comparativa, consulte nossa documentação sobre formatos de exportação.
Para implantar modelos YOLO26 em uma aplicação web, você pode usar o LiteRT.js, o ambiente de execução web do LiteRT, que permite executar modelos de aprendizado de máquina diretamente no navegador e no Node.js. Essa abordagem elimina a necessidade de infraestrutura de back-end e oferece desempenho em tempo real.
- Exporte o modelo YOLO26 para o formato LiteRT.
- Integre o modelo exportado à sua aplicação web usando o LiteRT.js.
Para ver instruções passo a passo, consulte nosso guia de integração do LiteRT.