Análise comparativa das opções de implementação do YOLO26#
O YOLO26 é compatível com mais de 20 opções de implementação, cada uma otimizada para um runtime, destino de hardware ou plataforma diferente — desde PyTorch e ONNX até TensorRT, OpenVINO, CoreML e formatos dedicados para NPU de edge. Escolher a opção certa exige equilibrar a velocidade de inferência, as limitações do hardware e a facilidade de integração. Este guia compara todas as opções para que possas escolher a mais adequada à tua aplicação e, em seguida, consultar as melhores práticas de implementação de modelos para fazer uma implementação fiável.
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
A implementação é a etapa do fluxo de trabalho de um projeto de visão computacional em que um modelo treinado começa a realizar trabalho real, pelo que o formato para o qual exportas tem um impacto direto na velocidade, no custo e na portabilidade.
Como selecionar a opção de implementação certa para o teu modelo YOLO26#
Quando chegar o momento de implementar o teu modelo YOLO26, é muito importante selecionar um formato de exportação adequado. Conforme descrito na documentação de exportação do Ultralytics YOLO26, a função model.export() converte o teu modelo treinado numa variedade de formatos adaptados a diferentes ambientes e requisitos de desempenho.
O formato ideal depende do contexto operacional pretendido para o teu modelo e do hardware.
Para uma implementação gerida sem exportação manual, a Ultralytics Platform disponibiliza endpoints de inferência prontos a utilizar, com escalabilidade automática em 42 regiões globais.
Opções de implementação do YOLO26#
Segue-se uma breve descrição de cada formato e das situações em que deves utilizá-lo. Para consultar o guia completo de exportação, vê a documentação de exportação; para conhecer os critérios lado a lado, consulta a tabela de comparação.
- PyTorch (
.pt): o formato nativo de treino e inferência, que oferece a máxima flexibilidade e aceleração de GPU através de NVIDIA CUDA ou AMD ROCm — ideal para investigação e prototipagem, sem necessidade de uma etapa de exportação. - TorchScript (
torchscript): serializa o modelo para um runtime C++ sem Python, adequado para sistemas de produção onde Python não está disponível. - ONNX (
onnx): um formato de intercâmbio independente de framework, com amplo suporte multiplataforma e de hardware através do ONNX Runtime. - OpenVINO (
openvino): o toolkit da Intel para inferência otimizada em CPUs Intel, GPUs integradas e NPUs, comum em IoT e computação de edge. - TensorRT (
engine): o runtime de alto desempenho da NVIDIA, que oferece inferência de GPU de topo com otimização FP16 e INT8. - CoreML (
coreml): o formato da Apple para execução no dispositivo em iOS, macOS, watchOS e tvOS, utilizando o Apple Neural Engine. - TF SavedModel (
saved_model): o formato padrão do TensorFlow para disponibilização escalável no lado do servidor com o TensorFlow Serving. - TF GraphDef (
pb): um formato TensorFlow de grafo estático congelado para ambientes que necessitam de um grafo de computação fixo. - TF Edge TPU (
edgetpu): compila modelos.tflitepara aceleradores Google Coral Edge TPU. - LiteRT (
litert): o runtime da Google para execução no dispositivo (anteriormente TensorFlow Lite), destinado à inferência em dispositivos móveis, sistemas incorporados e navegadores a partir de um único modelo.tflite, com suporte para FP32 e INT8 e execução no navegador através do LiteRT.js. - PaddlePaddle (
paddle): o framework de deep learning da Baidu, popular na China, com amplo suporte de hardware. - MNN (
mnn): um motor de inferência leve e de alto desempenho, otimizado para sistemas ARM e x86-64 móveis e incorporados. - NCNN (
ncnn): um framework de inferência leve e de alto desempenho, otimizado para dispositivos ARM móveis. - Sony IMX500 (
imx): exportações para o sensor de visão inteligente IMX500 da Sony, com processamento no chip, como a Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): destina-se a NPUs Rockchip em placas incorporadas, com quantização FP16 e INT8. - ExecuTorch (
executorch): o runtime nativo no dispositivo do PyTorch para sistemas móveis (iOS e Android) e incorporados através do XNNPACK. - Axelera AI (
axelera): compila para a AIPU Metis da Axelera (até 856 TOPS) através de PCIe ou M.2, para inferência de edge de alto débito. - DEEPX (
deepx): destina-se a hardware NPU DEEPX, com quantização INT8 para inferência de edge incorporada. - Qualcomm QNN (
qnn): inferência no dispositivo em NPU Hexagon Snapdragon, GPU Adreno e CPU através da stack de IA da Qualcomm. - Core AI (
coreai): o novo formato.aimodelda Apple para o iOS 27 e macOS 27, programado para CPU, GPU e Apple Neural Engine; a exportação precisa do macOS 26 ou posterior em silício Apple.
A integração Hailo exporta modelos YOLO de deteção, segmentação, segmentação semântica, estimativa de profundidade, classificação, pose e OBB diretamente para Hailo HEF; consulta a sua tabela de compatibilidade para ver os modelos e destinos validados. A integração Ambarella segue um fluxo de trabalho baseado primeiro em ONNX e compila exportações ONNX para o formato AmbaPB com o toolchain CVflow da Ambarella para SoCs CVflow®, como o CV72, utilizando opcionalmente treino com consciência de compressão SpongeTorch. A integração Huawei Ascend compila exportações ONNX para o formato offline .om com o compilador CANN ATC, para inferência FP16 em Ascend AI Processors.
Comparação das opções de implementação#
A tabela seguinte resume as opções de implementação para modelos YOLO26 segundo os critérios que normalmente orientam a escolha. Para uma análise detalhada de cada formato, consulta a documentação dos formatos de exportação.
| Opção de implementação | Benchmarks de desempenho | Compatibilidade e integração | Suporte da comunidade e ecossistema | Estudos de caso | Manutenção e atualizações | Considerações de segurança | Aceleração de hardware |
|---|---|---|---|---|---|---|---|
| PyTorch | Boa flexibilidade; pode implicar um compromisso no desempenho bruto | Excelente com bibliotecas Python | Recursos e comunidade abrangentes | Investigação e protótipos | Desenvolvimento regular e ativo | Depende do ambiente de implementação | Suporte CUDA para aceleração de GPU |
| TorchScript | Melhor para produção do que PyTorch | Transição simples de PyTorch para C++ | Especializado, mas mais limitado do que PyTorch | Setores em que Python é um obstáculo | Atualizações consistentes com PyTorch | Segurança melhorada sem Python completo | Herda o suporte CUDA do PyTorch |
| ONNX | Variável consoante o runtime | Elevada entre diferentes frameworks | Ecossistema abrangente, com suporte de muitas organizações | Flexibilidade entre frameworks de ML | Atualizações regulares para novas operações | Garante práticas seguras de conversão e implementação | Várias otimizações de hardware |
| OpenVINO | Otimizado para hardware Intel | Melhor no ecossistema Intel | Sólido no domínio da visão computacional | IoT e edge com hardware Intel | Atualizações regulares para hardware Intel | Funcionalidades robustas para aplicações sensíveis | Adaptado para hardware Intel |
| TensorRT | De topo em GPUs NVIDIA | Melhor para hardware NVIDIA | Rede forte através da NVIDIA | Inferência de vídeo e imagem em tempo real | Atualizações frequentes para novas GPUs | Ênfase na segurança | Concebido para GPUs NVIDIA |
| CoreML | Otimizado para hardware Apple no dispositivo | Exclusivo do ecossistema Apple | Forte suporte da Apple e dos programadores | ML no dispositivo em produtos Apple | Atualizações regulares da Apple | Foco na privacidade e na segurança | Apple Neural Engine e GPU |
| TF SavedModel | Escalável em ambientes de servidor | Ampla compatibilidade no ecossistema TensorFlow | Amplo suporte devido à popularidade do TensorFlow | Disponibilização de modelos em escala | Atualizações regulares da Google e da comunidade | Funcionalidades robustas para empresas | Várias acelerações de hardware |
| TF GraphDef | Estável para grafos de computação estáticos | Integra-se bem com a infraestrutura do TensorFlow | Recursos para otimizar grafos estáticos | Cenários que exigem grafos estáticos | Atualizações em conjunto com o núcleo do TensorFlow | Práticas de segurança do TensorFlow consolidadas | Opções de aceleração do TensorFlow |
| TF Edge TPU | Otimizado para o hardware Edge TPU da Google | Exclusivo para dispositivos Edge TPU | Em crescimento com recursos da Google e de terceiros | Dispositivos IoT que exigem processamento em tempo real | Melhorias para o novo hardware Edge TPU | Segurança robusta de IoT da Google | Projetado especificamente para o Google Coral |
| LiteRT | Velocidade e eficiência em dispositivos móveis, incorporados e na Web | Suporte para dispositivos móveis, incorporados, de edge e navegadores | Comunidade robusta, com apoio da Google | Aplicações no dispositivo em Android, iOS e na Web | Funcionalidades mais recentes do runtime no dispositivo | Inferência segura no dispositivo e no navegador | Aceleração por GPU, DSP e WebGPU |
| PaddlePaddle | Competitivo, fácil de utilizar e escalável | Ecossistema da Baidu, com amplo suporte a aplicações | Em rápido crescimento, especialmente na China | Mercado chinês e processamento de linguagem | Foco em aplicações de IA chinesas | Dá ênfase à privacidade e à segurança dos dados | Incluindo os chips Kunlun da Baidu |
| MNN | Alto desempenho para dispositivos móveis | Sistemas ARM móveis e incorporados e CPU X86-64 | Comunidade de ML móvel e incorporado | Eficiência em sistemas móveis | Manutenção de alto desempenho em dispositivos móveis | Vantagens de segurança no dispositivo | Otimizações para CPUs e GPUs ARM |
| NCNN | Otimizado para dispositivos móveis baseados em ARM | Sistemas ARM móveis e incorporados | Comunidade de ML móvel e incorporado pequena, mas ativa | Eficiência em sistemas Android e ARM | Manutenção de alto desempenho em ARM | Vantagens de segurança no dispositivo | Otimizações para CPUs e GPUs ARM |
| Sony IMX500 | Inferência no sensor com consumo de energia muito baixo | Sensor Sony IMX500, Raspberry Pi AI Camera | Ecossistema Sony AITRIOS | IA de edge na câmara | Atualizações do SDK da Sony e da cadeia de ferramentas MCT | Os dados permanecem no sensor | Acelerador integrado no chip Sony IMX500 |
| Rockchip RKNN | Otimizado para NPUs Rockchip | Placas SoC Rockchip (por exemplo, RK3588) | Comunidade de programadores Rockchip | SBC incorporados e dispositivos de edge | Atualizações do Rockchip RKNN-Toolkit | Inferência local no dispositivo | NPU Rockchip |
| ExecuTorch | Runtime PyTorch eficiente no dispositivo | iOS, Android e sistemas incorporados através do XNNPACK | Com o apoio do projeto PyTorch | Aplicações móveis e incorporadas | Mantido em conjunto com o PyTorch | A inferência no dispositivo mantém os dados localmente | Backends XNNPACK e de CPU/GPU móveis |
| Axelera AI | Throughput muito elevado (até 856 TOPS) | Metis AIPU através de PCIe ou M.2 | SDK Axelera Voyager | Inferência de edge com elevado throughput | Atualizações do SDK Axelera | Inferência de edge local | Axelera Metis AIPU |
| DEEPX | Inferência em NPU otimizada para INT8 | Hardware NPU DEEPX | Ferramentas de desenvolvimento DEEPX (dx_com, dx_engine) | Inferência de edge incorporada | Atualizações do SDK e do runtime DEEPX | Inferência local no dispositivo | NPU DEEPX |
| Qualcomm QNN | Inferência rápida no dispositivo com Snapdragon | NPU Snapdragon Hexagon, GPU Adreno, CPU | Ecossistema Qualcomm AI Hub | Dispositivos móveis e de edge com Snapdragon | Atualizações da stack de IA da Qualcomm (QAIRT) | A inferência no dispositivo mantém os dados localmente | NPU Snapdragon Hexagon |
| Hailo | Inferência INT8 HEF em NPUs Hailo | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler e HailoRT | Câmeras, robôs, sistemas de borda industriais | Lançamentos do Hailo DFC e HailoRT | Inferência local no dispositivo | NPU Hailo |
| Huawei Ascend | Maior taxa de transferência no Ascend AI Core | Placas Atlas e OrangePi AIPro | Ecossistema Huawei CANN | Inferência de borda em NPUs Ascend | Lançamentos do CANN e ATC | Inferência local no dispositivo | Ascend AI Core |
| Core AI | Otimizado para silício Apple | iOS 27 e macOS 27; exportação precisa do macOS 26+ | Framework da Apple; ainda não está nos SDKs iOS/Flutter | ML no dispositivo em plataformas Apple de próxima geração | Vinc. ao lançamento de sistemas operacionais da Apple; atualmente em beta | A inferência no dispositivo mantém os dados localmente | Apple Neural Engine, GPU e CPU |
Esta comparação oferece uma visão geral. Para a implementação, compara os requisitos e as restrições específicos do teu projeto com cada opção e consulta o guia de integração associado ao formato que escolheres.
Conclusão#
A vasta gama de formatos de exportação do YOLO26 permite adaptar um modelo a praticamente qualquer ambiente, desde um servidor cloud com GPU até uma câmara de edge com inferência no sensor. Depois de escolheres um formato, segue as melhores práticas de implementação de modelos para otimização, resolução de problemas e segurança, e recorre à comunidade Ultralytics quando encontrares um obstáculo.
Perguntas frequentes#
O Ultralytics YOLO26 suporta vários formatos de implementação, cada um concebido para ambientes e plataformas de hardware específicos. Os principais formatos incluem:
- PyTorch para investigação e prototipagem, com excelente integração com Python.
- TorchScript para ambientes de produção onde Python não está disponível.
- ONNX para compatibilidade entre plataformas e aceleração de hardware.
- OpenVINO para desempenho otimizado em hardware Intel.
- TensorRT para inferência de alta velocidade em GPUs NVIDIA.
Cada formato tem vantagens únicas. Para um guia detalhado, consulta a nossa documentação do processo de exportação.
Para aumentares a velocidade de inferência em CPUs Intel, podes implementar o teu modelo YOLO26 utilizando o toolkit OpenVINO da Intel. O OpenVINO proporciona melhorias significativas de desempenho ao otimizar os modelos para tirar partido do hardware Intel de forma eficiente.
- Converte o teu modelo YOLO26 para o formato OpenVINO utilizando a função
model.export(). - Segue o guia de configuração detalhado na documentação de exportação do Intel OpenVINO.
Para obteres mais informações, consulta a nossa publicação no blogue.
- Converte o teu modelo YOLO26 para o formato OpenVINO utilizando a função
Sim, os modelos YOLO26 podem ser implementados em dispositivos móveis usando LiteRT (anteriormente TensorFlow Lite) e NCNN para Android, e CoreML ou LiteRT para iOS. O LiteRT é o runtime no dispositivo da Google para dispositivos móveis e incorporados e executa o mesmo modelo no Android, iOS e navegador, proporcionando inferência eficiente no dispositivo.
Exemplo# Export command for NCNN format model.export(format="ncnn")Para obter mais detalhes sobre a implementação de modelos em dispositivos móveis, consulta o nosso guia de integração do LiteRT.
Ao escolher um formato de implementação para YOLO26, considera os seguintes fatores:
- Desempenho: Alguns formatos, como o TensorRT, proporcionam velocidades excecionais em GPUs NVIDIA, enquanto o OpenVINO é otimizado para hardware Intel.
- Compatibilidade: O ONNX oferece ampla compatibilidade entre diferentes plataformas.
- Facilidade de integração: Formatos como o CoreML ou o LiteRT são adaptados a ecossistemas específicos, como iOS e Android, respetivamente.
- Suporte da comunidade: Formatos como o PyTorch e o TensorFlow dispõem de amplos recursos e suporte da comunidade.
Para uma análise comparativa, consulta a nossa documentação sobre formatos de exportação.
Para implementar modelos YOLO26 numa aplicação web, podes usar o LiteRT.js, o runtime web do LiteRT, que permite executar modelos de aprendizagem automática diretamente no navegador e no Node.js. Esta abordagem elimina a necessidade de infraestrutura de backend e proporciona desempenho em tempo real.
- Exporta o modelo YOLO26 para o formato LiteRT.
- Integra o modelo exportado na tua aplicação web usando o LiteRT.js.
Para obter instruções passo a passo, consulta o nosso guia de integração do LiteRT.