Ultralytics YOLO27:
Get Started

YOLOX vs YOLOv9#

O cenário da visão computacional foi moldado por avanços arquitetônicos contínuos que equilibram eficiência computacional e alta precisão. Ao avaliar modelos de detecção de objetos em tempo real, a comparação entre YOLOX, da Megvii, e YOLOv9, da Academia Sinica, destaca duas filosofias distintas de desenvolvimento em deep learning. Um modelo foi pioneiro em um paradigma simplificado sem âncoras; o outro introduziu técnicas avançadas de roteamento de gradientes para maximizar a retenção de informações.

Este guia técnico explora as particularidades arquitetônicas, os benchmarks de desempenho e os casos de uso ideais dos modelos, além de demonstrar como soluções modernas, como a Ultralytics Platform e o recém-lançado modelo YOLO26, oferecem alternativas superiores para implantações prontas para produção.

YOLOX: pioneiro no paradigma sem âncoras#

Lançado em meados de 2021, YOLOX foi um grande avanço na aproximação entre a pesquisa acadêmica e a aplicação industrial. Ao eliminar a necessidade de caixas-âncora predefinidas, simplificou drasticamente os ajustes heurísticos necessários para conjuntos de dados personalizados.

Inovações arquiteturais#

YOLOX introduziu várias mudanças importantes no pipeline de detecção padrão. O modelo implementou uma cabeça desacoplada, separando as tarefas de classificação e regressão, o que reduziu significativamente o conflito entre identificar um objeto e localizar seus limites. Além disso, YOLOX adotou o SimOTA, uma estratégia avançada de atribuição de rótulos que alocava dinamicamente amostras positivas durante o treinamento, levando a uma convergência mais rápida e a um melhor desempenho geral em conjuntos de dados de benchmark padrão.

Pontos Fortes e Limitações#

O principal ponto forte do YOLOX está no design simplificado. O mecanismo sem âncoras significa que os desenvolvedores passam menos tempo executando algoritmos de agrupamento para encontrar tamanhos de âncora ideais para seus dados específicos. No entanto, por ser uma arquitetura mais antiga, criada sem os avanços recentes em autoatenção ou caminhos de gradiente, ela tem dificuldade para igualar a eficiência de parâmetros das redes mais novas. Também não oferece suporte nativo a tarefas avançadas, como segmentação de instâncias e estimativa de pose, em uma API unificada.

Saiba mais sobre o YOLOX

YOLOv9: maximizando as informações dos gradientes#

Avançando para 2024, YOLOv9 apresentou uma abordagem altamente teórica para resolver o problema do gargalo de informação inerente às redes neurais convolucionais profundas.

Inovações arquiteturais#

O recurso que define YOLOv9 é a informação programável de gradiente (PGI), que garante que dados semânticos essenciais não se percam ao passar por várias camadas da rede. Em conjunto com a rede de agregação de camadas eficiente generalizada (GELAN), YOLOv9 alcança uma relação excepcional entre parâmetros e precisão. Isso permite que o modelo retenha gradientes precisos para atualizar os pesos, tornando-o altamente eficaz até mesmo em suas variantes leves.

Pontos Fortes e Limitações#

YOLOv9 se destaca por ampliar os limites teóricos da precisão do modelo. O modelo alcança excelentes pontuações de mAP no COCO, sendo uma opção favorita entre pesquisadores. No entanto, apesar de sua eficiência, YOLOv9 ainda depende da supressão não máxima (NMS) tradicional no pós-processamento, o que causa picos de latência durante a inferência. Para engenheiros focados em implantar IA em dispositivos de borda, gerenciar a lógica da NMS adiciona complexidade desnecessária ao pipeline de implantação.

Saiba mais sobre o YOLOv9

Gargalos no pós-processamento

Modelos tradicionais como YOLOX e YOLOv9 exigem supressão não máxima (NMS) para filtrar caixas delimitadoras duplicadas. Essa etapa é inerentemente sequencial e costuma criar um gargalo nas CPUs, o que evidencia a necessidade das arquiteturas nativas ponta a ponta presentes nos modelos mais recentes da Ultralytics.

Comparação de desempenho#

Ao comparar as métricas computacionais brutas dessas arquiteturas, fica claro que YOLOv9 oferece uma referência mais moderna, enquanto YOLOX continua sendo uma opção leve para sistemas legados. A seguir, apresentamos uma análise detalhada dos modelos padrão.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Embora YOLOv9 demonstre maior precisão com quantidades comparáveis de parâmetros, desenvolvedores que buscam o melhor equilíbrio entre velocidade, precisão e facilidade de uso devem considerar os avanços mais recentes da Ultralytics.

A vantagem da Ultralytics: conheça o YOLO26#

Embora avaliar modelos históricos como YOLOX e YOLOv9 ofereça um contexto valioso, o estado da arte atual é definido pelo Ultralytics YOLO26. Lançado no início de 2026, YOLO26 reformula fundamentalmente o pipeline de detecção para ambientes empresariais modernos.

Inovações arquitetônicas incomparáveis#

YOLO26 resolve os gargalos de pós-processamento de seus antecessores com um design opcional ponta a ponta sem NMS (nms=False), garantindo uma implantação mais simples em todos os tipos de hardware. Além disso, ao remover a perda focal de distribuição (DFL) e integrar o inovador otimizador MuSGD — uma combinação de descida do gradiente estocástica e Muon —, YOLO26 alcança estabilidade de treinamento sem precedentes.

Para desenvolvedores que implantam em ambientes com recursos limitados, como o Raspberry Pi, YOLO26 oferece inferência na CPU até 43% mais rápida. O modelo também introduz ProgLoss + STAL (perda progressiva e atribuição de rótulos sensível a alvos pequenos), o que resulta em melhorias expressivas no reconhecimento de objetos pequenos, essencial para imagens aéreas e análises com drones.

Ecossistema de desenvolvimento simplificado#

Ao contrário dos repositórios de pesquisa independentes, o ecossistema da Ultralytics oferece uma experiência de desenvolvimento incomparável. Com a API Python da Ultralytics, engenheiros podem reduzir drasticamente o código repetitivo. Além disso, os requisitos de memória são altamente otimizados, o que permite treinar modelos robustos usando menos VRAM da GPU do que arquiteturas que dependem intensamente de mecanismos de atenção.

from ultralytics import YOLO

# Carrega o modelo pequeno YOLO26 altamente otimizado e sem NMS
model = YOLO("yolo26s.pt")

# Treina com um conjunto de dados personalizado e uso mínimo de memória
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporta facilmente para formatos de implantação otimizados
model.export(format="engine", quantize=16)  # Exporta para TensorRT

Além da detecção, YOLO26 oferece suporte a várias tarefas dentro exatamente do mesmo framework. Seja para obter caixas delimitadoras orientadas (OBB) precisas em imagens de satélite ou máscaras de pixels detalhadas para aplicações de diagnóstico por imagem, o fluxo de trabalho permanece idêntico. Para equipes que utilizam fluxos de trabalho da geração anterior, Ultralytics YOLO11 também está disponível e conta com suporte completo.

Casos de uso ideais e estratégias de implementação#

A escolha da arquitetura certa depende inteiramente do ambiente de implantação desejado e dos requisitos do projeto.

Computação de borda e robótica#

Em dispositivos de baixo consumo, depender de modelos que exigem pós-processamento pesado pode prejudicar o desempenho. Embora YOLOX-Nano seja incrivelmente pequeno, sua precisão costuma ser insuficiente para tarefas críticas de segurança. YOLO26 é a opção definitiva nesse caso: sua cabeça sem DFL e a inferência opcional sem NMS permitem que o modelo seja executado sem problemas em threads de CPU, tornando-o ideal para robótica autônoma ou gestão inteligente de estacionamentos.

Benchmarking acadêmico#

Se o único objetivo for analisar o fluxo de gradientes e estudar gargalos de redes profundas, YOLOv9 continua sendo um excelente objeto de estudo. Seu framework PGI oferece informações fascinantes sobre como os recursos são preservados entre as camadas de redes neurais profundas, tornando-o uma ferramenta valiosa para pesquisadores universitários que exploram a teoria das convoluções.

Análise de vídeo empresarial#

Em tarefas de processamento de vídeo em larga escala, como sistemas de alarme de segurança ou monitoramento de tráfego, velocidade e recursos versáteis de exportação são fundamentais. As ferramentas de exportação nativas do framework da Ultralytics permitem que equipes compilem YOLO26 diretamente para TensorRT ou OpenVINO com um único comando, reduzindo drasticamente o tempo até o lançamento no mercado.

Ao aproveitar os recursos abrangentes do ecossistema da Ultralytics, equipes de machine learning podem evitar as complexidades de bases de código de pesquisa brutas e se concentrar diretamente na criação de aplicações de IA escaláveis e práticas.

Colaboradores

Comentários