Ultralytics YOLO27:
Get Started

YOLOv9 vs YOLOX#

O campo da visão computacional passou por uma rápida evolução nas arquiteturas de detecção de objetos em tempo real. Este guia apresenta uma comparação abrangente entre YOLOv9 e YOLOX, analisando suas inovações arquiteturais, métricas de desempenho e metodologias de treinamento. Seja para criar aplicações inteligentes de IA na manufatura ou explorar a modelagem preditiva, entender esses modelos ajudará você a tomar decisões informadas para sua próxima implantação.

Inovações arquiteturais#

YOLOv9: informações de gradiente programáveis#

YOLOv9 introduziu uma mudança de paradigma ao abordar o problema do gargalo de informação inerente às redes neurais profundas. Suas principais inovações incluem Programmable Gradient Information (PGI) e Generalized Efficient Layer Aggregation Network (GELAN).

  • Autores: Chien-Yao Wang e Hong-Yuan Mark Liao
  • Organização: Instituto de Ciências da Informação, Academia Sinica, Taiwan
  • Data: 21 de fevereiro de 2024
  • Arxiv: 2402.13616
  • GitHub: WongKinYiu/yolov9

Ao preservar dados de características essenciais durante o processo feed-forward, YOLOv9 garante que os gradientes usados para atualizar os pesos durante a retropropagação permaneçam precisos. Essa arquitetura se destaca na extração de características, tornando-a altamente capaz de detectar objetos pequenos em ambientes complexos, como os encontrados em imagens aéreas e exames médicos detalhados.

Saiba mais sobre o YOLOv9

YOLOX: aproximando a pesquisa e a indústria#

Lançado em meados de 2021, YOLOX direcionou a série YOLO para um design sem âncoras. O modelo introduziu uma cabeça desacoplada, que separa as tarefas de classificação e localização, e utilizou a estratégia de atribuição de rótulos SimOTA para melhorar a convergência do treinamento.

Embora YOLOX tenha sido inovador para sua época, alcançando excelente precisão média média (mAP) e eliminando o ajuste de hiperparâmetros de caixas-âncora, sua arquitetura subjacente foi superada por redes modernas que equilibram melhor a quantidade de parâmetros e a preservação de características.

Saiba mais sobre o YOLOX

Evolução sem âncoras

Tanto YOLOX quanto os modelos Ultralytics mais recentes adotam designs sem âncoras, reduzindo a complexidade do ajuste de hiperparâmetros e melhorando a generalização em diversos conjuntos de dados.

Análise de desempenho#

Ao comparar esses modelos no benchmark MS COCO, os avanços do YOLOv9 ficam evidentes. YOLOv9 alcança consistentemente um equilíbrio melhor entre precisão e FLOPs.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Embora YOLOX ofereça variantes leves, como YOLOX-Nano, para casos extremos em dispositivos de borda, as variantes do YOLOv9 superam consistentemente modelos YOLOX de tamanho semelhante em termos de precisão. Por exemplo, YOLOv9m alcança 51,4% de mAP, em comparação com os 49,7% do YOLOXl, apesar de ter menos da metade dos parâmetros (20,1M contra 54,2M).

A vantagem da Ultralytics#

A escolha de um modelo envolve mais do que apenas teoria arquitetural; o ecossistema ao redor determina a velocidade de desenvolvimento e o sucesso da implantação. Usar YOLOv9 no ecossistema Ultralytics oferece facilidade de uso incomparável e suporte robusto da comunidade.

Ao contrário dos repositórios de pesquisa originais mais antigos, o framework Ultralytics oferece uma API Python unificada que simplifica pipelines complexos. O treinamento exige muito menos memória de GPU do que muitas alternativas, oferecendo uma eficiência de treinamento extraordinária.

from ultralytics import YOLO

# Inicializa o modelo YOLOv9c
model = YOLO("yolov9c.pt")

# Treina o modelo no seu conjunto de dados personalizado sem complicações
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Valida o desempenho do modelo
metrics = model.val()

# Exporta o modelo otimizado para o formato TensorRT
model.export(format="engine")

Com suporte integrado a várias tarefas, incluindo detecção de objetos, segmentação de instâncias e estimativa de pose, você pode adaptar rapidamente suas soluções de visão computacional sem alterar toda a sua base de código.

Exportação simplificada

Vai implantar em dispositivos de borda? A Ultralytics facilita a exportação dos modelos treinados para formatos altamente otimizados, como ONNX, TensorRT e OpenVINO, com um único comando.

Aplicações no mundo real#

Os pontos fortes específicos desses modelos os tornam adequados para diferentes aplicações do mundo real:

Análise de varejo em alta velocidade#

Para ambientes de varejo modernos que exigem reconhecimento de produtos em tempo real, YOLOv9 se destaca. Sua capacidade de preservar detalhes intrincados das características o torna perfeitamente adequado para implantações de IA no varejo, nas quais é necessário distinguir produtos visualmente semelhantes em uma prateleira cheia.

Implantações de borda em sistemas legados#

Em cenários com limitações rigorosas de hardware ou NPUs especializadas que têm dificuldade com blocos de agregação mais recentes, YOLOX-Nano pode ocasionalmente encontrar seu nicho. Seus padrões de convolução simples e reduzidos às vezes são preferidos em microcontroladores com recursos extremamente limitados.

Robótica autônoma#

Na navegação robótica, deixar de detectar objetos pequenos pode ser catastrófico. A arquitetura GELAN do YOLOv9 garante que as características de obstáculos pequenos e distantes não se percam nas camadas profundas da rede, superando modelos mais antigos em ambientes críticos para a segurança, como aplicações de IA automotiva.

Casos de uso e recomendações#

A escolha entre YOLOv9 e YOLOX depende dos requisitos específicos do seu projeto, das restrições de implantação e das preferências de ecossistema.

Quando escolher o YOLOv9#

YOLOv9 é uma ótima opção para:

  • Pesquisa sobre gargalos de informação: Projetos acadêmicos que estudam arquiteturas de Informação de Gradiente Programável (PGI) e Rede de Agregação de Camadas Eficiente Generalizada (GELAN).
  • Estudos de otimização do fluxo de gradientes: Pesquisas voltadas a entender e reduzir a perda de informação nas camadas profundas da rede durante o treinamento.
  • Benchmarking de detecção de alta precisão: Cenários em que o forte desempenho do YOLOv9 no benchmark COCO é necessário como referência para comparações arquitetônicas.

Quando escolher o YOLOX#

O YOLOX é recomendado para:

  • Investigação em deteção sem âncoras: Investigação académica que utiliza a arquitetura simples e sem âncoras do YOLOX como referência para experimentar novas cabeças de deteção ou funções de perda.
  • Dispositivos de borda ultraleves: Implementações em microcontroladores ou hardware móvel legado, onde o tamanho extremamente reduzido da variante YOLOX-Nano (0,91 milhões de parâmetros) é essencial.
  • Estudos sobre atribuição de rótulos SimOTA: Projetos de investigação que analisam estratégias de atribuição de rótulos baseadas em transporte ótimo e o seu impacto na convergência do treino.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência para desenvolvedores:

  • Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.

O futuro: chegou YOLO26#

Embora YOLOv9 represente um marco impressionante, as exigências dos ambientes de produção continuam ampliando os limites. O recém-lançado YOLO26 representa o padrão definitivo para a IA de visão moderna.

YOLO26 renova completamente o pipeline de implantação com um design opcional de ponta a ponta sem NMS. Ao eliminar a necessidade de supressão não máxima complexa durante o pós-processamento com nms=False, o modelo oferece latência de inferência significativamente menor.

Além disso, YOLO26 incorpora o revolucionário otimizador MuSGD, uma combinação de SGD e Muon que aproveita inovações do treinamento de LLMs para proporcionar uma convergência incrivelmente estável e rápida. Ao remover a Distribution Focal Loss (DFL), YOLO26 alcança inferência na CPU até 43% mais rápida que seus predecessores, tornando-se a melhor opção para dispositivos de borda e implantações empresariais. Com melhorias notáveis no reconhecimento de objetos pequenos por meio de ProgLoss e STAL, YOLO26 efetivamente supera YOLOX e YOLOv9.

Para engenheiros que estão explorando arquiteturas modernas, também recomendamos conhecer YOLO11 e RT-DETR, alternativas poderosas do conjunto Ultralytics. Prepare seu projeto para o futuro aproveitando o desempenho incomparável dos modelos mais recentes na Ultralytics Platform.

Comentários