Ultralytics YOLO27:

YOLOX vs YOLOv5#

Selecionar o modelo de deteção de objetos adequado é uma decisão crítica que determina o sucesso de qualquer projeto de visão computacional. Este guia apresenta uma comparação técnica abrangente entre dois modelos fundamentais no panorama da IA: o YOLOX da Megvii e o Ultralytics YOLOv5. Ao analisar as suas arquiteturas, métricas de desempenho e ecossistemas de treino, pretendemos ajudar programadores e investigadores a fazer uma escolha informada para os seus ambientes de implementação específicos.

Introdução aos modelos#

Ambos os modelos surgiram durante um período de rápido avanço na deteção de objetos em tempo real, mas seguiram filosofias arquitetónicas diferentes para alcançar o seu desempenho.

YOLOX: Uma abordagem sem âncoras#

Lançado pelos investigadores Zheng Ge, Songtao Liu, Feng Wang, Zeming Li e Jian Sun da Megvii em 18 de julho de 2021, o YOLOX introduziu uma mudança significativa ao afastar-se das caixas de âncora tradicionais. Documentado no seu relatório técnico da Arxiv, o YOLOX integrou um design sem âncoras com uma cabeça desacoplada e a estratégia de atribuição de etiquetas SimOTA. Este design procurava aproximar a investigação académica da aplicação industrial, oferecendo um desempenho sólido em conjuntos de dados padrão.

Saiba mais sobre o YOLOX

YOLOv5: O padrão para IA de visão em produção#

Criado por Glenn Jocher e lançado pela Ultralytics em 26 de junho de 2020, o YOLOv5 tornou-se rapidamente o padrão da indústria para visão computacional implementada. Desenvolvido nativamente no framework PyTorch, democratizou a IA de última geração ao oferecer uma facilidade de utilização incomparável, um treino excecionalmente rápido e um repositório altamente aperfeiçoado. A arquitetura do YOLOv5 centrou-se num equilíbrio perfeito entre velocidade, precisão e facilidade de implementação, tornando-o uma escolha favorita para tudo, desde dispositivos de edge computing até implementações massivas na cloud.

Diferenças arquiteturais#

Compreender as principais diferenças mecânicas entre estas redes esclarece por que razão apresentam desempenhos diferentes em várias tarefas.

Sem âncoras vs. baseado em âncoras#

O contraste mais marcante é o mecanismo sem âncoras do YOLOX. Os modelos tradicionais, como o YOLOv5, dependem de caixas de âncora predefinidas para prever caixas delimitadoras, o que requer uma análise de agrupamento no conjunto de dados de treino para determinar os tamanhos ideais das âncoras. O YOLOX elimina esta necessidade, prevendo diretamente as coordenadas da caixa delimitadora em cada localização espacial. Embora a abordagem sem âncoras reduza o número de parâmetros de design e o ajuste heurístico, a abordagem refinada baseada em âncoras do YOLOv5, apoiada pela sua funcionalidade auto-anchor, garante uma convergência do treino incrivelmente estável e previsível logo à partida.

Cabeça desacoplada vs. cabeça acoplada#

O YOLOX utiliza uma cabeça desacoplada, o que significa que as tarefas de classificação e regressão são separadas em ramos distintos da rede neural. Os autores argumentaram que isto resolve os conflitos entre a aprendizagem de características espaciais e semânticas. Em contrapartida, o YOLOv5 utilizava uma cabeça acoplada altamente otimizada (nas suas versões iniciais) que maximizava a eficiência computacional e reduzia a latência de inferência, algo crucial para a computação edge em tempo real.

Evolução arquitetónica

Embora o YOLOX tenha promovido a cabeça desacoplada em 2021, a Ultralytics adotou e aperfeiçoou posteriormente arquiteturas desacopladas em modelos subsequentes, como o YOLOv8 e o YOLO26 de última geração, combinando o melhor dos dois mundos.

Estratégia de atribuição de etiquetas#

O YOLOX utiliza o SimOTA para a atribuição de etiquetas, formulando a associação entre objetos de ground truth e previsões como um problema de Transporte Ótimo. Esta atribuição dinâmica melhora o tratamento de cenas congestionadas. O YOLOv5 utiliza uma atribuição robusta baseada em regras de forma, garantindo que amostras positivas de alta qualidade sejam continuamente fornecidas à função de perda, o que contribui para a sua lendária estabilidade de treino.

Desempenho e benchmarks#

O compromisso entre velocidade e precisão é o teste definitivo para estas arquiteturas. A tabela abaixo ilustra o desempenho de vários tamanhos de modelo em benchmarks padrão.

Modelotamanho
(píxeis)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Embora o YOLOX alcance pontuações de mAP competitivas, especialmente nas suas variantes maiores, o YOLOv5 mantém uma vantagem notável na velocidade de inferência com TensorRT em todos os cenários. O modelo YOLOv5s, por exemplo, oferece uma relação velocidade-precisão excecional, tornando-o altamente desejável para aplicações em tempo real onde cada milissegundo conta.

A vantagem da Ultralytics: treino e usabilidade#

Ao passar da investigação para a produção, o ecossistema que envolve um modelo é frequentemente tão importante como o próprio modelo. Aqui, as vantagens do ecossistema da Ultralytics tornam-se particularmente evidentes.

Experiência de utilização simplificada#

O YOLOv5 é universalmente elogiado pela sua experiência de desenvolvimento de "zero a herói". A API Python da Ultralytics e a CLI permitem carregar, treinar e implementar modelos com uma única linha de código. Em contrapartida, executar o YOLOX a partir do repositório GitHub da Megvii requer mais configuração manual de variáveis de ambiente, configurações complexas de caminhos do Python e uma curva de aprendizagem mais acentuada, típica das bases de código de investigação académica.

Eficiência do treino e requisitos de memória#

Os modelos da Ultralytics são meticulosamente concebidos para minimizar a utilização de memória durante o treino. O YOLOv5 requer significativamente menos memória CUDA em comparação com modelos Transformer fortemente parametrizados, como o RT-DETR, ou com modelos de investigação não otimizados. Isto permite aos programadores treinar com tamanhos de batch maiores em hardware de consumo, acelerando o ciclo de desenvolvimento iterativo.

Versatilidade entre tarefas#

Embora o YOLOX seja estritamente um framework de deteção de objetos, o ecossistema da Ultralytics evoluiu o YOLOv5 para suportar várias tarefas de visão. Pronto a utilizar, podes realizar Classificação de Imagens, Segmentação de Instâncias e deteção de objetos utilizando exatamente a mesma sintaxe da API.

Inovação contínua

Se precisares de tarefas ainda mais avançadas, como Estimativa de Pose ou deteção de Caixas Delimitadoras Orientadas (OBB), recomendamos vivamente atualizar para a mais recente arquitetura Ultralytics YOLO26, que suporta todas estas tarefas nativamente com uma precisão de última geração.

Comparação de código#

A diferença de usabilidade é melhor demonstrada através de código.

Treino com YOLOv5:

from ultralytics import YOLO

# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")

# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")

# Display results
results[0].show()

Treino com YOLOX: (Requer a clonagem manual do repositório, a instalação através de setup.py e argumentos CLI complexos)

# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -o

A abordagem da Ultralytics elimina obstáculos, permitindo que te concentres no teu conjunto de dados e na lógica da aplicação em vez de depurares ficheiros de configuração. Além disso, acompanhar as tuas experiências é simples graças às integrações incorporadas com Weights & Biases e Comet ML.

Casos de utilização ideais e aplicações no mundo real#

A escolha entre estes modelos depende do ambiente operacional do teu projeto.

Onde o YOLOX se destaca#

O YOLOX continua a ser uma opção sólida em contextos académicos onde os investigadores estudam explicitamente paradigmas sem âncoras ou estratégias de atribuição de etiquetas. Também é útil em cenários onde a deteção de cenas congestionadas é a métrica prioritária e as velocidades de implementação em edge são secundárias.

Onde o YOLOv5 se destaca#

O YOLOv5 é o campeão incontestado da implementação prática.

  • Fabrico de alta velocidade: Para a deteção de defeitos em linhas de montagem, a latência de inferência mínima do YOLOv5 em GPUs edge garante que os produtos são inspecionados sem abrandar a linha.
  • Imagens de drones e aéreas: A sua utilização eficiente de memória permite-lhe funcionar em computadores companheiros leves instalados em drones, para tarefas como a monitorização agrícola e o acompanhamento da vida selvagem.
  • Retalho inteligente: Desde o checkout automatizado até à gestão de inventário, o YOLOv5 exporta facilmente para TensorRT e ONNX para implementação em massa em milhares de câmaras de lojas.

Olhando para o futuro: a vantagem do YOLO26#

Embora o YOLOv5 seja um modelo lendário, o campo da IA avança rapidamente. Se estás a iniciar um novo projeto hoje, recomendamos vivamente que analises a mais recente geração de modelos da Ultralytics.

Lançado em 2026, o Ultralytics YOLO26 representa um enorme salto em frente. Apresenta um Design End-to-End sem NMS, eliminando completamente a necessidade de pós-processamento de Supressão de Não Máximos, o que simplifica drasticamente a lógica de implementação. Ao remover a Distribution Focal Loss (DFL) e utilizar o otimizador MuSGD de última geração, o YOLO26 alcança uma inferência até 43% mais rápida na CPU do que as gerações anteriores, mantendo simultaneamente uma maior precisão, especialmente em objetos pequenos, graças às novas funções de perda ProgLoss + STAL.

Quer escolhas a fiabilidade comprovada do YOLOv5 quer o desempenho de vanguarda do YOLO26, a Plataforma Ultralytics garante que tens as melhores ferramentas disponíveis para levar as tuas soluções de visão computacional do conceito à produção de forma simples. Explora a documentação abrangente da Ultralytics para desbloqueares todo o potencial do teu pipeline de IA.

Comentários