YOLOX vs. YOLOv5#
Selecionar o modelo de deteção de objetos certo é uma decisão crucial que determina o sucesso de qualquer projeto de visão computacional. Este guia apresenta uma comparação técnica abrangente entre dois modelos fundamentais no panorama da IA: o YOLOX, da Megvii, e o Ultralytics YOLOv5. Ao analisar as arquiteturas, as métricas de desempenho e os ecossistemas de treino, pretendemos ajudar programadores e investigadores a fazer uma escolha informada para os respetivos ambientes de implementação.
Introdução aos modelos#
Ambos os modelos surgiram durante um período de rápido avanço na deteção de objetos em tempo real, mas adotaram filosofias arquitetónicas diferentes para alcançar o seu desempenho.
YOLOX: uma abordagem sem âncoras#
Lançado pelos investigadores Zheng Ge, Songtao Liu, Feng Wang, Zeming Li e Jian Sun, da Megvii, a 18 de julho de 2021, o YOLOX introduziu uma mudança significativa ao abandonar as caixas-âncora tradicionais. Documentado no seu relatório técnico do Arxiv, o YOLOX integrou um design sem âncoras com uma cabeça desacoplada e a estratégia de atribuição de etiquetas SimOTA. Este design procurou colmatar a lacuna entre a investigação académica e a aplicação industrial, oferecendo um desempenho sólido em conjuntos de dados padrão.
YOLOv5: o padrão para IA de visão em produção#
Criado por Glenn Jocher e lançado pela Ultralytics a 26 de junho de 2020, o YOLOv5 tornou-se rapidamente o padrão da indústria para visão computacional implementada. Desenvolvido nativamente na framework PyTorch, democratizou a IA de última geração ao oferecer uma facilidade de utilização incomparável, um treino excecionalmente rápido e um repositório altamente aperfeiçoado. A arquitetura do YOLOv5 centrou-se num equilíbrio ideal entre velocidade, precisão e facilidade de implementação, tornando-o uma escolha popular para tudo, desde dispositivos de edge até implementações massivas na cloud.
Diferenças arquitetónicas#
Compreender as principais diferenças mecânicas entre estas redes esclarece por que motivo têm desempenhos diferentes em várias tarefas.
Sem âncoras vs. com âncoras#
O contraste mais marcante é o mecanismo sem âncoras do YOLOX. Os modelos tradicionais, como o YOLOv5, dependem de caixas-âncora predefinidas para prever caixas delimitadoras, o que exige uma análise de clustering no conjunto de dados de treino para determinar os tamanhos de âncora ideais. O YOLOX elimina esta etapa e prevê diretamente as coordenadas das caixas delimitadoras em cada localização espacial. Embora a abordagem sem âncoras reduza o número de parâmetros de design e o ajuste heurístico, a abordagem refinada com âncoras do YOLOv5, apoiada pela funcionalidade de âncoras automáticas, garante uma convergência do treino extremamente estável e previsível logo à partida.
Cabeça desacoplada vs. cabeça acoplada#
O YOLOX utiliza uma cabeça desacoplada, o que significa que as tarefas de classificação e regressão são separadas em ramos distintos da rede neuronal. Os autores argumentaram que isto resolve os conflitos entre a aprendizagem de características espaciais e semânticas. Por outro lado, o YOLOv5 utilizava uma cabeça acoplada altamente otimizada (nas versões anteriores), que maximizava a eficiência computacional e reduzia a latência de inferência, algo crucial para a computação de edge em tempo real.
Estratégia de atribuição de etiquetas#
O YOLOX utiliza SimOTA para a atribuição de etiquetas, formulando o emparelhamento de objetos de referência com previsões como um problema de Transporte Ótimo. Esta atribuição dinâmica melhora o tratamento de cenas congestionadas. O YOLOv5 utiliza uma atribuição robusta baseada em regras de forma, garantindo que amostras positivas de alta qualidade sejam fornecidas consistentemente à função de perda, o que contribui para a sua lendária estabilidade de treino.
Desempenho e benchmarks#
O compromisso entre velocidade e precisão é o teste definitivo para estas arquiteturas. A tabela abaixo ilustra o desempenho de vários tamanhos de modelo em benchmarks padrão.
| Modelo | tamanho (pixels) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
Embora o YOLOX alcance pontuações mAP competitivas, especialmente nas variantes maiores, o YOLOv5 mantém uma vantagem notável na velocidade de inferência com TensorRT em todas as variantes. Por exemplo, o modelo YOLOv5s oferece uma relação velocidade-precisão excecional, tornando-o altamente desejável para aplicações em tempo real em que cada milissegundo conta.
A vantagem da Ultralytics: treino e facilidade de utilização#
Na transição da investigação para a produção, o ecossistema em torno de um modelo é muitas vezes tão importante como o próprio modelo. É aqui que as vantagens do ecossistema da Ultralytics se tornam evidentes.
Experiência de utilizador simplificada#
O YOLOv5 é amplamente elogiado pela experiência de desenvolvimento que leva do zero ao sucesso. A API Python da Ultralytics e a CLI permitem-te carregar, treinar e implementar modelos com uma única linha de código. Em contrapartida, executar o YOLOX a partir do repositório GitHub da Megvii exige mais configuração manual de variáveis de ambiente, configurações complexas do caminho do Python e uma curva de aprendizagem mais acentuada, típica das bases de código de investigação académica.
Eficiência de treinamento e requisitos de memória#
Os modelos da Ultralytics são meticulosamente concebidos para minimizar a utilização de memória durante o treino. O YOLOv5 exige significativamente menos memória CUDA do que modelos Transformer com muitos parâmetros, como o RT-DETR, ou modelos de investigação não otimizados. Isto permite aos programadores treinar com tamanhos de lote maiores em hardware de consumo, acelerando o ciclo de desenvolvimento iterativo.
Versatilidade em várias tarefas#
Embora o YOLOX seja estritamente uma framework de deteção de objetos, o ecossistema da Ultralytics evoluiu o YOLOv5 para suportar várias tarefas de visão. Pronto a utilizar, podes realizar classificação de imagens, segmentação de instâncias e deteção de objetos usando exatamente a mesma sintaxe da API.
Se precisares de tarefas ainda mais avançadas, como estimativa de pose ou deteção de caixas delimitadoras orientadas (OBB), recomendamos vivamente que atualizes para a arquitetura mais recente Ultralytics YOLO26, que as suporta nativamente com precisão de última geração.
Comparação de código#
A diferença de facilidade de utilização é mais evidente no código.
Treino com YOLOv5:
from ultralytics import YOLO
# Carregue um modelo YOLOv5s pré-treinado
model = YOLO("yolov5su.pt") # YOLOv5u: pesos YOLOv5 sem âncoras para o pacote ultralytics
# Treina o modelo no conjunto de dados de exemplo COCO8
model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Executa a inferência numa imagem
results = model("https://ultralytics.com/images/zidane.jpg")
# Apresentar resultados
results[0].show()Treino com YOLOX: (Requer a clonagem manual do repositório, a instalação de setup.py e argumentos CLI complexos)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oA abordagem da Ultralytics elimina obstáculos, permitindo-te concentrares no teu conjunto de dados e na lógica da aplicação, em vez de depurares ficheiros de configuração. Além disso, o acompanhamento das experiências é simples, graças às integrações incorporadas com Weights & Biases e Comet ML.
Casos de uso ideais e aplicações no mundo real#
A escolha entre estes modelos depende do ambiente operacional do teu projeto.
Onde o YOLOX se destaca#
O YOLOX continua a ser uma opção sólida em contextos académicos, onde os investigadores estudam explicitamente paradigmas sem âncoras ou estratégias de atribuição de etiquetas. Também é útil em cenários nos quais a deteção de cenas congestionadas é a métrica prioritária e as velocidades de implementação em edge são secundárias.
Onde o YOLOv5 se destaca#
O YOLOv5 é o campeão indiscutível da implementação prática.
- Fabrico de alta velocidade: Para a deteção de defeitos em linhas de montagem, a latência mínima de inferência do YOLOv5 em GPUs de edge garante a inspeção dos produtos sem abrandar a linha.
- Drones e imagens aéreas: A utilização eficiente de memória permite-lhe funcionar em computadores auxiliares leves instalados em drones, para tarefas como a monitorização agrícola e o acompanhamento da vida selvagem.
- Retalho inteligente: Desde o pagamento automatizado à gestão de inventário, o YOLOv5 exporta facilmente para TensorRT e ONNX, permitindo a implementação em massa em milhares de câmaras de lojas.
O futuro: as vantagens do YOLO26#
Embora o YOLOv5 seja um modelo lendário, o campo da IA evolui rapidamente. Se estás a iniciar um novo projeto hoje, recomendamos vivamente que explores a geração mais recente de modelos da Ultralytics.
Lançado em 2026, Ultralytics YOLO26 representa um enorme avanço. Inclui um design opcional de ponta a ponta sem NMS (nms=False), que elimina a necessidade do pós-processamento de Supressão Não Máxima e simplifica drasticamente a lógica de implementação. Ao remover Distribution Focal Loss (DFL) e utilizar o avançado otimizador MuSGD, o YOLO26 alcança uma inferência na CPU até 43% mais rápida do que as gerações anteriores, mantendo uma precisão superior, especialmente em objetos pequenos, graças ao novo ProgLoss + STAL (perda progressiva e atribuição de etiquetas sensível a objetos pequenos).
Quer escolhas a fiabilidade comprovada do YOLOv5, quer o desempenho de ponta do YOLO26, a plataforma Ultralytics garante-te as melhores ferramentas disponíveis para levares as tuas soluções de visão computacional do conceito à produção sem complicações. Explora a abrangente documentação da Ultralytics para aproveitares todo o potencial do teu pipeline de IA.