YOLOX vs YOLOv5#
Selecionar o modelo de deteção de objetos adequado é uma decisão crítica que determina o sucesso de qualquer projeto de visão computacional. Este guia apresenta uma comparação técnica abrangente entre dois modelos fundamentais no panorama da IA: o YOLOX da Megvii e o Ultralytics YOLOv5. Ao analisar as suas arquiteturas, métricas de desempenho e ecossistemas de treino, pretendemos ajudar programadores e investigadores a fazer uma escolha informada para os seus ambientes de implementação específicos.
Introdução aos modelos#
Ambos os modelos surgiram durante um período de rápido avanço na deteção de objetos em tempo real, mas seguiram filosofias arquitetónicas diferentes para alcançar o seu desempenho.
YOLOX: Uma abordagem sem âncoras#
Lançado pelos investigadores Zheng Ge, Songtao Liu, Feng Wang, Zeming Li e Jian Sun da Megvii em 18 de julho de 2021, o YOLOX introduziu uma mudança significativa ao afastar-se das caixas de âncora tradicionais. Documentado no seu relatório técnico da Arxiv, o YOLOX integrou um design sem âncoras com uma cabeça desacoplada e a estratégia de atribuição de etiquetas SimOTA. Este design procurava aproximar a investigação académica da aplicação industrial, oferecendo um desempenho sólido em conjuntos de dados padrão.
YOLOv5: O padrão para IA de visão em produção#
Criado por Glenn Jocher e lançado pela Ultralytics em 26 de junho de 2020, o YOLOv5 tornou-se rapidamente o padrão da indústria para visão computacional implementada. Desenvolvido nativamente no framework PyTorch, democratizou a IA de última geração ao oferecer uma facilidade de utilização incomparável, um treino excecionalmente rápido e um repositório altamente aperfeiçoado. A arquitetura do YOLOv5 centrou-se num equilíbrio perfeito entre velocidade, precisão e facilidade de implementação, tornando-o uma escolha favorita para tudo, desde dispositivos de edge computing até implementações massivas na cloud.
Diferenças arquiteturais#
Compreender as principais diferenças mecânicas entre estas redes esclarece por que razão apresentam desempenhos diferentes em várias tarefas.
Sem âncoras vs. baseado em âncoras#
O contraste mais marcante é o mecanismo sem âncoras do YOLOX. Os modelos tradicionais, como o YOLOv5, dependem de caixas de âncora predefinidas para prever caixas delimitadoras, o que requer uma análise de agrupamento no conjunto de dados de treino para determinar os tamanhos ideais das âncoras. O YOLOX elimina esta necessidade, prevendo diretamente as coordenadas da caixa delimitadora em cada localização espacial. Embora a abordagem sem âncoras reduza o número de parâmetros de design e o ajuste heurístico, a abordagem refinada baseada em âncoras do YOLOv5, apoiada pela sua funcionalidade auto-anchor, garante uma convergência do treino incrivelmente estável e previsível logo à partida.
Cabeça desacoplada vs. cabeça acoplada#
O YOLOX utiliza uma cabeça desacoplada, o que significa que as tarefas de classificação e regressão são separadas em ramos distintos da rede neural. Os autores argumentaram que isto resolve os conflitos entre a aprendizagem de características espaciais e semânticas. Em contrapartida, o YOLOv5 utilizava uma cabeça acoplada altamente otimizada (nas suas versões iniciais) que maximizava a eficiência computacional e reduzia a latência de inferência, algo crucial para a computação edge em tempo real.
Estratégia de atribuição de etiquetas#
O YOLOX utiliza o SimOTA para a atribuição de etiquetas, formulando a associação entre objetos de ground truth e previsões como um problema de Transporte Ótimo. Esta atribuição dinâmica melhora o tratamento de cenas congestionadas. O YOLOv5 utiliza uma atribuição robusta baseada em regras de forma, garantindo que amostras positivas de alta qualidade sejam continuamente fornecidas à função de perda, o que contribui para a sua lendária estabilidade de treino.
Desempenho e benchmarks#
O compromisso entre velocidade e precisão é o teste definitivo para estas arquiteturas. A tabela abaixo ilustra o desempenho de vários tamanhos de modelo em benchmarks padrão.
| Modelo | tamanho (píxeis) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
Embora o YOLOX alcance pontuações de mAP competitivas, especialmente nas suas variantes maiores, o YOLOv5 mantém uma vantagem notável na velocidade de inferência com TensorRT em todos os cenários. O modelo YOLOv5s, por exemplo, oferece uma relação velocidade-precisão excecional, tornando-o altamente desejável para aplicações em tempo real onde cada milissegundo conta.
A vantagem da Ultralytics: treino e usabilidade#
Ao passar da investigação para a produção, o ecossistema que envolve um modelo é frequentemente tão importante como o próprio modelo. Aqui, as vantagens do ecossistema da Ultralytics tornam-se particularmente evidentes.
Experiência de utilização simplificada#
O YOLOv5 é universalmente elogiado pela sua experiência de desenvolvimento de "zero a herói". A API Python da Ultralytics e a CLI permitem carregar, treinar e implementar modelos com uma única linha de código. Em contrapartida, executar o YOLOX a partir do repositório GitHub da Megvii requer mais configuração manual de variáveis de ambiente, configurações complexas de caminhos do Python e uma curva de aprendizagem mais acentuada, típica das bases de código de investigação académica.
Eficiência do treino e requisitos de memória#
Os modelos da Ultralytics são meticulosamente concebidos para minimizar a utilização de memória durante o treino. O YOLOv5 requer significativamente menos memória CUDA em comparação com modelos Transformer fortemente parametrizados, como o RT-DETR, ou com modelos de investigação não otimizados. Isto permite aos programadores treinar com tamanhos de batch maiores em hardware de consumo, acelerando o ciclo de desenvolvimento iterativo.
Versatilidade entre tarefas#
Embora o YOLOX seja estritamente um framework de deteção de objetos, o ecossistema da Ultralytics evoluiu o YOLOv5 para suportar várias tarefas de visão. Pronto a utilizar, podes realizar Classificação de Imagens, Segmentação de Instâncias e deteção de objetos utilizando exatamente a mesma sintaxe da API.
Se precisares de tarefas ainda mais avançadas, como Estimativa de Pose ou deteção de Caixas Delimitadoras Orientadas (OBB), recomendamos vivamente atualizar para a mais recente arquitetura Ultralytics YOLO26, que suporta todas estas tarefas nativamente com uma precisão de última geração.
Comparação de código#
A diferença de usabilidade é melhor demonstrada através de código.
Treino com YOLOv5:
from ultralytics import YOLO
# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")
# Display results
results[0].show()Treino com YOLOX: (Requer a clonagem manual do repositório, a instalação através de setup.py e argumentos CLI complexos)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oA abordagem da Ultralytics elimina obstáculos, permitindo que te concentres no teu conjunto de dados e na lógica da aplicação em vez de depurares ficheiros de configuração. Além disso, acompanhar as tuas experiências é simples graças às integrações incorporadas com Weights & Biases e Comet ML.
Casos de utilização ideais e aplicações no mundo real#
A escolha entre estes modelos depende do ambiente operacional do teu projeto.
Onde o YOLOX se destaca#
O YOLOX continua a ser uma opção sólida em contextos académicos onde os investigadores estudam explicitamente paradigmas sem âncoras ou estratégias de atribuição de etiquetas. Também é útil em cenários onde a deteção de cenas congestionadas é a métrica prioritária e as velocidades de implementação em edge são secundárias.
Onde o YOLOv5 se destaca#
O YOLOv5 é o campeão incontestado da implementação prática.
- Fabrico de alta velocidade: Para a deteção de defeitos em linhas de montagem, a latência de inferência mínima do YOLOv5 em GPUs edge garante que os produtos são inspecionados sem abrandar a linha.
- Imagens de drones e aéreas: A sua utilização eficiente de memória permite-lhe funcionar em computadores companheiros leves instalados em drones, para tarefas como a monitorização agrícola e o acompanhamento da vida selvagem.
- Retalho inteligente: Desde o checkout automatizado até à gestão de inventário, o YOLOv5 exporta facilmente para TensorRT e ONNX para implementação em massa em milhares de câmaras de lojas.
Olhando para o futuro: a vantagem do YOLO26#
Embora o YOLOv5 seja um modelo lendário, o campo da IA avança rapidamente. Se estás a iniciar um novo projeto hoje, recomendamos vivamente que analises a mais recente geração de modelos da Ultralytics.
Lançado em 2026, o Ultralytics YOLO26 representa um enorme salto em frente. Apresenta um Design End-to-End sem NMS, eliminando completamente a necessidade de pós-processamento de Supressão de Não Máximos, o que simplifica drasticamente a lógica de implementação. Ao remover a Distribution Focal Loss (DFL) e utilizar o otimizador MuSGD de última geração, o YOLO26 alcança uma inferência até 43% mais rápida na CPU do que as gerações anteriores, mantendo simultaneamente uma maior precisão, especialmente em objetos pequenos, graças às novas funções de perda ProgLoss + STAL.
Quer escolhas a fiabilidade comprovada do YOLOv5 quer o desempenho de vanguarda do YOLO26, a Plataforma Ultralytics garante que tens as melhores ferramentas disponíveis para levar as tuas soluções de visão computacional do conceito à produção de forma simples. Explora a documentação abrangente da Ultralytics para desbloqueares todo o potencial do teu pipeline de IA.