Ultralytics YOLO27:
Get Started

YOLOv5 vs YOLOX#

A evolução da visão computacional em tempo real foi marcada por muitos avanços, com diferentes arquiteturas a alargar os limites da velocidade e da precisão. Dois modelos muito influentes neste domínio são YOLOv5 e YOLOX. Embora ambos sejam reconhecidos pelo elevado desempenho na deteção de objetos, adotam abordagens arquiteturais fundamentalmente diferentes.

Este guia apresenta uma análise técnica aprofundada destes dois modelos, comparando as suas arquiteturas, métricas de desempenho, metodologias de treino e cenários de implementação ideais para ajudar programadores e investigadores a escolher a ferramenta certa para os seus projetos de IA de visão.

Visão geral dos modelos e diferenças arquiteturais#

Ultralytics YOLOv5#

Apresentado pela Ultralytics, o YOLOv5 rapidamente se tornou um padrão do setor graças ao seu equilíbrio excepcional entre desempenho, facilidade de uso e eficiência de memória. Desenvolvido nativamente com o framework PyTorch, o YOLOv5 usa uma arquitetura baseada em âncoras. Ele se apoia em formatos predefinidos de caixas delimitadoras para prever a localização de objetos, o que o torna altamente eficaz em tarefas padrão de detecção de objetos.

Um dos maiores pontos fortes do YOLOv5 é seu ecossistema bem mantido. Ele conta com documentação abrangente, uma API Python incrivelmente simples e integração nativa com a Plataforma Ultralytics. Isso permite que os desenvolvedores passem perfeitamente da anotação de conjuntos de dados ao treinamento e à exportação para formatos como ONNX e TensorRT.

Vantagem do ecossistema

Os modelos Ultralytics YOLO geralmente exigem muito menos memória de GPU durante o treinamento do que alternativas complexas baseadas em Transformer. Esse baixo consumo de memória torna o YOLOv5 bastante acessível para pesquisadores que trabalham com hardware de consumo.

Megvii YOLOX#

Desenvolvido por pesquisadores da Megvii, o YOLOX seguiu um caminho diferente ao introduzir um design sem âncoras na família YOLO. Ao eliminar as caixas de âncora, o YOLOX simplifica a cabeça de detecção e reduz significativamente o número de parâmetros heurísticos que precisam ser ajustados manualmente durante o treinamento.

O YOLOX também incorpora uma cabeça desacoplada — que separa as tarefas de classificação e regressão em diferentes ramificações da rede — e utiliza a estratégia de atribuição de rótulos SimOTA. Essas inovações aproximam a pesquisa acadêmica das aplicações industriais, tornando o YOLOX particularmente eficaz em ambientes com objetos de escalas muito variadas.

Saiba mais sobre o YOLOX

Desempenho e métricas#

Ao avaliar modelos de visão computacional, é fundamental considerar o equilíbrio entre a precisão média (mAP) e a velocidade de inferência. Ambos os modelos oferecem diversos tamanhos (de Nano a Extra-Large) para atender a diferentes limitações de hardware.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Embora o YOLOXx alcance uma precisão máxima ligeiramente superior (51,1 mAP), o YOLOv5 oferece um pipeline de implantação muito mais robusto e amplamente testado em hardware com CPU e GPU. As velocidades do TensorRT para o YOLOv5 destacam sua profunda otimização para dispositivos de computação de borda, tornando-o uma opção altamente confiável para análise de vídeo em tempo real.

Metodologias de treinamento e facilidade de utilização#

A experiência do desenvolvedor varia significativamente entre essas duas arquiteturas.

A abordagem do YOLOX#

O treinamento do YOLOX normalmente exige clonar o repositório original, gerenciar dependências específicas e executar scripts complexos de linha de comando. Embora ofereça suporte a recursos avançados, como treinamento de precisão mista e configurações com vários nós via MegEngine, a curva de aprendizado pode ser íngreme para desenvolvedores que precisam fazer prototipagem rápida.

A vantagem da Ultralytics#

Em contrapartida, a Ultralytics prioriza uma experiência de uso excepcionalmente simples. Com o pacote Python ultralytics, os desenvolvedores podem carregar, treinar e validar um modelo com o mínimo de código boilerplate. A Ultralytics gerencia automaticamente aumentos de dados complexos, a evolução de hiperparâmetros e o agendamento da taxa de aprendizado.

from ultralytics import YOLO

# Carregue um modelo YOLOv5 pequeno pré-treinado
model = YOLO("yolov5su.pt")  # YOLOv5u: pesos YOLOv5 sem âncoras para o pacote ultralytics

# Treina o modelo com o conjunto de dados COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Valida o desempenho do modelo
metrics = model.val()

Além disso, a versatilidade do YOLOv5 vai além da detecção de objetos padrão, oferecendo suporte robusto à classificação de imagens e à segmentação de instâncias na mesma API coesa.

Implantação simplificada

Quando o treinamento é concluído, exportar um modelo YOLOv5 para ONNX, CoreML, LiteRT ou OpenVINO é tão simples quanto fazer uma única chamada, como model.export(format="onnx"). Isso elimina a necessidade de scripts de conversão de terceiros, comumente exigidos por repositórios voltados à pesquisa.

Aplicações no mundo real#

A escolha entre esses modelos depende do ambiente de implantação e dos requisitos técnicos:

  • Varejo e gestão de estoque: para aplicações que exigem reconhecimento de produtos em tempo real em dispositivos de borda, como o NVIDIA Jetson, o YOLOv5 é extremamente adequado. Seu consumo mínimo de memória e as altas velocidades de inferência com TensorRT permitem rastrear várias câmeras sem perder quadros.
  • Pesquisa acadêmica e arquiteturas personalizadas: o YOLOX é muito respeitado na comunidade de pesquisa. Sua cabeça desacoplada e sua natureza sem âncoras fazem dele uma excelente base para engenheiros que querem experimentar novas estratégias de atribuição de rótulos ou que trabalham com conjuntos de dados nos quais as caixas de âncora tradicionais não conseguem generalizar.
  • IA agrícola: para tarefas de agricultura de precisão, como detecção de frutas ou identificação de ervas daninhas por drones, a facilidade de treinar e implantar modelos YOLOv5 usando a Plataforma Ultralytics permite que especialistas do setor implementem soluções de IA sem precisar de conhecimentos avançados de engenharia de aprendizado de máquina.

Casos de uso e recomendações#

A escolha entre YOLOv5 e YOLOX depende dos requisitos específicos do projeto, das limitações de implantação e das preferências de ecossistema.

Quando escolher o YOLOv5#

O YOLOv5 é uma ótima opção para:

  • Sistemas de produção comprovados: implantações existentes em que são valorizados o longo histórico de estabilidade do YOLOv5, sua documentação abrangente e o enorme suporte da comunidade.
  • Treinamento com recursos limitados: ambientes com recursos de GPU limitados, nos quais o pipeline de treinamento eficiente e os menores requisitos de memória do YOLOv5 são vantajosos.
  • Amplo suporte a formatos de exportação: projetos que exigem implantação em vários formatos, incluindo ONNX, TensorRT, CoreML e LiteRT.

Quando escolher o YOLOX#

O YOLOX é recomendado para:

  • Investigação em deteção sem âncoras: Investigação académica que utiliza a arquitetura simples e sem âncoras do YOLOX como referência para experimentar novas cabeças de deteção ou funções de perda.
  • Dispositivos de borda ultraleves: Implementações em microcontroladores ou hardware móvel legado, onde o tamanho extremamente reduzido da variante YOLOX-Nano (0,91 milhões de parâmetros) é essencial.
  • Estudos sobre atribuição de rótulos SimOTA: Projetos de investigação que analisam estratégias de atribuição de rótulos baseadas em transporte ótimo e o seu impacto na convergência do treino.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência para desenvolvedores:

  • Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.

O futuro da IA de visão: chega o YOLO26#

Embora YOLOv5 e YOLOX já tenham garantido seu lugar na história da visão computacional, o campo avança rapidamente. Para desenvolvedores que iniciam projetos hoje, a Ultralytics recomenda fortemente explorar seu mais recente modelo principal, o YOLO26.

Lançado em janeiro de 2026, o YOLO26 representa um enorme avanço em desempenho e usabilidade. Ele introduz um design inovador de ponta a ponta sem NMS (selecionado com nms=False), que elimina o pós-processamento de supressão não máxima. Isso reduz significativamente a variabilidade da latência e simplifica a lógica de implantação em dispositivos de baixo consumo.

Além disso, o YOLO26 utiliza o novo otimizador MuSGD — uma combinação de SGD e Muon inspirada em inovações de treinamento de LLMs — para alcançar uma convergência incrivelmente estável e rápida. Com a remoção da DFL (Distribution Focal Loss, removida para simplificar a exportação e melhorar a compatibilidade com dispositivos de borda e de baixo consumo), o YOLO26 alcança inferência em CPU até 43% mais rápida, consolidando sua posição como o modelo definitivo para computação de borda moderna, robótica e aplicações de IoT. Além disso, ProgLoss + STAL oferece funções de perda aprimoradas, com ganhos notáveis no reconhecimento de objetos pequenos, algo essencial para IoT, robótica e imagens aéreas. Quem tiver interesse em gerações anteriores também pode conferir o YOLO11, embora o YOLO26 seja, sem dúvida, a escolha mais avançada.

Conclusão#

YOLOv5 e YOLOX oferecem recursos incríveis de detecção de objetos. Em 2021, o YOLOX ampliou os limites da arquitetura ao demonstrar que designs sem âncoras podiam competir com métodos tradicionais e superá-los. No entanto, o YOLOv5 continua sendo uma força dominante graças à sua facilidade de uso incomparável, ao ecossistema abrangente e aos menores requisitos de memória durante o treinamento.

Para a grande maioria das aplicações comerciais, o ecossistema Ultralytics oferece o caminho mais rápido de um conjunto de dados bruto a um modelo de produção implantado. Seja usando o comprovado YOLOv5 ou migrando para o avançado YOLO26, os desenvolvedores se beneficiam de um framework projetado para tornar a IA de visão acessível, eficiente e altamente performática.

Comentários