Ultralytics YOLO27:
Get Started

YOLOX vs. YOLOv7#

A evolução da detecção de objetos em tempo real foi impulsionada por avanços contínuos na arquitetura. Dois marcos importantes nessa trajetória são o YOLOX e o YOLOv7. Lançados com menos de um ano de diferença, ambos os modelos introduziram novas abordagens ao paradigma padrão de detecção de objetos, melhorando significativamente o equilíbrio entre velocidade e precisão.

Esta página apresenta uma análise técnica aprofundada do YOLOX e do YOLOv7, comparando suas arquiteturas, métricas de desempenho e casos de uso ideais para ajudar os desenvolvedores a escolher a ferramenta certa para suas implantações de visão computacional.

YOLOX: pioneiro na detecção sem âncoras#

Apresentado por pesquisadores da Megvii em julho de 2021, o YOLOX representou uma grande mudança ao abandonar os designs tradicionais baseados em âncoras. Ao aproximar a pesquisa acadêmica da aplicação industrial, o YOLOX simplificou a cabeça de detecção e melhorou o desempenho geral.

Principais detalhes do modelo:

Inovações arquiteturais#

O YOLOX introduziu uma abordagem sem âncoras, que reduziu drasticamente o número de parâmetros de design e os ajustes heurísticos necessários para conjuntos de dados personalizados. O modelo implementou uma cabeça desacoplada, separando as tarefas de classificação e regressão, o que melhorou a velocidade de convergência e a precisão. Além disso, o YOLOX utilizou estratégias avançadas de aumento de dados, como MixUp e Mosaic, para aumentar a robustez do modelo.

Saiba mais sobre o YOLOX

Vantagem de não usar âncoras

Ao eliminar as caixas de âncora, o YOLOX reduz a sobrecarga computacional do cálculo da interseção sobre união (IoU) entre as previsões e as referências reais durante o treinamento, o que resulta em menores requisitos de memória CUDA e tempos de treinamento mais curtos.

YOLOv7: conjunto de recursos gratuitos treináveis#

Lançado em julho de 2022 por pesquisadores do Institute of Information Science da Academia Sinica, em Taiwan, o YOLOv7 ampliou ainda mais os limites da detecção de objetos em tempo real. O modelo introduziu o conceito de "conjunto de recursos gratuitos treinável", estabelecendo novos benchmarks de última geração no conjunto de dados MS COCO quando foi lançado.

Principais detalhes do modelo:

Inovações arquiteturais#

A arquitetura do YOLOv7 é baseada na Extended Efficient Layer Aggregation Network (E-ELAN), que permite ao modelo aprender continuamente características mais diversificadas sem degradar o caminho do gradiente. Além disso, o YOLOv7 utilizou técnicas de reparametrização do modelo, permitindo simplificar redes complexas de treinamento com múltiplas ramificações em redes mais rápidas de caminho único durante a inferência.

Saiba mais sobre o YOLOv7

Comparação de desempenho#

Ao avaliar esses modelos para aplicações reais, é fundamental entender o desempenho deles em diferentes escalas. A tabela abaixo compara as métricas padrão de vários tamanhos de YOLOX e YOLOv7.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Análise#

  • Precisão: O YOLOv7 geralmente alcança um mAP superior ao dos modelos YOLOX equivalentes. Por exemplo, o YOLOv7x alcança 53.1 mAP, em comparação com 51.1 do YOLOXx.
  • Velocidade: Embora ambos os modelos sejam altamente otimizados para execução na GPU usando TensorRT, a arquitetura E-ELAN do YOLOv7 oferece uma taxa de transferência ligeiramente melhor para aplicações de ponta, enquanto o YOLOX mantém uma latência excelente em dispositivos de borda menores.
  • Versatilidade: O YOLOv7 ampliou seu repertório para além das caixas delimitadoras, oferecendo nativamente pesos para segmentação de instâncias e estimativa de pose, tornando-se mais versátil do que o repositório base do YOLOX.

Aplicações no mundo real#

A escolha entre esses modelos muitas vezes depende do teu ambiente específico de implantação.

Computação de borda e IoT#

Para dispositivos de borda com recursos limitados, como o Raspberry Pi, ou para processadores móveis mais antigos, YOLOX-Nano e YOLOX-Tiny são opções muito atraentes. A quantidade mínima de parâmetros e a natureza sem âncoras desses modelos facilitam a implantação em ambientes de baixo consumo de energia para tarefas como rastreamento básico de movimento ou aplicações de campainhas inteligentes.

Análise de vídeo de alta fidelidade#

Para processar fluxos de alta resolução em tarefas de detecção de defeitos industriais ou monitoramento de tráfego denso, o YOLOv7 é superior. Sua agregação robusta de características permite manter alta precisão mesmo quando os objetos estão parcialmente ocluídos ou variam muito de escala.

Casos de uso e recomendações#

A escolha entre YOLOX e YOLOv7 depende dos requisitos específicos do teu projeto, das restrições de implantação e das preferências de ecossistema.

Quando escolher o YOLOX#

O YOLOX é uma ótima opção para:

  • Investigação em deteção sem âncoras: Investigação académica que utiliza a arquitetura simples e sem âncoras do YOLOX como referência para experimentar novas cabeças de deteção ou funções de perda.
  • Dispositivos de borda ultraleves: Implementações em microcontroladores ou hardware móvel legado, onde o tamanho extremamente reduzido da variante YOLOX-Nano (0,91 milhões de parâmetros) é essencial.
  • Estudos sobre atribuição de rótulos SimOTA: Projetos de investigação que analisam estratégias de atribuição de rótulos baseadas em transporte ótimo e o seu impacto na convergência do treino.

Quando escolher o YOLOv7#

O YOLOv7 é recomendado para:

  • Benchmarking acadêmico: reproduzir resultados de ponta de 2022 ou estudar os efeitos do E-ELAN e das técnicas de conjunto treinável de vantagens gratuitas.
  • Pesquisa sobre reparametrização: investigar convoluções reparametrizadas planejadas e estratégias de escalabilidade composta de modelos.
  • Pipelines personalizados existentes: projetos com pipelines altamente personalizados, construídos em torno da arquitetura específica do YOLOv7, que não podem ser refatorados facilmente.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência para desenvolvedores:

  • Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.

A vantagem da Ultralytics#

Embora YOLOX e YOLOv7 sejam implementações de pesquisa poderosas, passar de um repositório de pesquisa para um ambiente de produção escalável pode ser complicado. É aí que a Ultralytics Platform se destaca.

Os modelos Ultralytics oferecem uma API unificada do Python, tratando o treinamento, a validação e a implantação de modelos como tarefas simplificadas e padronizadas. Você evita o incômodo de gerenciar dependências complexas de terceiros ou operadores personalizados de C++, comuns em arquiteturas mais antigas.

Além disso, os modelos Ultralytics YOLO exigem significativamente menos memória CUDA durante o treinamento do que detectores baseados em Transformer, como o RT-DETR. Isso permite que os profissionais usem tamanhos de lote maiores, estabilizando o treinamento e acelerando a convergência em conjuntos de dados personalizados.

Integrações compatíveis

A Ultralytics oferece suporte nativo à exportação de modelos para formatos padrão do setor, como ONNX, OpenVINO e CoreML, com um único argumento format, simplificando bastante o processo de implantação do modelo.

Exemplo de código: treinamento com Ultralytics#

O pacote Python da Ultralytics não treina nem executa nativamente checkpoints .pt do YOLOv7 (a documentação do YOLOv7 mostra como executar modelos ONNX ou TensorRT exportados), mas arquiteturas mais recentes, como o YOLO26, podem ser carregadas, treinadas e executadas com apenas algumas linhas de código.

from ultralytics import YOLO

# Carrega um modelo YOLO26 pré-treinado
model = YOLO("yolo26n.pt")

# Treina o modelo em um conjunto de dados personalizado (por exemplo, COCO8)
# A API gerencia automaticamente o carregamento de dados, o aumento de dados e a memória
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Executa a inferência em uma imagem de teste
predictions = model("path/to/image.jpg")
predictions[0].show()

O futuro: Ultralytics YOLO26#

Embora YOLOv7 e YOLOX representem etapas históricas importantes, o estado da arte evolui rapidamente. Lançado em janeiro de 2026, o Ultralytics YOLO26 introduz paradigmas inovadores que superam os modelos anteriores.

  • Design ponta a ponta sem NMS: a cabeça opcional um para um do YOLO26 (nms=False) dispensa o pós-processamento de supressão não máxima (NMS). Isso reduz drasticamente os gargalos de latência e garante tempos de execução determinísticos em diferentes configurações de hardware.
  • Inferência na CPU até 43% mais rápida: ao remover a perda focal de distribuição (DFL) e otimizar a profundidade da rede, o YOLO26 é altamente adaptado para dispositivos de borda sem hardware dedicado de GPU.
  • Otimizador MuSGD: inspirado em técnicas avançadas de treinamento de LLM, o otimizador MuSGD — um híbrido de SGD e Muon — oferece estabilidade excepcional de treinamento e convergência mais rápida.
  • Detecção aprimorada de objetos pequenos: a integração das funções de perda ProgLoss + STAL proporciona melhorias significativas no reconhecimento de objetos pequenos e distantes, algo crucial para o mapeamento por drones e a vigilância de segurança.
  • Suporte nativo a tarefas: o YOLO26 oferece suporte abrangente a caixas delimitadoras orientadas (OBB), segmentação de instâncias e estimativa de pose, nativamente na mesma API simplificada.

Para qualquer desenvolvedor que esteja começando hoje um novo projeto de visão computacional, recomenda-se avaliar o Ultralytics YOLO26 na Platform para alcançar o melhor equilíbrio entre velocidade, precisão e simplicidade de implantação. Para quem está migrando de gerações anteriores, como o YOLO11 ou o YOLOv8, basta alterar a string do modelo para desbloquear imediatamente recursos superiores.

Colaboradores

Comentários