Ultralytics YOLO27:
Get Started

YOLOX vs YOLOv10#

A evolução dos modelos de visão computacional em tempo real foi marcada por grandes saltos arquitetônicos. Dois marcos fundamentais nessa trajetória são YOLOX e YOLOv10. Lançado em 2021, YOLOX aproximou com sucesso a pesquisa acadêmica da aplicação industrial ao apresentar um design sem âncoras altamente eficaz. Três anos depois, YOLOv10 revolucionou o campo ao eliminar a necessidade de supressão não máxima (NMS) durante o pós-processamento, ampliando os limites da eficiência e da velocidade.

Esta comparação técnica abrangente explora as arquiteturas, as métricas de desempenho e os casos de uso ideais dos dois modelos, oferecendo informações para ajudar você a escolher a ferramenta certa para seu próximo projeto de detecção de objetos.

Origens e metadados dos modelos#

Entender as origens desses modelos ajuda a contextualizar suas escolhas arquitetônicas e os ambientes de implantação pretendidos.

Detalhes do YOLOX

Saiba mais sobre o YOLOX

Detalhes do YOLOv10

Sabe mais sobre o YOLOv10

Inovações arquiteturais#

As principais diferenças entre YOLOX e YOLOv10 estão na forma como lidam com as previsões de caixas delimitadoras e o pós-processamento.

YOLOX: pioneiro no design sem âncoras#

YOLOX chamou a atenção ao levar a família YOLO para uma arquitetura sem âncoras. Ao prever o centro de um objeto, em vez de depender de caixas-âncora predefinidas, YOLOX reduziu drasticamente o número de parâmetros de design e os ajustes heurísticos necessários para conjuntos de dados personalizados. Além disso, introduziu uma cabeça desacoplada, separando as tarefas de classificação e regressão em caminhos distintos. Essa abordagem resolveu o conflito entre identificar o que é um objeto e determinar onde ele está, levando a um aumento perceptível na velocidade de convergência e na precisão.

YOLOv10: a revolução sem NMS#

Embora YOLOX tenha simplificado a cabeça de detecção, ainda dependia de NMS para filtrar previsões redundantes de caixas delimitadoras. YOLOv10 enfrentou esse gargalo fundamental. Ao utilizar atribuições duplas consistentes durante o treinamento, YOLOv10 realiza detecção ponta a ponta nativamente. O modelo usa uma cabeça one-to-many durante o treinamento para garantir sinais de supervisão ricos e uma cabeça one-to-one durante a inferência para gerar diretamente as previsões finais. Esse design abrangente, que equilibra eficiência e precisão, elimina completamente a NMS e reduz significativamente a latência de inferência em chips embarcados.

O impacto da remoção da NMS

A supressão não máxima costuma ser uma operação complexa de acelerar em unidades de processamento neural (NPUs). Ao removê-la, YOLOv10 permite que todo o grafo do modelo seja executado sem interrupções em hardware especializado, melhorando drasticamente a compatibilidade com frameworks de otimização como OpenVINO e TensorRT.

Métricas de desempenho e comparação#

Ao avaliar modelos para produção, é fundamental equilibrar a precisão com a sobrecarga computacional. A tabela abaixo ilustra as compensações entre várias escalas de YOLOX e YOLOv10.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4

Análise dos Dados#

As métricas demonstram claramente o salto geracional de YOLOv10. Por exemplo, YOLOv10-S alcança uma precisão média média de 46,3%, em comparação com 46,9% do YOLOX-m, mas usa menos de um terço dos parâmetros (7,2M contra 25,3M) e muito menos FLOPs. Além disso, o modelo de ponta YOLOv10-X eleva o mAP a 54,4%, tornando-o altamente competitivo em tarefas que exigem precisão, sem deixar de ser mais rápido que a arquitetura mais antiga YOLOX-x.

A vantagem do ecossistema Ultralytics#

Embora YOLOX continue sendo uma implementação de pesquisa robusta e de código aberto, adotar YOLOv10 oferece acesso imediato ao ecossistema bem mantido fornecido pela Ultralytics. Escolher um modelo compatível com a Ultralytics garante uma experiência simplificada, caracterizada por uma API simples e documentação abrangente.

Os desenvolvedores se beneficiam bastante dos baixos requisitos de memória do framework; treinar modelos da Ultralytics normalmente consome muito menos memória CUDA do que alternativas pesadas baseadas em Transformer, como RT-DETR. Esse baixo consumo durante o treinamento permite usar tamanhos de lote maiores em hardware para consumidores, acelerando o caminho da coleta de dados à implantação do modelo. Além disso, o framework oferece versatilidade incomparável, permitindo que os usuários alternem facilmente entre detecção de objetos, segmentação de instâncias e estimativa de pose com alterações mínimas no código.

Exemplo de treinamento e inferência#

A API unificada permite validar ideias com enorme rapidez. O trecho de código a seguir demonstra como é fácil treinar e implantar um modelo YOLOv10 usando o backend PyTorch:

from ultralytics import YOLO

# Carrega um modelo nano YOLOv10 pré-treinado
model = YOLO("yolov10n.pt")

# Treina o modelo com o conjunto de dados COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Executa inferência em uma imagem de exemplo
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# Exportar o modelo para implementação edge
model.export(format="engine", quantize=16)

Com as rotinas de exportação integradas, converter modelos para formatos como TensorRT ou ONNX exige apenas uma linha de código, eliminando completamente as complexidades da compilação.

Casos de uso e cenários de implantação ideais#

A escolha entre essas arquiteturas depende, em grande medida, das limitações do seu hardware e dos requisitos específicos do domínio.

Análise de vídeo em tempo real#

Para aplicações que exigem latência ultrabaixa, como direção autônoma ou monitoramento de tráfego em tempo real, YOLOv10 é a melhor opção. Seu design ponta a ponta sem NMS garante tempos de execução determinísticos, essenciais para sistemas de segurança que não podem tolerar latência variável no pós-processamento. Os modelos alcançam facilmente altas taxas de quadros em dispositivos como os da série NVIDIA Jetson.

Referências acadêmicas e microcontroladores de borda#

YOLOX ainda tem valor em contextos acadêmicos nos quais pesquisadores querem uma referência limpa com cabeça desacoplada para experimentar estratégias de atribuição de rótulos. Além disso, o excepcionalmente pequeno YOLOX-Nano (com menos de 1 milhão de parâmetros) pode ser instalado em dispositivos de borda com recursos muito limitados e pouca memória, desde que o hardware seja compatível com operações de convolução padrão.

O padrão definitivo: Ultralytics YOLO26#

Embora YOLOv10 tenha representado um grande salto ao remover a NMS, o campo da visão computacional avança rapidamente. Para desenvolvedores que buscam implementar hoje o melhor desempenho da categoria, recomendamos explorar o YOLO26.

Lançado como o mais novo padrão em IA de visão, YOLO26 aproveita as ideias fundamentais de seus antecessores e as potencializa. Ele oferece o equilíbrio definitivo de desempenho e oferece suporte nativo à detecção, segmentação, pose e caixas delimitadoras orientadas.

Veja por que YOLO26 é a opção recomendada para pipelines modernos de visão computacional:

  • Design ponta a ponta sem NMS: Com base nos avanços do YOLOv10, YOLO26 oferece suporte à inferência ponta a ponta nativa (nms=False), proporcionando tempos de inferência mais rápidos e determinísticos, sem os gargalos do pós-processamento com NMS.
  • Inferência na CPU até 43% mais rápida: O modelo é otimizado especificamente para computação de borda, garantindo desempenho excepcional em processadores móveis e dispositivos sem GPUs dedicadas.
  • Otimizador MuSGD: Inspirado no treinamento de modelos de linguagem grandes (especificamente no Kimi K2, da Moonshot AI), YOLO26 utiliza uma combinação de SGD e Muon para obter treinamento extremamente estável e convergência rápida.
  • ProgLoss + STAL: Essas funções de perda avançadas proporcionam melhorias notáveis no reconhecimento de objetos pequenos, essencial em domínios exigentes como imagens aéreas e navegação de drones.
  • Remoção de DFL: Ao remover a perda focal de distribuição, YOLO26 simplifica o grafo do modelo para facilitar a exportação para dispositivos de borda e de baixo consumo.
  • Melhorias específicas para cada tarefa: Quer você use a estimativa residual de log-verossimilhança (RLE) para estimativa de pose ou uma perda de ângulo especializada para OBB, YOLO26 é ajustado para cada uma das principais tarefas de visão.

Para desenvolvedores prontos para atualizar seus pipelines com as ferramentas de treinamento e implantação mais eficientes disponíveis, migrar para a Ultralytics Platform e aproveitar YOLO26 garante que você permaneça na vanguarda da inteligência artificial. Usuários interessados em arquiteturas mais antigas, mas estáveis, também podem avaliar YOLO11 ou YOLOv8, que contam com amplo suporte da comunidade e robustez comprovada.

Comentários