YOLOX vs YOLO11#
A evolução da visão computacional tem sido fortemente impulsionada pela procura de frameworks de deteção de objetos em tempo real que equilibrem elevada precisão e velocidade de inferência. Entre os marcos mais importantes desta jornada estão o YOLOX e o Ultralytics YOLO11. Embora ambos os modelos tenham contribuído significativamente para a área, as suas arquiteturas subjacentes, filosofias de design e ecossistemas de desenvolvimento diferem substancialmente.
Esta comparação técnica abrangente analisa as suas arquiteturas, métricas de desempenho, metodologias de treino e cenários ideais de implementação para te ajudar a tomar uma decisão informada para o teu próximo projeto de inteligência artificial.
Visão geral do YOLOX#
Apresentado pelos investigadores Zheng Ge, Songtao Liu, Feng Wang, Zeming Li e Jian Sun, da Megvii, em 18 de julho de 2021, o YOLOX representou uma mudança significativa na série YOLO. Conseguiu colmatar a lacuna entre a investigação académica e a aplicação industrial ao introduzir um design sem âncoras.
Para obteres mais contexto técnico, podes consultar o artigo original do YOLOX no Arxiv.
Principais características arquiteturais#
O YOLOX afastou-se da deteção tradicional baseada em âncoras ao adotar uma cabeça desacoplada e um mecanismo sem âncoras. Este design reduziu o número de parâmetros de design e melhorou o desempenho do modelo em vários benchmarks. Além disso, introduziu estratégias avançadas de atribuição de etiquetas, como a SimOTA, para acelerar o processo de treino e melhorar a convergência.
Embora o YOLOX ofereça uma excelente precisão para a sua época, concentra-se principalmente na deteção de objetos com caixas delimitadoras e não oferece suporte nativo imediato para outras tarefas complexas de visão.
Ao eliminar as caixas de âncora predefinidas, o YOLOX reduziu drasticamente o ajuste heurístico necessário para diferentes conjuntos de dados, tornando-se uma forte referência para a investigação de metodologias sem âncoras.
Visão geral do Ultralytics YOLO11#
Lançado em 27 de setembro de 2024 por Glenn Jocher e Jing Qiu, da Ultralytics, o YOLO11 é um modelo de última geração que redefine a versatilidade e a facilidade de utilização na visão computacional. Desenvolvido com base em anos de investigação, oferece uma solução altamente refinada e pronta para produção, com excelente desempenho numa grande variedade de tarefas.
A vantagem da Ultralytics#
O YOLO11 não é apenas um detetor de objetos; é um framework unificado que suporta segmentação de instâncias, classificação de imagens, estimativa de pose e deteção de caixas delimitadoras orientadas (OBB). Apresenta uma arquitetura altamente eficiente que prioriza um equilíbrio harmonioso entre velocidade, número de parâmetros e precisão.
Além disso, o YOLO11 está totalmente integrado na Ultralytics Platform, que fornece um ecossistema simplificado para anotação de dados, treino de modelos e implementação.
Comparação de desempenho e métricas#
Ao comparar estes modelos, o equilíbrio de desempenho torna-se evidente. O YOLO11 alcança uma precisão média (mAP) superior, com significativamente menos parâmetros e FLOPs na maioria das categorias de tamanho, em comparação com os seus equivalentes YOLOX.
| Modelo | tamanho (píxeis) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
Como demonstrado, os modelos YOLO11 superam consistentemente o YOLOX em precisão, mantendo uma quantidade de parâmetros mais reduzida. Por exemplo, o YOLO11m alcança 51.5 mAP com apenas 20.1M parâmetros, enquanto o YOLOXx alcança uma precisão semelhante de 51.1 mAP, mas requer uns impressionantes 99.1M parâmetros. Esta eficiência de memória durante o treino e a inferência torna o YOLO11 altamente adequado para implementação em dispositivos de IA de edge, evitando os elevados requisitos de memória CUDA típicos de modelos mais antigos ou baseados em Transformer, como o RT-DETR.
Os modelos Ultralytics requerem significativamente menos memória GPU durante o treino em comparação com o YOLOX e arquiteturas baseadas em Transformer, permitindo que os investigadores treinem modelos avançados em hardware de consumo convencional.
Ecossistema e facilidade de utilização#
Uma das diferenças mais marcantes entre os dois frameworks está na experiência de desenvolvimento.
O YOLOX exige frequentemente a clonagem de repositórios, a configuração de ambientes complexos e a execução de argumentos detalhados na linha de comandos para treinar e exportar modelos para formatos como ONNX ou TensorRT.
Em forte contraste, o Ultralytics YOLO11 oferece uma API Python e uma CLI incrivelmente simples. A biblioteca Ultralytics trata automaticamente do aumento de dados, do ajuste de hiperparâmetros e da exportação.
from ultralytics import YOLO
# Load a pretrained YOLO11 model
model = YOLO("yolo11n.pt")
# Train the model effortlessly on custom data
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained model to TensorRT for optimized deployment
model.export(format="engine")Este ecossistema bem mantido é apoiado por uma documentação abrangente e por uma integração simples com ferramentas como Weights & Biases para acompanhamento de experiências.
Casos de Utilização Ideais#
A escolha entre estes modelos depende frequentemente das especificidades do ambiente de implementação.
Quando utilizar o YOLOX#
- Sistemas legados: Se tens um pipeline consolidado explicitamente desenvolvido em torno do framework MegEngine ou dos paradigmas de deteção de objetos do início de 2021.
- Referências académicas: Quando realizas investigação que exige uma comparação direta com arquiteturas fundamentais sem âncoras da era de 2021.
Quando utilizar o YOLO11#
- Implementações em produção: Para aplicações comerciais em retalho inteligente ou sistemas de alarme de segurança, onde código robusto e mantido, bem como elevada precisão, são indispensáveis.
- Pipelines multitarefa: Quando um projeto exige o rastreamento de objetos, a estimativa de poses humanas e a segmentação de instâncias através de um único framework unificado.
- Dispositivos edge com recursos limitados: Graças ao seu baixo número de parâmetros e elevado débito, o YOLO11 é ideal para implementação em Raspberry Pi ou nós edge móveis através de CoreML e NCNN.
O futuro: a vantagem do YOLO26#
Embora o YOLO11 represente um enorme avanço em relação ao YOLOX, a área da visão computacional está a evoluir rapidamente. Para os programadores que iniciam novos projetos atualmente, o Ultralytics YOLO26 é a recomendação definitiva.
Lançado em janeiro de 2026, o YOLO26 aproveita a excelência arquitetural do YOLO11 e introduz várias funcionalidades inovadoras:
- Design Sem NMS de Ponta a Ponta: O YOLO26 elimina o pós-processamento de Supressão Não Máxima (NMS) para pipelines de implantação mais rápidos e simples (um conceito explorado pela primeira vez no YOLOv10).
- Inferência em CPU até 43% mais rápida: Ao remover a Perda Focal de Distribuição (DFL), o YOLO26 é muito mais eficiente em CPUs e dispositivos edge de baixo consumo.
- Otimizador MuSGD: Inspirado nas inovações de treino de LLM da Moonshot AI, o otimizador MuSGD garante execuções de treino altamente estáveis e uma convergência rápida.
- Funções de perda avançadas: Utilizando ProgLoss + STAL, o YOLO26 alcança melhorias notáveis no reconhecimento de objetos pequenos, algo essencial para imagens captadas por drones e robótica autónoma.
Para a grande maioria das tarefas modernas de visão computacional, atualizar o teu pipeline para tirar partido do YOLO26 proporcionará o melhor equilíbrio possível entre velocidade, precisão e simplicidade de implementação.