Ultralytics YOLO27:
Get Started

YOLOv10 vs YOLO26#

O panorama da visão computacional registou avanços notáveis nos últimos anos, passando de arquiteturas complexas e dependentes do pós-processamento para modelos ponta a ponta simplificados. Esta comparação técnica analisa dois marcos importantes deste percurso: o avanço académico do YOLOv10 e o YOLO26 de ponta, pronto para utilização empresarial. Ao examinar as respetivas arquiteturas, metodologias de treino e capacidades de implementação no mundo real, os programadores podem tomar decisões informadas ao desenvolver a sua próxima aplicação de IA de visão.

YOLOv10: Pioneiro na deteção de objetos ponta a ponta#

Lançado em meados de 2024, o YOLOv10 representou um avanço significativo na investigação académica em visão computacional ao abordar um dos obstáculos mais persistentes na deteção de objetos em tempo real: a supressão não máxima (NMS). Os detetores de objetos tradicionais dependiam fortemente da NMS para filtrar caixas delimitadoras redundantes, acrescentando latência variável durante a inferência e complicando a implementação em dispositivos de borda.

A equipa da Universidade Tsinghua introduziu uma estratégia consistente de atribuição dupla para o treino sem NMS. Esta estratégia permitiu ao modelo prever caixas delimitadoras com precisão sem precisar de uma etapa de filtragem de pós-processamento, melhorando diretamente a latência de inferência e facilitando a implementação em aceleradores de hardware. Embora seja muito eficiente para tarefas de deteção convencionais, o modelo centrava-se sobretudo na previsão de caixas delimitadoras e não oferecia suporte nativo para tarefas mais complexas, como segmentação de instâncias ou estimativa de pose.

Sabe mais sobre o YOLOv10

YOLO26: O novo padrão para IA de visão na borda e na nuvem#

Com base nos conceitos sem NMS introduzidos anteriormente, o recém-lançado YOLO26 representa o auge do desempenho e da versatilidade. Concebido tanto para a investigação académica como para implementações de nível empresarial, oferece um design ponta a ponta sem NMS através de uma cabeça opcional um para um (nms=False) que ignora o pós-processamento NMS para permitir implementações mais rápidas e simples em todo o hardware suportado.

O YOLO26 introduz várias melhorias arquitetónicas revolucionárias. A remoção de Distribution Focal Loss (DFL) simplifica significativamente o processo de exportação do modelo e melhora a compatibilidade com dispositivos de borda de baixo consumo. Com estas alterações estruturais, o YOLO26 alcança uma inferência na CPU até 43% mais rápida, o que o torna uma opção excecional para aplicações de IoT e robótica em que a aceleração por GPU pode não estar disponível.

A estabilidade do treino e a velocidade de convergência foram também revolucionadas com o otimizador MuSGD, um híbrido de SGD e Muon inspirado em técnicas de treino de LLMs. Em conjunto com funções de perda avançadas como ProgLoss + STAL, o YOLO26 apresenta melhorias notáveis no reconhecimento de objetos pequenos. Inclui também melhorias específicas para cada tarefa, como prototipagem multiescala para segmentação, estimativa de log-verosimilhança residual (RLE) para estimativa de pose e uma função de perda angular especializada para resolver problemas de fronteira na deteção com caixas delimitadoras orientadas (OBB).

Implementação empresarial

Para as equipas que pretendem expandir os seus fluxos de trabalho de visão computacional, a Plataforma Ultralytics oferece integração simples com o YOLO26, com anotação intuitiva de dados, treino automatizado na nuvem e opções de implementação com um só clique, sem exigir uma infraestrutura MLOps extensa.

Comparação técnica do desempenho#

Ao avaliar estes modelos, é essencial considerar o equilíbrio entre a precisão, o tamanho do modelo e a velocidade de inferência. A tabela abaixo destaca o desempenho das duas famílias de modelos em várias escalas, avaliado no conjunto de dados COCO padrão.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

Os dados demonstram claramente a vantagem evolutiva da arquitetura mais recente. O YOLO26 alcança uma precisão média (mAP) superior em todas as classes de tamanho, mantendo velocidades de inferência altamente competitivas. A remoção de DFL no YOLO26 contribui especificamente para o seu desempenho excecional de ONNX na CPU, uma métrica que frequentemente representava um desafio para as gerações anteriores.

Metodologias de treinamento e ecossistema#

Um modelo só é tão útil quanto o ecossistema que o suporta. Embora o YOLOv10 disponibilizasse uma excelente implementação académica baseada em PyTorch, muitas vezes exige configuração manual para tarefas que vão além da deteção básica.

Em contrapartida, o YOLO26 está totalmente integrado no ecossistema bem mantido da Ultralytics. Isto garante requisitos de memória significativamente inferiores durante o treino, em comparação com modelos baseados em Transformer como o RT-DETR, permitindo aos investigadores treinar redes de ponta em hardware de consumo. A facilidade de utilização é incomparável: a API unificada trata automaticamente do aumento de dados, do ajuste de hiperparâmetros e do registo.

Exemplo de código: Treinar o YOLO26#

Para treinar um modelo versátil e altamente preciso, bastam algumas linhas de código Python:

from ultralytics import YOLO

# Carrega o modelo YOLO26 pequeno e altamente otimizado
model = YOLO("yolo26s.pt")

# Treina o modelo de forma eficiente com gestão automática da memória
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
)

# Exporta para TensorRT a cabeça um para um sem NMS
model.export(format="engine", nms=False)

Aplicações e casos de uso no mundo real#

A escolha da arquitetura certa depende totalmente das restrições de implantação.

Computação de borda de alta velocidade#

Para aplicações que exigem implantação rápida em microcontroladores, robótica ou dispositivos móveis antigos, a inferência na CPU até 43% mais rápida do YOLO26 faz dele a escolha definitiva. Sua arquitetura sem NMS e sem DFL converte-se perfeitamente para formatos como OpenVINO e TensorRT, ideais para análise de vídeo em tempo real em infraestruturas de cidades inteligentes.

Visão avançada multitarefa#

Embora o YOLOv10 se destaque na detecção pura de caixas delimitadoras, projetos que exigem uma compreensão visual rica devem contar com o YOLO26. Da segmentação de instâncias em imagens médicas à estimativa de pose precisa para análise esportiva, o YOLO26 oferece funções de perda específicas para cada tarefa que garantem precisão superior em diversos domínios.

Opções alternativas

Se o seu projeto exige detecção robusta de vocabulário aberto, considere explorar o YOLO-World. Para quem mantém pipelines legados, o YOLO11 continua sendo uma alternativa poderosa e totalmente compatível com o framework Ultralytics.

Casos de uso e recomendações#

A escolha entre YOLOv10 e YOLO26 depende dos requisitos específicos do seu projeto, das restrições de implantação e das preferências de ecossistema.

Quando escolher o YOLOv10#

O YOLOv10 é uma ótima opção para:

  • Detecção em tempo real sem NMS: Aplicações que se beneficiam da detecção de ponta a ponta sem supressão não máxima, reduzindo a complexidade da implantação.
  • Equilíbrio entre velocidade e precisão: Projetos que exigem um bom equilíbrio entre velocidade de inferência e precisão de detecção em várias escalas de modelo.
  • Aplicações com latência consistente: Cenários de implantação nos quais tempos de inferência previsíveis são essenciais, como em robótica ou sistemas autônomos.

Quando escolher o YOLO26#

O YOLO26 é recomendado para:

  • Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.

Conclusão#

A transição do YOLOv10 para o YOLO26 destaca uma mudança crucial: da prova de conceito acadêmica para soluções empresariais prontas para produção. Ao adotar o pioneiro design sem NMS e aprimorá-lo com o otimizador MuSGD, o ProgLoss e uma compatibilidade simplificada com dispositivos de borda, o YOLO26 estabelece um novo padrão para o que é possível na visão computacional em tempo real. Para desenvolvedores que buscam o melhor equilíbrio entre velocidade, precisão e usabilidade, o YOLO26 se destaca como a recomendação definitiva.

Colaboradores

Comentários