Ultralytics YOLO27:

Comparação entre YOLOv10 e DAMO-YOLO#

Ao criar pipelines modernos de visão computacional, selecionar a arquitetura certa de detecção de objetos em tempo real é essencial. Nesta análise técnica abrangente, exploramos as arquiteturas, as métricas de desempenho e os casos de uso ideais do YOLOv10 e do DAMO-YOLO. Ambos os modelos representam avanços significativos nas capacidades de detecção de objetos, mas seguem caminhos arquiteturais diferentes para alcançar os seus objetivos.

Quer o seu projeto exija implementação em hardware de IA de borda com recursos limitados, quer exija a máxima precisão em GPUs na cloud, compreender as particularidades destas arquiteturas ajudará você a tomar uma decisão informada.

Explorando o YOLOv10#

Apresentado por investigadores da Universidade de Tsinghua, o YOLOv10 revolucionou a família YOLO ao introduzir uma abordagem nativamente de ponta a ponta, eliminando efetivamente a necessidade de supressão não máxima (NMS) durante o pós-processamento.

Detalhes do YOLOv10:

Principais características arquiteturais#

A principal inovação do YOLOv10 é a sua estratégia de Atribuições Duplas Consistentes para treinamento sem NMS. Os detetores de objetos tradicionais dependem fortemente de NMS para filtrar caixas delimitadoras sobrepostas, o que introduz uma latência imprevisível — um gargalo significativo para aplicações em tempo real, como veículos autónomos e robótica de alta velocidade. Ao prever diretamente uma única caixa delimitadora ideal por objeto, o YOLOv10 alcança uma inferência previsível e com latência ultrabaixa.

Além disso, o modelo utiliza um Design Holístico Orientado para a Eficiência e a Precisão. A arquitetura otimiza vários componentes, incluindo uma cabeça de classificação leve e uma subamostragem desacoplada espacialmente e por canais, o que reduz significativamente a redundância computacional. O resultado é uma arquitetura com menos parâmetros e menos FLOPs, mantendo uma precisão média (mAP) competitiva.

Exportação simplificada para produção

Como o YOLOv10 remove as operações de NMS do grafo de inferência, exportar o modelo para formatos como ONNX ou TensorRT é muito mais simples, tornando-o especialmente adequado para implementações na borda.

Sabe mais sobre o YOLOv10

Exemplo de utilização#

O YOLOv10 está profundamente integrado no ecossistema da Ultralytics, o que torna a sua utilização através do pacote Python da Ultralytics extremamente fácil.

from ultralytics import YOLO

# Load a pre-trained YOLOv10 nano model
model = YOLO("yolov10n.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")

# Export the model to TensorRT format
model.export(format="engine", quantize=16)

Explorando o DAMO-YOLO#

Desenvolvido pelo Alibaba Group, o DAMO-YOLO concentra-se na descoberta de estruturas de rede altamente eficientes através da Pesquisa de Arquitetura Neural (NAS) automatizada, com o objetivo de expandir a fronteira de Pareto entre velocidade e precisão.

Detalhes do DAMO-YOLO:

Principais características arquiteturais#

O DAMO-YOLO introduz várias tecnologias inovadoras adaptadas para aplicações industriais. A base do modelo é o seu MAE-NAS Backbone, gerado por meio de uma busca guiada por entropia máxima. Este processo automatizado descobre estruturas de backbone que aderem rigorosamente a orçamentos computacionais predefinidos, alcançando um equilíbrio refinado entre precisão e latência de inferência.

Além disso, a arquitetura utiliza um neck Efficient RepGFPN. Esta rede de pirâmide de características foi concebida para melhorar a fusão de características entre diferentes escalas, algo essencial para tarefas complexas, como a análise de imagens aéreas, em que os objetos variam drasticamente de tamanho. Para complementar esta abordagem, o DAMO-YOLO implementa um ZeroHead, uma cabeça de deteção minimalista que reduz drasticamente a complexidade das camadas finais de predição, poupando tempo de computação valioso durante a inferência.

Learn more about DAMO-YOLO

Comparação de desempenho#

Ao avaliar arquiteturas de deteção de objetos, é fundamental encontrar o equilíbrio certo entre velocidade de inferência, eficiência de parâmetros e precisão de deteção. A tabela abaixo compara o desempenho do YOLOv10 e do DAMO-YOLO nos respetivos tamanhos de modelo.

Modelotamanho
(píxeis)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Como observado nos benchmarks, o YOLOv10 proporciona consistentemente excelentes perfis de latência no TensorRT, especialmente na sua variante nano, exigindo significativamente menos parâmetros e FLOPs do que os modelos comparáveis do DAMO-YOLO. Embora o DAMO-YOLO ofereça um mAP sólido na sua variante tiny, a eficiência de parâmetros e a latência de inferência da família YOLOv10 proporcionam uma vantagem distinta em ambientes de implementação com recursos limitados.

Casos de uso e recomendações#

A escolha entre YOLOv10 e DAMO-YOLO depende dos requisitos específicos do seu projeto, das restrições de implementação e das suas preferências de ecossistema.

Quando escolher o YOLOv10#

O YOLOv10 é uma escolha sólida para:

  • Detecção em tempo real sem NMS: Aplicações que se beneficiam da detecção de ponta a ponta sem Supressão de Não-Máximos, reduzindo a complexidade da implantação.
  • Equilíbrio entre velocidade e precisão: Projetos que exigem um equilíbrio sólido entre velocidade de inferência e precisão de detecção em diferentes escalas de modelo.
  • Aplicações com latência consistente: Cenários de implantação nos quais tempos de inferência previsíveis são essenciais, como em robótica ou sistemas autônomos.

Quando escolher o DAMO-YOLO#

O DAMO-YOLO é recomendado para:

  • Análise de vídeo de elevado débito: Processamento de streams de vídeo com FPS elevado em infraestruturas GPU NVIDIA fixas, nas quais o débito com batch-1 é a principal métrica.
  • Linhas de fabrico industrial: Cenários com restrições rigorosas de latência GPU em hardware dedicado, como a inspeção de qualidade em tempo real em linhas de montagem.
  • Investigação sobre pesquisa de arquitetura neural: Estudo dos efeitos da pesquisa automatizada de arquiteturas (MAE-NAS) e de backbones eficientemente reparametrizados no desempenho da deteção.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, o Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência de desenvolvimento:

  • Implantação em dispositivos de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência sem a complexidade do pós-processamento de Supressão de Não-Máximos.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência em CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas capturadas por drones ou análise de sensores de IoT, nos quais ProgLoss e STAL aumentam significativamente a precisão em objetos minúsculos.

A vantagem da Ultralytics#

Embora ambos os modelos sejam tecnicamente impressionantes, escolher uma arquitetura para produção implica olhar para além das métricas brutas. Criar soluções com modelos nativamente compatíveis com o ecossistema da Ultralytics oferece vantagens incomparáveis tanto para programadores como para investigadores.

Facilidade de utilização e ecossistema bem mantido#

Ao contrário dos repositórios académicos autónomos, que frequentemente são abandonados, a Ultralytics oferece um ecossistema robusto e mantido ativamente. Configurar ambientes complexos para modelos que dependem fortemente de pipelines de NAS pode ser intimidante. Em contrapartida, a Ultralytics disponibiliza uma API Python padronizada e intuitiva, além de uma CLI poderosa, apoiadas por uma documentação abrangente. Isto reduz drasticamente o tempo de colocação no mercado de soluções de visão personalizadas.

Eficiência do treino e requisitos de memória#

Treinar modelos grandes pode tornar-se rapidamente dispendioso em termos computacionais. As arquiteturas YOLO da Ultralytics são historicamente conhecidas pelo baixo consumo de memória CUDA durante o treinamento e a inferência. Esta eficiência permite que os programadores treinem modelos em hardware de consumo ou em instâncias cloud económicas sem encontrar erros de memória esgotada, comuns ao trabalhar com modelos baseados em Transformer, como o RT-DETR.

Acompanhamento de experiências

A Ultralytics integra-se nativamente com as principais ferramentas de MLOps. Você pode acompanhar facilmente o progresso do treinamento do seu modelo através das integrações com Weights & Biases, Comet ou ClearML, sem qualquer código boilerplate adicional.

Versatilidade entre tarefas#

Uma limitação significativa de muitos modelos de deteção especializados é o seu foco restrito. No ecossistema da Ultralytics, você não está limitado apenas à deteção de objetos. As ferramentas estendem-se perfeitamente a várias tarefas de visão computacional, incluindo segmentação de instâncias, classificação de imagens, estimativa de pose e deteção de caixas delimitadoras orientadas (OBB).

Olhando para o futuro: a evolução do YOLO26#

Enquanto o YOLOv10 introduziu a inferência sem NMS e o DAMO-YOLO demonstrou o poder do NAS, o campo da visão computacional evolui rapidamente. Para programadores que procuram a solução de última geração definitiva, recomendamos que conheçam o Ultralytics YOLO26.

Lançado como o sucessor definitivo do YOLO11, o YOLO26 baseia-se na fundação sem NMS estabelecida pelo YOLOv10, mas leva-a significativamente mais longe.

Os principais avanços do YOLO26 incluem:

  • Inferência em CPU até 43% mais rápida: especificamente otimizada para computação de borda e dispositivos de baixo consumo.
  • Remoção do DFL: a Perda Focal de Distribuição foi removida, garantindo exportações mais simples e compatibilidade aprimorada com diversos destinos de implementação.
  • Otimizador MuSGD: uma combinação de SGD e Muon, que traz diretamente para a visão computacional uma estabilidade avançada no treinamento de LLM e uma convergência mais rápida.
  • ProgLoss + STAL: funções de perda significativamente aprimoradas, que oferecem melhorias notáveis no reconhecimento de objetos pequenos, algo essencial para casos de uso como agricultura e deteção remota.

Ao utilizar a recém-reformulada Ultralytics Platform, os programadores podem anotar, treinar e implementar facilmente modelos de próxima geração, como o YOLO26, com apenas alguns cliques, garantindo que o seu pipeline de visão computacional seja simultaneamente de ponta e preparado para o futuro.

Comentários