Ultralytics YOLO27:
Get Started

YOLO26 vs DAMO-YOLO#

Ao escolher um modelo de visão computacional de última geração, é fundamental encontrar o equilíbrio ideal entre velocidade de inferência, precisão e facilidade de implantação. Este guia abrangente compara dois modelos de destaque no cenário da IA para visão: Ultralytics YOLO26 e DAMO-YOLO. Embora ambas as arquiteturas ampliem os limites da detecção de objetos em tempo real, suas filosofias de projeto e casos de uso pretendidos diferem significativamente.

Inovações e projeto arquiteturais#

Ultralytics YOLO26: o padrão de visão com foco na borda#

Desenvolvido por Glenn Jocher e Jing Qiu na Ultralytics e lançado em 14 de janeiro de 2026, o YOLO26 representa um enorme avanço na linhagem YOLO. Ele foi projetado desde o início para computação de borda, combinando perfeitamente práticas avançadas de treinamento de LLMs com arquiteturas de visão avançadas.

Entre os principais avanços arquiteturais do YOLO26 estão:

  • Projeto de ponta a ponta sem NMS: Com base no trabalho pioneiro do YOLOv10, o YOLO26 é nativamente de ponta a ponta. Ao dispensar o pós-processamento de supressão não máxima (NMS) com sua cabeça opcional one-to-one (nms=False), ele garante latência determinística e simplifica bastante os pipelines de implantação.
  • Remoção do DFL: A remoção do Distribution Focal Loss simplifica o grafo do modelo. Isso facilita muito a exportação para frameworks de implantação como ONNX e TensorRT e garante melhor compatibilidade com dispositivos de borda de baixo consumo.
  • Otimizador MuSGD: Inspirada no Kimi K2 da Moonshot AI, esta combinação de gradiente descendente estocástico (SGD) e Muon leva inovações do treinamento de LLMs para a visão computacional, resultando em um treinamento notavelmente estável e convergência rápida.
  • ProgLoss + STAL: Estas funções de perda avançadas proporcionam melhorias notáveis no reconhecimento de objetos pequenos, algo essencial para a análise de imagens aéreas com drones e pipelines complexos de robótica.

DAMO-YOLO: busca de arquitetura neural em escala#

Desenvolvido por Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang e Xiuyu Sun do Alibaba Group (lançado em 23 de novembro de 2022), o DAMO-YOLO se concentra fortemente na descoberta automatizada de arquiteturas. A pesquisa, detalhada em seu artigo no arXiv, utiliza busca de arquitetura neural (NAS) para encontrar backbones ideais dentro de limites rigorosos de latência.

Entre os principais recursos arquiteturais do DAMO-YOLO estão:

  • Backbone MAE-NAS: Emprega uma busca guiada por entropia máxima para projetar automaticamente backbones que equilibram a precisão com a velocidade de implantação desejada.
  • RepGFPN eficiente: Um design robusto de neck pesado que otimiza a fusão de características em diferentes escalas, tornando-o altamente capaz de processar cenas visuais complexas.
  • ZeroHead: Uma cabeça de detecção drasticamente simplificada, projetada para minimizar a sobrecarga computacional nas camadas finais de predição.

Saiba mais sobre o DAMO-YOLO

Escolhendo a arquitetura certa

Embora a arquitetura do DAMO-YOLO orientada por NAS seja excelente para restrições específicas de hardware definidas previamente, o projeto sem NMS e a remoção do DFL do YOLO26 fazem dele uma opção muito mais versátil e previsível em uma ampla variedade de ambientes de borda e nuvem.

Comparação de desempenho e métricas#

Uma comparação direta entre variantes de modelos treinadas no conjunto de dados padrão COCO revela perfis de desempenho distintos. A tabela abaixo apresenta as compensações entre precisão (mAP), velocidade e consumo computacional (parâmetros e FLOPs).

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Análise de desempenho#

Ao analisar os dados, o equilíbrio de desempenho favorece bastante o YOLO26 em aplicações modernas. A variante Nano (YOLO26n) é excepcionalmente leve, com apenas 2.4M parâmetros, e oferece velocidades impressionantes de 1.7 ms em uma GPU NVIDIA T4. Além disso, o YOLO26 foi projetado especificamente para oferecer inferência na CPU até 43% mais rápida, sendo o campeão indiscutível para dispositivos de borda sem aceleradores de GPU dedicados.

Embora o DAMO-YOLOt supere ligeiramente o YOLO26n em mAP puro, isso exige cerca de 3.5 vezes mais parâmetros (8.5M). Nas variantes maiores, o YOLO26 supera consistentemente o DAMO-YOLO em precisão, mantendo uma pegada de memória menor, menor uso de memória CUDA durante o treinamento e velocidades muito maiores no TensorRT.

Ecossistema, facilidade de uso e eficiência do treinamento#

A verdadeira força de um modelo de aprendizado de máquina não está apenas em suas métricas brutas, mas também na facilidade de uso para desenvolvedores e pesquisadores.

A vantagem da Ultralytics#

A escolha de um modelo Ultralytics garante acesso a um ecossistema altamente refinado e centrado no desenvolvedor. Fluxos de trabalho complexos que envolvem aumento de dados, ajuste de hiperparâmetros e acompanhamento robusto de experimentos são abstraídos em comandos intuitivos.

Além disso, o YOLO26 oferece versatilidade incomparável. Enquanto o DAMO-YOLO é estritamente um detector de objetos, o YOLO26 oferece melhorias abrangentes e específicas para cada tarefa em vários domínios, prontas para uso:

Metodologias de treinamento#

O treinamento do DAMO-YOLO costuma envolver um processo complexo de destilação, no qual um modelo grande, o "professor", treina um modelo menor, o "aluno". Embora essa técnica obtenha ganhos marginais de precisão, ela exige muita memória de GPU e ciclos de treinamento mais longos.

Em contrapartida, os requisitos de memória do YOLO26 são significativamente menores. Com o otimizador MuSGD, o YOLO26 treina de forma rápida e eficiente em hardware convencional para consumidores. Veja como é fácil treinar um modelo YOLO26 usando a API Python da Ultralytics, baseada em PyTorch:

from ultralytics import YOLO

# Inicializa o modelo nano YOLO26 nativamente de ponta a ponta
model = YOLO("yolo26n.pt")

# Treina facilmente com um conjunto de dados personalizado
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)

# Exporta o modelo otimizado, sem NMS
model.export(format="onnx", nms=False)
Explorando outros modelos

Se tiveres interesse em explorar outras arquiteturas modernas do ecossistema Ultralytics, o altamente capaz YOLO11 continua sendo uma ótima opção para pipelines legados. Como alternativa, pesquisadores interessados em arquiteturas baseadas em Transformer podem explorar o modelo RT-DETR.

Aplicações no mundo real#

Em última análise, a escolha entre essas arquiteturas depende do teu ambiente de implantação.

IA de borda e dispositivos IoT#

Para câmeras de varejo inteligente, monitores agrícolas automatizados ou robótica, os recursos computacionais são bastante limitados. Nesse cenário, o YOLO26 é a escolha definitiva. Sua inferência na CPU 43% mais rápida, o pipeline totalmente sem NMS e o número reduzido de parâmetros permitem que ele funcione sem problemas em dispositivos de borda, como o Raspberry Pi, sem sacrificar a precisão essencial.

Fabricação em alta velocidade e controle de qualidade#

Em linhas de automação da fabricação de ritmo acelerado, detectar defeitos em esteiras transportadoras velozes exige latência mínima e determinística. Embora o DAMO-YOLO possa ter um desempenho adequado em configurações específicas de GPU, a latência variável introduzida pelo pós-processamento tradicional de NMS pode dessincronizar os atuadores robóticos. A arquitetura de ponta a ponta do YOLO26 garante tempos de processamento de quadros consistentes e previsíveis, assegurando uma integração impecável em robótica industrial de alta velocidade.

Imagens de drones e imagens aéreas#

Detectar objetos minúsculos a grandes altitudes é notoriamente difícil. A integração de ProgLoss e STAL no YOLO26 melhora drasticamente o reconhecimento de objetos pequenos. Seja para rastrear animais selvagens ou analisar congestionamentos no trânsito a partir de UAVs, o YOLO26 identifica consistentemente objetos com áreas de poucos pixels que arquiteturas mais antigas, incluindo o DAMO-YOLO, frequentemente não detectam.

Casos de uso e recomendações#

A escolha entre YOLO26 e DAMO-YOLO depende dos requisitos específicos do teu projeto, das restrições de implantação e das preferências de ecossistema.

Quando escolher o YOLO26#

O YOLO26 é uma ótima opção para:

  • Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.

Quando escolher DAMO-YOLO#

O DAMO-YOLO é recomendado para:

  • Análise de vídeo de alto rendimento: Processamento de transmissões de vídeo com alto FPS em uma infraestrutura fixa de GPU NVIDIA, na qual o rendimento com lote 1 é a principal métrica.
  • Linhas de fabricação industrial: Cenários com restrições rigorosas de latência da GPU em hardware dedicado, como inspeção de qualidade em tempo real em linhas de montagem.
  • Pesquisa em busca de arquitetura neural: Estudo dos efeitos da busca automatizada de arquitetura (MAE-NAS) e de backbones eficientes com reparametrização no desempenho da detecção.

Conclusão#

Embora o DAMO-YOLO continue sendo um estudo fascinante sobre os recursos da busca de arquitetura neural para alvos de hardware específicos, o Ultralytics YOLO26 é a solução superior e completa para profissionais de IA modernos. Com sua arquitetura de ponta a ponta sem NMS, requisitos de memória significativamente menores, otimizador híbrido MuSGD e ecossistema impecavelmente mantido, o YOLO26 permite que desenvolvedores criem e implantem sistemas de visão de última geração com mais rapidez e confiabilidade do que nunca.

Comentários