Ultralytics YOLO27:
Get Started

YOLOv10 vs. YOLOv7#

O rápido avanço da visão computacional nos últimos anos resultou em arquiteturas cada vez mais eficientes para aplicações em tempo real. A comparação entre YOLOv10 e YOLOv7 destaca uma transição crucial nessa evolução. Enquanto o YOLOv7 introduziu estratégias de treinamento altamente eficazes e escalabilidade arquitetônica, o YOLOv10 revolucionou a implantação ao eliminar a dependência de longa data da supressão não máxima (NMS).

Ambos os modelos ampliaram os limites da detecção de objetos quando foram lançados, mas o moderno ecossistema Ultralytics e a introdução de modelos de nova geração, como o YOLO26, oferecem fluxos de trabalho muito superiores para os profissionais de IA de hoje.

Perfis e origens dos modelos#

Entender a origem desses modelos fornece um contexto valioso sobre as escolhas de design arquitetônico e a pesquisa acadêmica que as impulsionou.

Detalhes do YOLOv10#

Sabe mais sobre o YOLOv10

Detalhes do YOLOv7#

Saiba mais sobre o YOLOv7

Inovações arquiteturais#

A abordagem do YOLOv7#

Lançado em 2022, o YOLOv7 concentrou-se bastante na otimização dos caminhos de gradiente. Ele introduziu a Extended Efficient Layer Aggregation Network (E-ELAN), que permitiu ao modelo aprender características mais variadas sem destruir o caminho de gradiente original. Além disso, os autores implementaram uma metodologia de "conjunto treinável de vantagens gratuitas", usando técnicas de reparametrização durante o treinamento que podiam ser fundidas durante a inferência para manter altas velocidades de execução. Apesar dessas otimizações impressionantes, o YOLOv7 ainda dependia bastante de NMS no pós-processamento, gerando latência variável durante a análise de cenas densas.

O avanço do YOLOv10#

O YOLOv10 abordou diretamente o gargalo da NMS. Ao introduzir atribuições duplas consistentes durante o treinamento, a equipe da Universidade de Tsinghua viabilizou a detecção de ponta a ponta sem NMS. Essa abordagem de duas cabeças usa um ramo com atribuições de um para muitos, que fornece sinais de supervisão ricos durante o treinamento, e outro com atribuições de um para um para a inferência sem NMS. Essa mudança arquitetônica garante uma latência de inferência ultrabaixa e consistente, adequada para análise de vídeo em alta velocidade. Além disso, o YOLOv10 usa um design de modelo holístico orientado à eficiência e à precisão, eliminando redundâncias computacionais presentes nas gerações anteriores.

Impacto do pós-processamento

Remover o pós-processamento com NMS não só acelera a inferência, como também simplifica significativamente a implantação em hardware de IA de borda, como aceleradores de IA e NPUs, nos quais operações NMS personalizadas são notoriamente difíceis de compilar.

Comparação de desempenho#

Ao comparar as métricas brutas no conjunto de dados MS COCO, fica evidente a diferença entre as gerações. O YOLOv10 oferece um equilíbrio muito mais favorável entre parâmetros, requisitos computacionais e precisão.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Como mostrado acima, o YOLOv10x alcança um mAP superior de 54,4%, em comparação com 53,1% do YOLOv7x, usando menos da metade dos parâmetros (29,5M contra 71,3M). Além disso, os modelos leves YOLOv10 (Nano e Small) oferecem velocidades excepcionais de implantação com TensorRT, o que os torna altamente atraentes para implantação em dispositivos móveis.

A vantagem do ecossistema Ultralytics#

Embora estudar artigos sobre arquitetura seja esclarecedor, o desenvolvimento moderno de visão computacional depende de frameworks robustos e bem mantidos. Escolher um modelo compatível com a Ultralytics oferece uma enorme vantagem aos desenvolvedores que querem passar rapidamente do protótipo à produção.

Desenvolvimento simplificado#

O YOLOv10 tem suporte nativo no pacote padrão Ultralytics Python, enquanto checkpoints do YOLOv7 treinados upstream só podem ser executados na Ultralytics após a exportação para ONNX ou TensorRT. O suporte nativo oferece facilidade de uso incomparável, substituindo milhares de linhas de código repetitivo por uma API simples e intuitiva. Além disso, os modelos Ultralytics YOLO exigem muito menos memória CUDA durante o treinamento do que arquiteturas Transformer pesadas, permitindo usar tamanhos de lote maiores em hardware para consumidores.

Versatilidade incomparável#

Embora repositórios mais antigos muitas vezes se concentrem exclusivamente na detecção com caixas delimitadoras, o framework integrado da Ultralytics oferece suporte fácil a uma enorme variedade de tarefas. Seja para realizar segmentação de instâncias, estimativa de pose ou detecção com caixas delimitadoras orientadas (OBB), o fluxo de trabalho permanece idêntico.

Exemplo de código: fluxos de trabalho de treinamento consistentes#

O trecho de código a seguir demonstra o processo simplificado de treinamento, que gerencia automaticamente o aumento de dados e o agendamento da taxa de aprendizado:

from ultralytics import YOLO

# Carrega o modelo desejado (por exemplo, YOLOv10 ou o recomendado YOLO26)
model = YOLO("yolo26n.pt")

# Treina o modelo facilmente no seu conjunto de dados
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)

# Exporta para o formato ONNX para uma implantação rápida
model.export(format="onnx")

Casos de uso e recomendações#

A escolha entre YOLOv10 e YOLOv7 depende dos requisitos específicos do seu projeto, das restrições de implantação e das preferências de ecossistema.

Quando escolher o YOLOv10#

O YOLOv10 é uma ótima opção para:

  • Detecção em tempo real sem NMS: Aplicações que se beneficiam da detecção de ponta a ponta sem supressão não máxima, reduzindo a complexidade da implantação.
  • Equilíbrio entre velocidade e precisão: Projetos que exigem um bom equilíbrio entre velocidade de inferência e precisão de detecção em várias escalas de modelo.
  • Aplicações com latência consistente: Cenários de implantação nos quais tempos de inferência previsíveis são essenciais, como em robótica ou sistemas autônomos.

Quando escolher o YOLOv7#

O YOLOv7 é recomendado para:

  • Benchmarking acadêmico: reproduzir resultados de ponta de 2022 ou estudar os efeitos do E-ELAN e das técnicas de conjunto treinável de vantagens gratuitas.
  • Pesquisa sobre reparametrização: investigar convoluções reparametrizadas planejadas e estratégias de escalabilidade composta de modelos.
  • Pipelines personalizados existentes: projetos com pipelines altamente personalizados, construídos em torno da arquitetura específica do YOLOv7, que não podem ser refatorados facilmente.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência para desenvolvedores:

  • Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.

O novo padrão: conheça o YOLO26#

Embora o YOLOv10 tenha representado um grande salto em 2024, o cenário da visão computacional evolui rapidamente. Para todo novo desenvolvimento, recomendamos fortemente o modelo de última geração: Ultralytics YOLO26. Lançado em janeiro de 2026, ele representa o ápice absoluto da IA de visão em tempo real e supera amplamente o YOLOv7 e o YOLOv10.

O YOLO26 traz inovações sem precedentes, desenvolvidas especificamente para ambientes modernos de implantação:

  • Design de ponta a ponta sem NMS: com base nos princípios estabelecidos pelo YOLOv10, a cabeça opcional de um para um do YOLO26 (nms=False) elimina o pós-processamento com NMS, simplificando os pipelines de implantação e garantindo uma inferência rápida e consistente.
  • Inferência na CPU até 43% mais rápida: otimizado extensivamente para computação de borda e dispositivos sem GPUs dedicadas, proporciona grande economia nos custos de hardware.
  • Remoção da DFL: a Distribution Focal Loss foi totalmente removida, o que simplifica radicalmente a lógica de exportação e melhora muito a compatibilidade com dispositivos de borda de baixo consumo e microcontroladores.
  • Otimizador MuSGD: inspirado no Kimi K2 da Moonshot AI, esse híbrido de SGD e Muon traz inovações de treinamento de modelos de linguagem de grande porte (LLM) diretamente para a visão computacional, proporcionando uma dinâmica de treinamento extremamente estável e convergência mais rápida.
  • ProgLoss + STAL: essas funções de perda avançadas melhoram significativamente o reconhecimento de objetos pequenos, uma área historicamente desafiadora e essencial para drones, robótica e monitoramento de cidades inteligentes.
  • Melhorias específicas para cada tarefa: o YOLO26 não é apenas um detector. Ele inclui uma função de perda especializada para segmentação semântica, Residual Log-Likelihood Estimation (RLE) para estimativa de pose de alta precisão e algoritmos especializados de perda angular para eliminar problemas nos limites de OBB.
Gerenciamento de conjuntos de dados e treinamento

Para ter a melhor experiência possível no gerenciamento dos seus conjuntos de dados, no treinamento do YOLO26 e na implantação de modelos na nuvem, explore a plataforma Ultralytics. Ela oferece uma interface sem código que complementa perfeitamente o Python SDK.

Casos de uso no mundo real#

A escolha da arquitetura certa depende bastante do seu hardware e das restrições da aplicação.

Quando usar o YOLOv7#

O YOLOv7 continua sendo uma opção confiável para manter pipelines legados que já estejam profundamente integrados às suas estruturas de tensores específicas ou para reproduzir benchmarks acadêmicos de 2022 e 2023. Ele apresenta ótimo desempenho em GPUs de servidor de alto desempenho.

Quando usar o YOLOv10#

O YOLOv10 se destaca em cenários que exigem latência rigorosamente constante. Por não usar NMS, ele é excelente para contagem de multidões em alta densidade ou detecção de defeitos de fabricação, em que o número de objetos varia muito, mas o tempo de processamento por quadro precisa permanecer constante.

Quando usar o YOLO26#

O YOLO26 é a escolha definitiva para qualquer projeto novo. Desde a implantação de sofisticados sistemas de alarme de segurança em um Raspberry Pi básico até a execução de análises de vídeo em grande escala na nuvem, sua velocidade superior na CPU e a detecção avançada de objetos pequenos o tornam muito superior às gerações anteriores.

Para os desenvolvedores interessados em explorar arquiteturas modernas alternativas, também oferecemos amplo suporte a detectores baseados em Transformer, como o RT-DETR, e a modelos de gerações anteriores, como o Ultralytics YOLO11.

Comentários