YOLO11 vs PP-YOLOE+#
Escolher a arquitetura de rede neural ideal é fundamental para implementar aplicações de visão computacional em produção. Nesta comparação técnica, analisamos dois modelos de destaque na área da deteção de objetos em tempo real: o Ultralytics YOLO11 e o PP-YOLOE+ da Baidu. Ambas as arquiteturas oferecem um desempenho robusto, mas abordam de formas bastante diferentes os desafios da precisão, da velocidade de inferência e do ecossistema para programadores.
Abaixo, um gráfico interativo mostra os limites de desempenho destes modelos para te ajudar a identificar a melhor opção para as tuas restrições de hardware.
Origens dos modelos e linhagem técnica#
Compreender as origens e as filosofias de design desses modelos fornece um contexto valioso sobre seus respectivos pontos fortes e casos de uso ideais.
Detalhes do YOLO11#
Desenvolvido pela Ultralytics, YOLO11 representa uma iteração altamente refinada da série YOLO, priorizando o equilíbrio entre inferência em alta velocidade, eficiência extrema de parâmetros e facilidade de uso incomparável. É amplamente reconhecido por seus recursos unificados para várias tarefas e pela API Python intuitiva para desenvolvedores.
- Autores: Glenn Jocher e Jing Qiu
- Organização: Ultralytics
- Data: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentação: Documentação do YOLO11
Detalhes do PP-YOLOE+#
PP-YOLOE+ é uma versão aprimorada do PP-YOLOv2, desenvolvida com base na estrutura PaddlePaddle. O modelo introduz mudanças arquiteturais, como o backbone CSPRepResNet e o Aprendizado de Alinhamento de Tarefas (TAL), para ampliar os limites da precisão, especialmente em GPUs de alto desempenho.
- Autores: Autores do PaddlePaddle
- Organização: Baidu
- Data: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Documentação: Documentação de configuração do PP-YOLOE+
Diferenças arquitetónicas#
Os projetos arquiteturais fundamentais do YOLO11 e do PP-YOLOE+ refletem suas diferentes prioridades no cenário da visão computacional.
YOLO11 usa como base um backbone altamente otimizado e uma cabeça de detecção sem âncoras. O modelo utiliza blocos C3k2 e Spatial Pyramid Pooling - Fast (SPPF) para capturar recursos em várias escalas com sobrecarga computacional mínima. Esse projeto é muito vantajoso para reduzir a latência de inferência em dispositivos com recursos limitados, como NPUs de borda e CPUs móveis. Além disso, YOLO11 foi projetado nativamente para aprendizado de múltiplas tarefas, com suporte a segmentação de instâncias, estimativa de pose e detecção de caixas delimitadoras orientadas (OBB) desde o início.
PP-YOLOE+ introduz o backbone CSPRepResNet e uma cabeça Efficient Task-aligned (ET-head). O modelo utiliza intensamente técnicas de reparametrização para aumentar a capacidade de representação durante o treinamento e, em seguida, incorpora esses parâmetros em convoluções padrão para a inferência. Embora isso proporcione uma Precisão Média (mAP) impressionante, os modelos resultantes tendem a ter mais parâmetros e ocupar mais memória, sendo mais adequados para implantação em GPUs de servidor robustas do que em dispositivos de borda leves.
Se o seu projeto precisa ir além das caixas delimitadoras padrão, o Ultralytics YOLO11 oferece suporte nativo à segmentação, estimativa de pose e classificação na mesma API, reduzindo drasticamente o esforço de desenvolvimento em comparação com a integração de vários repositórios distintos.
Desempenho e benchmarks#
Ao avaliar o desempenho, analisamos a precisão (mAP), a velocidade de inferência em diferentes hardwares e a eficiência do modelo (parâmetros e FLOPs). A tabela abaixo destaca as métricas comparativas, com os valores mais eficientes ou de melhor desempenho em negrito.
| Modelo | tamanho (pixels) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Análise#
YOLO11 apresenta uma clara vantagem no equilíbrio de desempenho e na eficiência de parâmetros. Por exemplo, YOLO11m alcança um mAP maior (51.5) do que PP-YOLOE+m (49.8), usando menos parâmetros (20.1M contra 23.43M) e atingindo velocidades de inferência significativamente maiores no TensorRT (4.7ms contra 5.56ms). A leveza dos modelos YOLO11 se traduz naturalmente em menores requisitos de memória durante o treinamento do modelo e a implantação.
Ecossistema de treinamento e facilidade de uso#
O verdadeiro valor de um modelo muitas vezes está na facilidade com que os desenvolvedores podem treiná-lo com conjuntos de dados de visão computacional personalizados e implantá-lo em produção.
A vantagem da Ultralytics#
A Ultralytics prioriza uma experiência de desenvolvimento simplificada. O treinamento do YOLO11 é feito por meio de uma API Python simples ou da CLI, que abstrai o código boilerplate complexo. A Plataforma Ultralytics aprimora ainda mais essa experiência, oferecendo treinamento sem código, gerenciamento automatizado de conjuntos de dados e exportações com um clique para formatos como ONNX, CoreML e TensorRT.
Além disso, os modelos YOLO são altamente eficientes no uso de memória durante o treinamento, evitando a enorme sobrecarga de VRAM típica das arquiteturas baseadas em Transformer ou dos modelos com muita reparametrização, o que permite treiná-los em hardware de consumo.
from ultralytics import YOLO
# Carrega um modelo YOLO11 pré-treinado
model = YOLO("yolo11n.pt")
# Treina o modelo com o conjunto de dados COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Executa a inferência numa imagem
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()Ecossistema PP-YOLOE+#
PP-YOLOE+ funciona no ecossistema PaddleDetection. Embora essa estrutura seja poderosa e profundamente integrada às soluções industriais da Baidu, ela exige que os desenvolvedores adotem a estrutura de aprendizado profundo específica PaddlePaddle. Isso pode tornar a curva de aprendizado mais íngreme para equipes que já padronizaram o PyTorch. Além disso, exportar modelos PP-YOLOE+ para formatos universais padrão destinados a dispositivos de borda pode exigir etapas adicionais de conversão em comparação com os pipelines de exportação nativos dos fluxos de trabalho da Ultralytics.
Casos de utilização ideais#
A escolha entre esses modelos depende do seu ambiente específico de implantação.
- Escolha YOLO11 para desenvolvimento ágil, computação de borda e aplicações móveis. A alta velocidade de inferência, a baixa ocupação de memória e os amplos recursos de exportação tornam o modelo ideal para tarefas como gerenciamento de estoque no varejo em CPUs padrão, análise de imagens aéreas capturadas por drones e pipelines complexos de múltiplas tarefas.
- Escolha PP-YOLOE+ se todo o seu pipeline de produção já depender fortemente do ecossistema PaddlePaddle ou se você estiver implantando em servidores de inferência dedicados e de alto desempenho, nos quais as restrições de memória e a compatibilidade de hardware (fora do hardware otimizado para Paddle) não sejam preocupações prioritárias.
A próxima geração: conheça YOLO26#
Embora YOLO11 continue sendo incrivelmente poderoso, o campo da IA evolui rapidamente. Para o que há de mais avançado em detecção de objetos, a Ultralytics apresentou o novo YOLO26. Lançado em janeiro de 2026, YOLO26 se baseia nos sucessos de seus antecessores para oferecer eficiência e precisão sem precedentes.
Principais inovações do YOLO26:
- Projeto de ponta a ponta sem NMS: a cabeça opcional um para um do YOLO26 (
nms=False) dispensa o pós-processamento de supressão não máxima (NMS). Isso acelera significativamente a inferência e simplifica a lógica de implantação — um avanço arquitetural pioneiro do YOLOv10. - Inferência na CPU até 43% mais rápida: otimizada especificamente para dispositivos de borda sem GPUs, garantindo desempenho em tempo real em hardware de menor consumo.
- Otimizador MuSGD: inspirado na estabilidade do treinamento de LLMs, essa combinação de SGD e Muon garante convergência mais rápida e treinamento mais estável.
- ProgLoss + STAL: funções de perda aprimoradas melhoram drasticamente o reconhecimento de objetos pequenos, algo fundamental para aplicações com drones e vigilância de segurança.
- Remoção do DFL: a remoção da Distribution Focal Loss simplifica a exportação do modelo e melhora drasticamente a compatibilidade com uma ampla variedade de dispositivos de borda.
Para novos projetos que priorizam velocidade, exportação integrada e máxima precisão, recomendamos aproveitar os recursos do YOLO26 por meio da Plataforma Ultralytics.
Se você estiver avaliando outras arquiteturas, também pode se interessar por uma comparação entre YOLO11 e RT-DETR ou por explorar o desempenho do legado YOLOv8 nos benchmarks atuais.