Implementação#
A Ultralytics Platform fornece opções de implantação de modelos abrangentes para colocar os teus modelos YOLO em produção. Testa modelos com inferência baseada no navegador, implanta em endpoints dedicados em 42 regiões globais e monitoriza o desempenho em tempo real.
Watch: Get Started with Ultralytics Platform - Deploy
Visão geral#
A secção de Implementação ajuda-te a:
- Testar modelos diretamente no navegador com o separador
Predict - Implanta em endpoints dedicados em 42 regiões globais
- Monitorizar métricas de pedidos, registos e verificações de integridade
- Escalar para zero quando inativo (as implementações executam atualmente uma única instância ativa)

Opções de Implementação#
A Ultralytics Platform oferece vários caminhos de implementação:
| Opção | Descrição | Melhor para |
|---|---|---|
| Separador Predict | Inferência baseada no navegador com imagem, webcam e exemplos | Desenvolvimento, validação |
| Inferência Partilhada | Serviço multitenant em 3 regiões | Uso leve, testes |
| Endpoints Dedicados | Serviços de tenant único em 42 regiões | Produção, baixa latência |
Fluxo de trabalho#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Etapa | Descrição |
|---|---|
| Teste | Valida o modelo com o separador Predict |
| Configurar | Seleciona uma região e revê o nome de implementação editável e gerado automaticamente |
| Deploy | Cria um endpoint dedicado a partir do separador Deploy |
| Monitorar | Rastreia pedidos, latência, erros e registos na Monitorização |
Arquitetura#
Inferência Partilhada#
O serviço de inferência partilhada funciona em 3 regiões principais, encaminhando automaticamente os pedidos com base na região dos teus dados:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Region Router}:::decide
Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Região | Rótulo | Localização | Melhor para |
|---|---|---|---|
| US | Américas | Iowa, EUA | Usuários das Américas, mais rápido para as Américas |
| EU | Europa, Oriente Médio e África | Bélgica, Europa | Usuários europeus, conformidade com o GDPR |
| AP | Ásia-Pacífico | Taiwan, Ásia-Pacífico | Usuários da Ásia-Pacífico, menor latência APAC |
Endpoints Dedicados#
Implanta em 42 regiões em todo o mundo na Ultralytics Cloud:
- Américas: 14 regiões
- Europa: 13 regiões
- Ásia-Pacífico: 12 regiões
- Oriente Médio e África: 3 regiões
Cada endpoint é um serviço single-tenant com:
- Recursos padrão de
1 CPU,2 GiBde memória,minInstances=0,maxInstances=1 - Escalonamento para zero quando inativo
- URL de endpoint exclusivo
- Monitorização, registos e verificações de integridade independentes
Página de Implementações#
Acede à página global de implementações a partir da barra lateral em Deploy. Esta página mostra:
- Mapa mundial com pinos das regiões implementadas (mapa interativo)
- Cartões de visão geral: Total de Pedidos (24h), Implementações Ativas, Taxa de Erro (24h), Latência P95 (24h)
- Lista de implementações com três modos de visualização: cartões, compacto e tabela
- Botão Nova Implementação para criar endpoints a partir de qualquer modelo concluído

A página verifica normalmente a cada 15 segundos. Quando as implementações estão num estado de transição (creating, deploying ou stopping), a sondagem aumenta para cada 3 segundos para um feedback mais rápido.
Principais recursos#
Cobertura Global#
Implanta perto dos teus utilizadores com 42 regiões abrangendo:
- América do Norte, América do Sul
- Europa, Médio Oriente, África
- Ásia-Pacífico, Oceânia
Comportamento de Escalonamento#
Os endpoints comportam-se atualmente da seguinte forma:
- Dimensionar para zero:
minInstancestem por predefinição0 - Instância única ativa:
maxInstancesestá atualmente limitado a1em todos os planos
Implementação Regional#
Usa a latência de região medida para colocar um endpoint perto de quem o chama. A latência de inferência real depende do modelo, do tamanho de entrada, do estado do endpoint e do caminho de rede.
Verificações de Integridade#
Cada implementação em execução inclui uma verificação de integridade automática com:
- Indicador de estado ao vivo (saudável/não saudável)
- Exibição de latência de resposta
- Repetição automática quando não saudável (sondagem a cada 20 segundos)
- Botão de atualização manual
Início Rápido#
Criar uma implementação:
- Treina ou carrega um modelo para um projeto
- Vai para o separador Deploy do modelo
- Seleciona uma região na tabela de latência
- Clica em Deploy e espera que o estado da implementação passe a Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyUma vez implementado, utiliza o URL do endpoint com a tua chave API para enviar pedidos de inferência a partir de qualquer aplicação.
Links Rápidos#
- Inferência: Testa modelos no navegador
- Endpoints: Implementa endpoints dedicados
- Monitorização: Rastreia o desempenho da implementação
FAQ#
Qual é a diferença entre inferência partilhada e dedicada?#
| Funcionalidade | Partilhada | Dedicada |
|---|---|---|
| Serviço | Partilhado entre os utilizadores da Platform | Dedicado a uma única implementação |
| Escala | Gerido pela Platform | Dimensionamento para zero, uma instância |
| Regiões | 3 regiões de dados | Escolhe entre 42 regiões de implementação |
| URL | API de modelo da Platform | URL do endpoint de implementação gerado |
| Testes | Separador Predict do modelo | Separador Predict do cartão de implementação ou API |
Quanto tempo demora a implantação?#
A implementação permanece num estado de criação ou implementação enquanto o seu serviço arranca. Fica utilizável quando o estado muda para Ready; o tempo varia consoante o modelo e a região.
Posso implantar vários modelos?#
Sim, cada modelo pode ter múltiplos endpoints em diferentes regiões. As contagens de implantação são limitadas pelo plano: Free 3, Pro 10, Enterprise unlimited.
O que acontece quando um endpoint está ocioso?#
Com scale-to-zero ativado:
- O endpoint reduz a escala após inatividade
- A primeira solicitação dispara um cold start
- Solicitações subsequentes são rápidas
As primeiras solicitações após um período de inatividade disparam um cold start.