Endpoints dedicados#
A Plataforma Ultralytics permite implementar modelos YOLO em endpoints dedicados em 42 regiões do mundo. Cada endpoint é um serviço de inquilino único, com um URL exclusivo e monitorização independente. O tamanho de recurso predefinido é reduzido a zero quando está inativo; os tamanhos personalizados mantêm uma instância ativa e são cobrados pelo tempo de atividade.

Criar endpoint#
Na aba Deploy#
Implementa um modelo a partir da respetiva aba Deploy:
- Navega até ao teu modelo
- Clica na aba Deploy
- Consulta o mapa-múndi e a tabela de regiões, ordenada pela latência medida a partir da tua localização
- Clica em Deploy na linha da região que pretendes utilizar
- Na caixa de diálogo, consulta a CPU, a memória, o preço e o nome da implementação; depois, clica em Create Deployment
O nome sugerido combina o nome do modelo e a cidade da região (por exemplo, yolo26n-iowa) e pode ser editado antes da implementação. O modelo tem de ter pesos; caso contrário, a aba apresenta um estado vazio em vez da tabela de regiões.
Na aba Deployments#
Cria uma implementação a partir da aba Deployments do teu perfil ou da barra lateral:
- Clica em New Deployment na aba Deployments ou em
+junto a Deployments na barra lateral - Seleciona um modelo no seletor de modelos, que apresenta os modelos concluídos
- Seleciona uma região no minimapa ou na tabela de latência
- Escolhe a CPU e a memória, consulta o preço e, se necessário, edita o nome de implementação sugerido
- Clica em Create Deployment

Ciclo de vida da implementação#
stateDiagram-v2
[*] --> Creating: Deploy
Creating --> Deploying: Service starting
Deploying --> Ready: Service URL published
Ready --> Stopping: Stop
Ready --> Deploying: Replace model or resize
Stopping --> Stopped: Stopped
Stopped --> Deploying: Start
Deploying --> Stopped: Start failed
Ready --> [*]: Delete
Stopped --> [*]: Delete
Creating --> Failed: Error
Deploying --> Failed: Error
Failed --> [*]: Delete
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff
classDef error fill:#F44336,color:#fff
classDef extern fill:#607D8B,color:#fff
class Creating,Deploying,Stopping proc
class Ready out
class Failed error
class Stopped externLiga os alertas do Slack para receber uma mensagem quando uma implementação ficar pronta ou não conseguir iniciar.
Seleção de região#
Escolhe entre 42 regiões em todo o mundo. O mapa interativo de regiões e a tabela mostram:
- Marcadores de região: codificados por cores segundo a latência, num gradiente do verde ao vermelho (as regiões mais rápidas são mais verdes e as mais lentas são mais vermelhas)
- Regiões implementadas: destacadas com um emblema «Deployed» na tabela
- Regiões em implementação: indicador de pulso animado no marcador e na linha da tabela
- Realce bidirecional: ao passar o cursor sobre o mapa, a linha correspondente da tabela fica realçada, e vice-versa

A tabela de regiões na aba Deploy do modelo inclui:
| Coluna | Descrição |
|---|---|
| Localização | Cidade e país com ícone de bandeira |
| Zona | Identificador da região |
| Latência | Tempo de ping medido a partir do teu navegador |
| Distância | Distância aproximada da tua localização, em km |
| Ações | Botão Deploy ou emblema de estado «Deployed» |
A tabela pode ser pesquisada por cidade, país e zona e, por predefinição, está ordenada por latência.
A caixa de diálogo New Deployment (na aba Deployments ou na barra lateral) apresenta uma tabela de regiões mais simples, com apenas as colunas Localização, Latência e Selecionar, e lista as 20 regiões mais rápidas com uma nota sobre as restantes. Usa o minimapa para escolher qualquer outra região.
O teu navegador mede a latência para cada uma das 42 regiões. Os resultados são guardados em cache durante 30 minutos e partilhados entre a aba Deploy e a caixa de diálogo New Deployment. Usa o botão Rescan na aba Deploy do modelo para voltar a medir a partir da tua rede atual. A distância é calculada a partir da localização aproximada do teu pedido, por isso serve apenas como referência e não como valor exato.
Regiões disponíveis#
| Zona | Localização |
|---|---|
| us-central1 | Iowa, EUA |
| us-east1 | Carolina do Sul, EUA |
| us-east4 | Virgínia do Norte, EUA |
| us-east5 | Columbus, EUA |
| us-south1 | Dallas, EUA |
| us-west1 | Oregon, EUA |
| us-west2 | Los Angeles, EUA |
| us-west3 | Salt Lake City, EUA |
| us-west4 | Las Vegas, EUA |
| northamerica-northeast1 | Montreal, Canadá |
| northamerica-northeast2 | Toronto, Canadá |
| northamerica-south1 | Querétaro, México |
| southamerica-east1 | São Paulo, Brasil |
| southamerica-west1 | Santiago, Chile |
Configuração do endpoint#
Caixa de diálogo de nova implantação#
A caixa de diálogo New Deployment permite selecionar um modelo, uma região, recursos e um nome para a implantação:
| Campo | Descrição |
|---|---|
| Modelo | Qualquer modelo concluído no espaço de trabalho, selecionado com o seletor |
| Região | Região de implantação, escolhida no minimapa ou na tabela de latência |
| CPU e memória | Seleciona o tamanho dos recursos e consulta os preços exibidos |
| Nome da implantação | Gerado automaticamente após definir o modelo e a região, e editável |

Escolhe o tamanho da CPU e da memória nos controles de recursos e consulta os preços exibidos antes de criar a implantação. As opções de CPU são 1, 2, 4, 6 ou 8 vCPU, e as opções de memória vão de 2 a 32 GiB; tamanhos de memória maiores precisam de mais vCPU (por exemplo, 16 GiB requer pelo menos 4 vCPU), e a caixa de diálogo explica qualquer combinação inválida. O tamanho padrão (1 vCPU, 2 GiB) é gratuito e reduz a zero quando fica inativo. Os tamanhos personalizados mantêm uma instância aquecida e são cobrados pela tarifa horária regional exibida desde que ficam prontas até interromperes o endpoint, incluindo o tempo ocioso. Criar, iniciar ou redimensionar para um tamanho personalizado requer créditos disponíveis, e os endpoints de tamanho personalizado são interrompidos automaticamente quando o espaço de trabalho fica sem créditos. Agentes reutiliza esta caixa de diálogo quando selecionas Nova implantação….

O nome da implantação combina o nome do modelo com a cidade da região, por exemplo, yolo26n-iowa. Os nomes têm de ser exclusivos no espaço de trabalho: se o nome já estiver a ser utilizado, a caixa de diálogo apresenta um erro em linha e desativa Criar implantação até escolheres outro nome.
Separador Deploy (implantação rápida)#
A implantação a partir do separador Deploy do modelo abre a mesma caixa de diálogo, com o modelo e a região pré-selecionados. Consulta o tamanho dos recursos, os preços e o nome gerado automaticamente antes de criares o endpoint. A implantação aparece na lista de implantações do modelo, abaixo da tabela de regiões, enquanto está a ser criada.
Gerir endpoints#
Modos de visualização#
A lista de implantações permite três modos de visualização:
| Modo | Descrição |
|---|---|
| Cartões | Cartões com estado, tamanho, métricas, distância e data de implantação |
| Compacta | Grelha de cartões menores com métricas principais |
| Tabela | Tabela de dados com colunas ordenáveis |

Os cartões compactos mostram a bandeira, o nome, a cidade, o estado e as três métricas. A vista de tabela permite ordenar por Nome, Região, Estado, CPU, Memória, Pedidos HTTP, Taxa de erros HTTP, Latência P95 HTTP, Distância e Implantação. Cada cartão e linha contém uma ligação para a página da implantação; as ações do ciclo de vida estão nessa página, e o ícone do caixote do lixo junto a uma implantação na barra lateral elimina-a.
Página da implantação#
Cada implantação tem a sua própria página em /{username}/deploy/{deployment}, que mostra:
- Cabeçalho: bandeira da região, nome de apresentação (clica nele para o renomear; o URL da página e o caminho da API mudam para um slug do novo nome, mas o URL do endpoint não muda), indicador de estado, localização e tamanho da CPU e da memória
- Ações: Atualizar configuração, Substituir modelo e Interromper implantação quando está Pronta; Iniciar implantação quando está Interrompida; e um menu Mais ações (…) com Informações, Atualizar e Eliminar implantação
- Métricas: pedidos HTTP, taxa de erros HTTP e latência P95 HTTP ao longo de 24 horas, com minigráficos, além de um cartão com uma ligação para o modelo implantado
- Separadores:
Overview,Monitoring,PredicteLogs - Mensagem de estado: o motivo da falha, quando uma implantação falha
O separador Overview mostra o mapa de localização, o cartão Endpoint com o URL do endpoint que podes copiar, uma ligação para a documentação da API e uma verificação de estado, além de um cartão Informações da implantação com preços, região, CPU e memória. O separador Logs mostra as entradas de registo recentes, com filtragem por gravidade (Todas / Erros). O separador Predict disponibiliza um painel de previsão em linha para testar diretamente na implantação; o separador de resultados Docs contém exemplos de código prontos a utilizar em Python, JavaScript e cURL, preenchidos com o URL do endpoint e, para os proprietários do espaço de trabalho, com a chave de API associada (consulta Monitorização). A caixa de diálogo Informações apresenta as propriedades da implantação e permite-te editar metadados personalizados.
Atualizar CPU e memória#
- Abre a página da implantação de um endpoint Pronto.
- Clica em Atualizar configuração.
- Escolhe CPU e Memória e consulta o custo horário apresentado.
- Clica em Atualizar configuração. A configuração atual continua a servir pedidos até a nova estar pronta.

Os recursos personalizados são cobrados pelo tempo de atividade e mantêm uma instância ativa, o que também permite manter uma câmara IP em execução sem custos adicionais (consulta Câmara em segundo plano). Regressar aos recursos predefinidos restaura o comportamento de redução a zero e remove a câmara em segundo plano.
Os gráficos de monitorização e as imagens de exemplo são dados leves mantidos na memória. Interromper, reiniciar, reimplantar, redimensionar ou substituir um modelo pode apagá-los. Iniciar o endpoint novamente não restaura o histórico. Guarda os exemplos úteis num conjunto de dados e aguarda a conclusão da ingestão antes de alterar o endpoint. As métricas operacionais e os registos têm períodos de histórico separados.
Substituir um modelo#
Substitui o modelo associado a um endpoint pronto sem alterar o respetivo URL:
- Abre a página da implantação
- Clica em Substituir modelo
- Seleciona outro modelo concluído do mesmo espaço de trabalho
- Se quiseres, edita o nome da implantação
- Clica em Substituir modelo
O modelo atual continua a servir pedidos enquanto o modelo de substituição é iniciado. Quando o modelo de substituição fica pronto, o tráfego passa para o novo modelo. O ID da implantação, o URL, a região e a chave de API mantêm-se inalterados; o nome de apresentação só muda se introduzires um novo. Se a substituição falhar, o modelo e o nome anteriores continuam ativos.
A substituição requer todos os seguintes requisitos; caso contrário, é rejeitada:
- A implantação está Pronta e não há nenhuma outra operação de ciclo de vida em andamento
- O modelo de substituição tem pesos e pertence ao mesmo espaço de trabalho que a implantação
- O modelo de substituição não é o que já está implantado
A substituição remove o modelo anterior da implantação. Cada endpoint atende um modelo; crie outra implantação quando precisar que os dois modelos estejam disponíveis ao mesmo tempo.
Status das implantações#
| Status | Descrição |
|---|---|
| Criando | A implantação está sendo configurada |
| Implantando | O contêiner está iniciando |
| Pronto | O endpoint está ativo e aceitando solicitações |
| Parando | O endpoint está sendo encerrado |
| Parado | O endpoint está pausado e indisponível |
| Falhou | Falha na implantação (consulte a mensagem de erro) |
Em uma implantação Pronta, o selo da página exibe Iniciando até o endpoint responder à primeira verificação de integridade e Sem resposta se a verificação falhar.
URL do endpoint#
Cada endpoint tem uma URL exclusiva, por exemplo:
https://predict-<deployment-id>-<hash>-<region>.a.run.app
Clique no botão de copiar para copiar a URL. Clique em Documentação da API para abrir a referência da API do próprio endpoint. O endpoint oferece estes caminhos:
| Caminho | Método | Descrição |
|---|---|---|
/predict | POST | Executa a inferência; requer a chave de API da implantação |
/health | GET | Verificação de atividade que informa o status do serviço e o número de modelos em cache |
/ | GET | Resumo do status do serviço implantado |
/docs | GET | Referência interativa da API gerada para esta implantação, modelo e região |
Gerenciamento do ciclo de vida#
Controle o estado do endpoint:
graph LR
R[Ready]:::out -->|Stop| S[Stopped]:::extern
S -->|Start| R
R -->|Delete| D[Deleted]:::error
S -->|Delete| D
classDef out fill:#9C27B0,color:#fff
classDef error fill:#F44336,color:#fff
classDef extern fill:#607D8B,color:#fff| Ação | Descrição |
|---|---|
| Iniciar | Retome um endpoint parado |
| Parar | Pause o endpoint |
| Eliminar | Remova o endpoint permanentemente |
Parar endpoint#
Pare um endpoint quando não quiser que ele aceite solicitações:
- Clique em Parar implantação na página da implantação
- O status do endpoint muda para "Parando" e, em seguida, para "Parado"
Endpoints parados:
- Não aceitam solicitações nem informam métricas em tempo real ou o status de integridade
- Deixam de acumular cobranças por tempo de atividade
- Perdem as estatísticas temporárias de monitoramento e as imagens de exemplo quando a instância de atendimento é encerrada
- Mantêm a URL, a região e a chave de API vinculada, e podem ser reiniciados a qualquer momento
- Continuam contando para a cota de implantações do seu plano — exclua um endpoint para liberar sua vaga
Excluir endpoint#
Remova um endpoint permanentemente:
- Abra Mais ações (…) na página da implantação e clique em Excluir implantação, ou clique no ícone da lixeira ao lado da implantação na barra lateral
- Confirme com Excluir
A exclusão é imediata e permanente — as implantações não vão para a Lixeira. Excluir o endpoint remove seu serviço e libera uma vaga na cota de implantações. Você sempre pode criar um novo endpoint, mas ele receberá uma nova URL.
As implantações também são removidas quando o modelo ou projeto é excluído permanentemente, ou quando um modelo ou projeto na lixeira chega ao fim do período de retenção.
Usar endpoints#
Autenticação#
Cada implantação é vinculada a uma única chave de API do espaço de trabalho que contém o modelo. Inclua essa chave nas solicitações:
Authorization: Bearer YOUR_API_KEYO endpoint aceita apenas a chave vinculada na criação, então nenhuma outra chave dá acesso a ele — nem mesmo outra chave ativa no mesmo espaço de trabalho. Para controlar qual chave será vinculada, faça a implantação pela API autenticada com a chave do proprietário do espaço de trabalho: essa chave específica será vinculada, e você já terá acesso a ela. As implantações criadas de qualquer outra forma (pela interface da Platform ou por uma chamada à API autenticada como membro da equipe) vinculam automaticamente uma das chaves ativas do espaço de trabalho proprietário — peça o valor ao proprietário do espaço de trabalho, pois só ele pode consultar os valores das chaves (consulte Chaves de API). Os membros da equipe sem a chave vinculada ainda podem executar inferências pelo proxy de previsão da Platform no navegador.
Excluir ou desativar a chave de API vinculada não revoga o acesso direto ao endpoint — qualquer pessoa que tenha a sequência da chave ainda pode chamar a URL do endpoint. O que deixa de funcionar é o proxy de previsão da Platform, que verifica a chave em tempo real e informa que ela não está mais disponível. Para revogar totalmente o acesso, pare ou exclua a implantação; depois de alternar as chaves, crie o endpoint novamente para vinculá-lo à nova chave.
Solicitações diretas ao endpoint#
Envie solicitações de produção diretamente à URL exibida na página da implantação. Essas solicitações não passam pelo limitador de taxa da API da Platform, então o limite de previsão de 20 solicitações por minuto não se aplica. O endpoint ainda tem seu próprio limite de capacidade:
- Uma única instância atende cada endpoint, processando um número limitado de solicitações simultâneas
- Solicitações que não podem ser atendidas prontamente retornam
429com um cabeçalhoRetry-After - Uma única solicitação pode levar até 1 hora, o que permite concluir a inferência de vídeo
- O corpo das solicitações tem limite de 32 MB; uploads maiores são rejeitados com
413 - Respostas maiores que 1 KB são compactadas com gzip, e solicitações do navegador entre origens diferentes são permitidas
Exemplo de solicitação#
import requests
# Endpoint da implantação
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"
# Cabeçalhos com sua chave de API da implantação
headers = {"Authorization": "Bearer YOUR_API_KEY"}
# Parâmetros de inferência
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}
# Envie uma imagem para inferência
with open("image.jpg", "rb") as f:
response = requests.post(url, headers=headers, data=data, files={"file": f})
print(response.json())Parâmetros do pedido#
| Parâmetro | Tipo | Padrão | Intervalo | Descrição |
|---|---|---|---|---|
file | ficheiro | - | - | Ficheiro de imagem ou vídeo (obrigatório, a menos que source esteja definido) |
conf | float | 0.25 | 0.01 – 1.0 | Limiar mínimo de confiança |
iou | float | 0.7 | 0.0 – 0.95 | Limiar de IoU da NMS |
imgsz | int | - | 32 – 1280 | Tamanho da imagem de entrada em píxeis; por predefinição, usa o tamanho de treino do modelo (640, se não estiver disponível) |
normalize | bool | false | - | Devolve as coordenadas da caixa delimitadora entre 0 e 1 |
decimals | int | 5 | 0 – 10 | Precisão decimal dos valores das coordenadas |
vid_stride | int | 1 | ≥ 1 | Prevê em cada N-ésimo fotograma do vídeo; as imagens ignoram este parâmetro |
bits | int | 8 | 8, 12, 16 | Quantização do mapa de profundidade; apenas para modelos de profundidade |
source | string | - | - | URL da imagem ou string em base64 (alternativa a file); máximo de 4,096 caracteres através da API da Platform |
Um endpoint mantém o ambiente de execução de inferência da última implantação, então comportamentos mais recentes, como o padrão de tamanho de treinamento imgsz ou o vid_stride acima, chegam ao endpoint quando uma nova revisão é implantada, por exemplo, depois que você substitui o modelo ou altera a CPU ou a memória. Passe imgsz explicitamente para fixar o tamanho da entrada.
Consulte Respostas de profundidade para saber como bits altera o mapa de profundidade retornado e como interpretá-lo.
Endpoints dedicados aceitam imagens e vídeos por meio do parâmetro file.
- Formatos de imagem (até 32 MB por solicitação): AVIF, BMP, DNG, HEIC, HEIF, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
- Formatos de vídeo (até 32 MB por solicitação): ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV
Os resultados são retornados para cada quadro de vídeo processado; os modelos de profundidade aceitam apenas imagens. Você também pode passar uma URL pública de imagem ou uma imagem codificada em base64 pelo parâmetro source, em vez de file. Uploads acima do limite são rejeitados com 413.
Formato da resposta#
Igual à inferência compartilhada, com campos específicos da tarefa.
Perguntas frequentes#
Os limites de endpoints dependem do plano:
- Gratuito: até 3 implantações
- Pro: até 10 implantações
- Enterprise: implantações ilimitadas
Cada modelo ainda pode ser implantado em várias regiões, dentro da cota do seu plano. A cota é contabilizada no espaço de trabalho que contém o modelo, então membros da equipe que implantam um modelo compartilhado consomem a cota do proprietário. Ao atingir o limite, é exibido um erro solicitando que você exclua primeiro uma implantação existente.
Não, as regiões são fixas. Para mudar de região:
- Exclua o endpoint existente
- Crie um novo endpoint na região desejada
O novo endpoint recebe uma nova URL. Para alterar apenas o modelo por trás de um endpoint, use a substituição de modelo, que mantém a URL.
Para ter cobertura global:
- Implante em várias regiões
- Use um balanceador de carga ou roteamento DNS
- Direcione os usuários ao endpoint mais próximo
O tempo de inicialização a frio depende do modelo e de o endpoint ter sido reduzido a zero; a inicialização a partir da inatividade pode levar até cerca de um minuto, e a Platform permite que um endpoint inativo tenha mais tempo para iniciar antes de considerá-lo não íntegro. Abrir a página da implantação ou executar novamente a verificação de integridade aquece um endpoint inativo, então faça uma dessas ações antes de chegar um pico de tráfego.
Não. Cada implantação atende o tráfego na URL gerada para o endpoint e exibida na página da implantação. Essa URL permanece estável durante toda a vida útil da implantação — inclusive quando o modelo é substituído.