YOLO Vision 2026:

Endpoints Dedicados#

Ultralytics Platform permite a implementação de modelos YOLO em endpoints dedicados em 42 regiões globais. Cada endpoint é um serviço de locatário único com comportamento de escala para zero, um URL de endpoint exclusivo e monitoramento independente.

Ultralytics Platform Model Deploy Tab With Region Map And Table

Criar Endpoint#

A partir da guia Deploy#

Implementa um modelo a partir da tua aba Deploy:

  1. Navegue até seu modelo
  2. Clique na guia Deploy
  3. Analisa o mapa-múndi e a tabela de regiões, que está ordenada pela latência medida a partir da tua localização
  4. Clica em Deploy na linha da região que queres usar

A implementação começa imediatamente sem etapa de nomeação: o nome é gerado a partir do nome do modelo e da cidade da região (por exemplo, yolo26n-iowa). O modelo deve ter pesos, caso contrário, a aba exibe um estado vazio em vez da tabela de regiões.

A partir da página Deployments#

Cria uma implementação a partir da página global Deploy na barra lateral:

  1. Clique em New Deployment
  2. Seleciona um modelo no seletor de modelos, que lista os teus modelos concluídos
  3. Seleciona uma região no mini-mapa ou na tabela de latência
  4. Analisa o nome de implementação gerado automaticamente, que podes editar aqui
  5. Clique em Deploy Model

Ultralytics Platform New Deployment Dialog With Model Selector And Region Map

Ciclo de Vida de Implantação#

stateDiagram-v2
    [*] --> Creating: Deploy
    Creating --> Deploying: Service starting
    Deploying --> Ready: Service URL published
    Ready --> Stopping: Stop
    Ready --> Deploying: Replace model
    Stopping --> Stopped: Stopped
    Stopped --> Deploying: Start
    Deploying --> Stopped: Start failed
    Ready --> [*]: Delete
    Stopped --> [*]: Delete
    Creating --> Failed: Error
    Deploying --> Failed: Error
    Failed --> [*]: Delete

    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
    classDef error fill:#F44336,color:#fff
    classDef extern fill:#607D8B,color:#fff
    class Creating,Deploying,Stopping proc
    class Ready out
    class Failed error
    class Stopped extern

Conecta Slack alerts para receber uma mensagem quando uma implementação ficar pronta ou falhar ao iniciar.

Seleção de Região#

Escolhe entre 42 regiões em todo o mundo. O mapa de regiões interativo e a tabela mostram:

  • Pinos de região: Codificados por cores por latência em um gradiente de verde para vermelho (regiões mais rápidas são mais verdes, regiões mais lentas são mais vermelhas)
  • Regiões implementadas: Destacadas com um crachá "Deployed" na tabela
  • Regiões em implementação: Indicador de pulsação animado no marcador e na linha da tabela
  • Destaque bidirecional: Passar o mouse sobre o mapa destaca a linha da tabela, e vice-versa

Ultralytics Platform Deploy Tab Region Latency Table Sorted By Latency A tabela de regiões na aba do modelo Deploy inclui:

ColunaDescrição
LocalizaçãoCidade e país com ícone de bandeira
ZonaIdentificador da região
LatênciaTempo de ping medido a partir do teu navegador
DistânciaDistância da tua localização aproximada em km
AçõesBotão Deploy ou selo de status "Deployed"

A tabela permite pesquisa por cidade, país e zona, e é ordenada por latência por predefinição.

Caixa de Diálogo Nova Implementação

O diálogo New Deployment (da página global Deploy) mostra uma tabela de regiões mais simples, apenas com as colunas Location, Latency e Select, listando as 20 regiões mais rápidas com uma nota sobre as restantes. Usa o mini-mapa para escolher qualquer outra região.

Como a Latência é Medida

O teu navegador mede a latência para cada uma das 42 regiões, e os resultados são colocados em cache durante 30 minutos e partilhados entre a aba Deploy e o diálogo New Deployment. Usa o botão Rescan na aba do modelo Deploy para voltar a medir a partir da tua rede atual. A distância é calculada a partir da localização aproximada do teu pedido, pelo que serve de guia aproximado e não de um valor preciso.

Regiões Disponíveis#

ZonaLocalização
us-central1Iowa, EUA
us-east1Carolina do Sul, EUA
us-east4Virgínia do Norte, EUA
us-east5Columbus, EUA
us-south1Dallas, EUA
us-west1Oregon, EUA
us-west2Los Angeles, EUA
us-west3Salt Lake City, EUA
us-west4Las Vegas, EUA
northamerica-northeast1Montreal, Canadá
northamerica-northeast2Toronto, Canadá
northamerica-south1Querétaro, México
southamerica-east1São Paulo, Brasil
southamerica-west1Santiago, Chile

Configuração de Endpoint#

Caixa de Diálogo Nova Implementação#

O diálogo New Deployment recolhe três entradas:

CampoDescrição
ModeloQualquer modelo concluído no espaço de trabalho, escolhido com o seletor
RegiãoRegião de implementação, escolhida no mini-mapa ou na tabela de latência
Nome da ImplantaçãoGerado automaticamente assim que o modelo e a região são definidos, e editável

Ultralytics Platform New Deployment Dialog Fixed Resource Defaults Abaixo do nome, um painel Resources de leitura exclusiva contém um crachá Custom resources coming soon. Os recursos não são configuráveis atualmente: cada endpoint é executado como uma única instância que é reduzida a zero quando inativa.

Nomes Gerados Automaticamente

O nome da implementação combina o nome do modelo com a cidade da região, por exemplo yolo26n-iowa. Na aba do modelo Deploy, é adicionado um sufixo numérico quando esse modelo já tem uma implementação na região (por exemplo yolo26n-iowa-2). Os nomes devem ser únicos dentro de um espaço de trabalho — implementar um nome que já existe devolve um erro em vez de mudar o nome silenciosamente.

Guia Deploy (Implantação Rápida)#

Implementar a partir da aba Deploy do modelo utiliza os mesmos recursos fixos e o nome gerado automaticamente, sem etapa de diálogo. A implementação aparece imediatamente na lista Active Deployments abaixo da tabela de regiões enquanto é criada.

Gerenciar Endpoints#

Modos de Visualização#

A lista de implantações suporta três modos de visualização:

ModoDescrição
CartõesCartões de detalhes completos com logs, exemplos de código, painel de previsão
CompactoGrade de cartões menores com métricas principais
TabelaDataTable com colunas ordenáveis e pesquisa

Ultralytics Platform Deploy Tab Active Deployments Cards View

Cartão de Implantação (Visualização de Cartões)#

Cada cartão de implantação na visualização de cartões mostra:

  • Cabeçalho: Nome, bandeira da região, crachá de estado e os botões de ação disponíveis para o estado atual — substituir e parar quando estiver Ready, iniciar quando estiver Stopped, eliminar a qualquer momento
  • URL do Endpoint: URL copiável com uma ligação para a referência da API própria do endpoint
  • Métricas: Contagem de pedidos (24h), latência P95, taxa de erro ou "No traffic yet"
  • Verificação de integridade: Indicador de integridade ao vivo com latência e atualização manual
  • Abas: Logs, Code e Predict
  • Rodapé: O prefixo da chave de API associada à implementação e a data em que ficou pronta
  • Mensagem de estado: O motivo da falha, quando uma implementação falha

O URL, as métricas, a verificação de estado de saúde e as abas aparecem apenas enquanto a implementação estiver Ready. A aba Logs mostra entradas de registo recentes com filtragem de gravidade (All / Errors). A aba Code mostra exemplos de código prontos a usar em Python, JavaScript e cURL com o teu URL de endpoint, além da chave de API associada para os proprietários do espaço de trabalho (consulta Monitoring). A aba Predict disponibiliza um painel de previsão em linha para testar diretamente na implementação.

Vistas Compacta e em Tabela

Os cartões compactos mostram a bandeira, o nome, a cidade, o estado e as três métricas. A vista em tabela é ordenável por Name, Region, Status, Requests, P95 e Errors, com pesquisa em nome, região e estado. Ambas as vistas mantêm a ação de eliminar; iniciar, parar e substituir estão disponíveis na vista de cartões.

Substituir um Modelo#

Substitua o modelo por trás de um endpoint pronto sem alterar a URL dele:

  1. Abra o deploy na visualização Cards
  2. Clique em Replace model
  3. Selecione outro modelo concluído do mesmo workspace
  4. Opcionalmente, edite o nome do deploy
  5. Clique em Replace Model

O modelo atual continua a servir enquanto a substituição é iniciada. Assim que a substituição estiver pronta, o tráfego é direcionado para o novo modelo. O ID da implementação, o URL, a região e a chave de API permanecem inalterados; o nome de apresentação só muda se introduzires um novo. Se a substituição falhar, o modelo e o nome anteriores continuam ativos.

A substituição requer todos os pontos seguintes e é rejeitada caso contrário:

  • A implementação está Ready e não tem nenhuma outra operação do ciclo de vida em curso
  • O modelo de substituição tem pesos e pertence ao mesmo espaço de trabalho da implementação
  • O modelo de substituição não é aquele que já está implementado
Um Modelo por Endpoint

A substituição remove o modelo anterior do deploy. Cada endpoint atende a um modelo; crie outro deploy quando precisar de ambos os modelos disponíveis ao mesmo tempo.

Status de Implantação#

StatusDescrição
CriandoA implantação está sendo configurada
ImplantandoO contêiner está iniciando
ProntoO endpoint está ativo e aceitando solicitações
ParandoO endpoint está sendo desligado
ParadoO endpoint está pausado e indisponível
FailedA implantação falhou (consulte a mensagem de erro)

URL do Endpoint#

Cada endpoint possui uma URL única, por exemplo:

https://predict-<deployment-id>-<hash>-<region>.a.run.app

Ultralytics Platform Deployment Card Endpoint Url With Copy Button Clica no botão de cópia para copiar o URL. Clica no ícone de documentação para abrir a referência da API própria do endpoint. O endpoint serve estes caminhos:

CaminhoMétodoDescrição
/predictPOSTExecutar inferência; requer a chave de API da implementação
/healthGETVerificação de atividade que reporta o estado do serviço e o número de modelos em cache
/GETResumo de estado para o serviço implementado
/docsGETReferência de API interativa gerada para esta implementação, modelo e região

Gerenciamento de Ciclo de Vida#

Controle o estado do seu endpoint:

graph LR
    R[Ready]:::out -->|Stop| S[Stopped]:::extern
    S -->|Start| R
    R -->|Delete| D[Deleted]:::error
    S -->|Delete| D

    classDef out fill:#9C27B0,color:#fff
    classDef error fill:#F44336,color:#fff
    classDef extern fill:#607D8B,color:#fff
AçãoDescrição
IniciarRetomar um endpoint parado
PararPausar o endpoint
DeleteRemover permanentemente o endpoint

Parar Endpoint#

Para um endpoint quando não quiseres que ele aceite pedidos:

  1. Clique no ícone de pausa no cartão de implantação
  2. O status do endpoint muda para "Parando" e depois para "Parado"

Endpoints parados:

  • Não aceitar pedidos e não reportar métricas nem estado de saúde
  • Mantêm o seu URL, região e chave de API associada, e podem ser reiniciados a qualquer momento
  • Continuam a contar para a quota de implementação do teu plano — elimina um endpoint para libertar o seu espaço

Excluir Endpoint#

Remover permanentemente um endpoint:

  1. Clique no ícone de exclusão (lixeira) no cartão de implantação
  2. Confirme a exclusão na caixa de diálogo
Ação Permanente

A eliminação é imediata e permanente — as implementações não vão para Trash. Eliminar o endpoint remove o respetivo serviço e liberta um espaço na tua quota de implementação. Podes sempre criar um novo endpoint, mas este recebe um novo URL.

As implementações também são removidas quando o respetivo modelo ou projeto é eliminado permanentemente, ou quando um modelo ou projeto colocado no lixo atinge o fim da sua janela de retenção.

Usando Endpoints#

Autenticação#

Cada implementação está associada a uma única chave de API do espaço de trabalho proprietário do modelo. Inclui-a nos pedidos:

Authorization: Bearer YOUR_API_KEY

O endpoint aceita apenas a chave associada na criação, pelo que nenhuma outra chave o abre — nem mesmo outra chave ativa no mesmo espaço de trabalho. Para controlares qual a chave associada, implementa através da API autenticada com a chave do proprietário do espaço de trabalho: essa exata chave fica associada e tu já a possuis. As implementações criadas de qualquer outra forma (a interface da Plataforma ou uma chamada de API autenticada como membro de equipa) associam automaticamente uma das chaves ativas do espaço de trabalho proprietário — identifica-a pelo prefixo da chave apresentado no rodapé do cartão de implementação e pede o valor ao proprietário do espaço de trabalho, uma vez que apenas o proprietário pode ver os valores das chaves (consulta API Keys). Os membros de equipa sem a chave associada ainda podem executar inferências através do proxy de previsão da Plataforma no navegador.

Eliminar a Chave Associada Não Bloqueia o Endpoint

Eliminar ou desativar a chave de API associada não revoga o acesso direto ao endpoint — qualquer pessoa que possua a string da chave ainda pode chamar o URL do endpoint. O que deixa de funcionar é o proxy de previsão da Plataforma, que verifica a chave em tempo real e reporta-a como já não estando disponível. Para revogar totalmente o acesso, para ou elimina a implementação; após rodar as chaves, cria o endpoint novamente para que associe a nova chave.

Pedidos Diretos de Endpoint#

Envia pedidos de produção diretamente para o URL apresentado no cartão de implementação. Estes pedidos não passam pelo limitador de taxa da API da Plataforma, pelo que o limite de previsão de 20 pedidos/minuto não se aplica. O endpoint ainda tem o seu próprio limite de capacidade:

  • Uma única instância serve cada endpoint, processando um número limitado de pedidos de cada vez
  • Os pedidos que não possam ser servidos prontamente devolvem 429 com um cabeçalho Retry-After
  • Um único pedido pode ser executado durante até 1 hora, o que permite que a inferência de vídeo seja concluída
  • As respostas superiores a 1 KB são comprimidas com gzip e são permitidos pedidos de navegador de origem cruzada

Exemplo de solicitação#

import requests

# Deployment endpoint
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"

# Headers with your deployment API key
headers = {"Authorization": "Bearer YOUR_API_KEY"}

# Inference parameters
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}

# Send image for inference
with open("image.jpg", "rb") as f:
    response = requests.post(url, headers=headers, data=data, files={"file": f})

print(response.json())

Parâmetros de solicitação#

ParâmetroTipoPredefiniçãoIntervaloDescrição
filearquivo--Ficheiro de imagem ou vídeo (obrigatório, a menos que source esteja definido)
conffloat0.250.01 – 1.0Limite mínimo de confiança
ioufloat0.70.0 – 0.95Limite de IoU do NMS
imgszint64032 – 1280Tamanho da imagem de entrada em pixels
normalizeboolfalse-Retornar coordenadas de caixa delimitadora como 0 – 1
decimalsint50 – 10Precisão decimal para valores de coordenadas
bitsint88, 12, 16Quantização de mapa de profundidade, apenas para modelos de profundidade
sourcestring--URL da imagem ou string base64 (alternativa a file)

Consulta Depth responses para saberes como o bits altera o mapa de profundidade devolvido e como decodificá-lo.

Inferência de vídeo

Os endpoints dedicados aceitam imagens e vídeos através do parâmetro file.

  • Formatos de imagem (até 100 MB): AVIF, BMP, DNG, HEIC, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
  • Formatos de vídeo (até 100 MB): ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV

Cada fotograma de vídeo é processado individualmente e os resultados são devolvidos por fotograma. Também podes passar um URL de imagem público ou uma imagem codificada em base64 através do parâmetro source em vez de file. Os carregamentos sobredimensionados são rejeitados com 413.

Formato de Resposta#

O mesmo que shared inference com campos específicos de tarefas.

FAQ#

  • Os limites de endpoint dependem do plano:

    • Free: Até 3 implantações
    • Pro: Até 10 implantações
    • Enterprise: Implantações ilimitadas

    Cada modelo ainda pode ser implementado em várias regiões dentro da quota do teu plano. A quota é contabilizada contra o espaço de trabalho proprietário do modelo, pelo que os membros de equipa que implementam um modelo partilhado consomem a alocação do proprietário. Atingir o limite devolve um erro a pedir que elimines primeiro uma implementação existente.

  • Não, as regiões são fixas. Para alterar as regiões:

    1. Exclua o endpoint existente
    2. Crie um novo endpoint na região desejada

    O novo endpoint recebe um novo URL. Para alterar apenas o modelo subjacente a um endpoint, usa a substituição de modelo, que mantém o URL.

  • Para cobertura global:

    1. Implante em várias regiões
    2. Use um balanceador de carga ou roteamento DNS
    3. Encaminhe os usuários para o endpoint mais próximo
  • O tempo de arranque a frio depende do modelo e de o endpoint ter sido reduzido a zero; a Plataforma concede a um endpoint inativo tempo extra para arrancar antes de o reportar como não saudável. Executar uma verificação de estado de saúde a partir do cartão de implementação antes de um pico de tráfego aquece a instância.

  • Não. Cada implementação serve tráfego no URL de endpoint gerado apresentado no respetivo cartão de implementação, que permanece estável durante todo o ciclo de vida da implementação — inclusive entre substituições de modelos.

Comentários