Ultralytics YOLO27:
Get Started

Endpoints dedicados#

A Plataforma Ultralytics permite implementar modelos YOLO em endpoints dedicados em 42 regiões do mundo. Cada endpoint é um serviço de inquilino único, com um URL exclusivo e monitorização independente. O tamanho de recurso predefinido é reduzido a zero quando está inativo; os tamanhos personalizados mantêm uma instância ativa e são cobrados pelo tempo de atividade.

Aba de implementação da Plataforma Ultralytics, com mapa de regiões e tabela

Criar endpoint#

Na aba Deploy#

Implementa um modelo a partir da respetiva aba Deploy:

  1. Navega até ao teu modelo
  2. Clica na aba Deploy
  3. Consulta o mapa-múndi e a tabela de regiões, ordenada pela latência medida a partir da tua localização
  4. Clica em Deploy na linha da região que pretendes utilizar
  5. Na caixa de diálogo, consulta a CPU, a memória, o preço e o nome da implementação; depois, clica em Create Deployment

O nome sugerido combina o nome do modelo e a cidade da região (por exemplo, yolo26n-iowa) e pode ser editado antes da implementação. O modelo tem de ter pesos; caso contrário, a aba apresenta um estado vazio em vez da tabela de regiões.

Na aba Deployments#

Cria uma implementação a partir da aba Deployments do teu perfil ou da barra lateral:

  1. Clica em New Deployment na aba Deployments ou em + junto a Deployments na barra lateral
  2. Seleciona um modelo no seletor de modelos, que apresenta os modelos concluídos
  3. Seleciona uma região no minimapa ou na tabela de latência
  4. Escolhe a CPU e a memória, consulta o preço e, se necessário, edita o nome de implementação sugerido
  5. Clica em Create Deployment

Caixa de diálogo de nova implementação da Plataforma Ultralytics, com seletor de modelos e mapa de regiões

Ciclo de vida da implementação#

stateDiagram-v2
    [*] --> Creating: Deploy
    Creating --> Deploying: Service starting
    Deploying --> Ready: Service URL published
    Ready --> Stopping: Stop
    Ready --> Deploying: Replace model or resize
    Stopping --> Stopped: Stopped
    Stopped --> Deploying: Start
    Deploying --> Stopped: Start failed
    Ready --> [*]: Delete
    Stopped --> [*]: Delete
    Creating --> Failed: Error
    Deploying --> Failed: Error
    Failed --> [*]: Delete

    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
    classDef error fill:#F44336,color:#fff
    classDef extern fill:#607D8B,color:#fff
    class Creating,Deploying,Stopping proc
    class Ready out
    class Failed error
    class Stopped extern

Liga os alertas do Slack para receber uma mensagem quando uma implementação ficar pronta ou não conseguir iniciar.

Seleção de região#

Escolhe entre 42 regiões em todo o mundo. O mapa interativo de regiões e a tabela mostram:

  • Marcadores de região: codificados por cores segundo a latência, num gradiente do verde ao vermelho (as regiões mais rápidas são mais verdes e as mais lentas são mais vermelhas)
  • Regiões implementadas: destacadas com um emblema «Deployed» na tabela
  • Regiões em implementação: indicador de pulso animado no marcador e na linha da tabela
  • Realce bidirecional: ao passar o cursor sobre o mapa, a linha correspondente da tabela fica realçada, e vice-versa

Tabela de latência de regiões na aba Deploy da Plataforma Ultralytics, ordenada por latência

A tabela de regiões na aba Deploy do modelo inclui:

ColunaDescrição
LocalizaçãoCidade e país com ícone de bandeira
ZonaIdentificador da região
LatênciaTempo de ping medido a partir do teu navegador
DistânciaDistância aproximada da tua localização, em km
AçõesBotão Deploy ou emblema de estado «Deployed»

A tabela pode ser pesquisada por cidade, país e zona e, por predefinição, está ordenada por latência.

Caixa de diálogo de nova implementação

A caixa de diálogo New Deployment (na aba Deployments ou na barra lateral) apresenta uma tabela de regiões mais simples, com apenas as colunas Localização, Latência e Selecionar, e lista as 20 regiões mais rápidas com uma nota sobre as restantes. Usa o minimapa para escolher qualquer outra região.

Como a latência é medida

O teu navegador mede a latência para cada uma das 42 regiões. Os resultados são guardados em cache durante 30 minutos e partilhados entre a aba Deploy e a caixa de diálogo New Deployment. Usa o botão Rescan na aba Deploy do modelo para voltar a medir a partir da tua rede atual. A distância é calculada a partir da localização aproximada do teu pedido, por isso serve apenas como referência e não como valor exato.

Regiões disponíveis#

ZonaLocalização
us-central1Iowa, EUA
us-east1Carolina do Sul, EUA
us-east4Virgínia do Norte, EUA
us-east5Columbus, EUA
us-south1Dallas, EUA
us-west1Oregon, EUA
us-west2Los Angeles, EUA
us-west3Salt Lake City, EUA
us-west4Las Vegas, EUA
northamerica-northeast1Montreal, Canadá
northamerica-northeast2Toronto, Canadá
northamerica-south1Querétaro, México
southamerica-east1São Paulo, Brasil
southamerica-west1Santiago, Chile

Configuração do endpoint#

Caixa de diálogo de nova implantação#

A caixa de diálogo New Deployment permite selecionar um modelo, uma região, recursos e um nome para a implantação:

CampoDescrição
ModeloQualquer modelo concluído no espaço de trabalho, selecionado com o seletor
RegiãoRegião de implantação, escolhida no minimapa ou na tabela de latência
CPU e memóriaSeleciona o tamanho dos recursos e consulta os preços exibidos
Nome da implantaçãoGerado automaticamente após definir o modelo e a região, e editável

Caixa de diálogo de nova implantação da Ultralytics Platform com recursos padrão fixos

Escolhe o tamanho da CPU e da memória nos controles de recursos e consulta os preços exibidos antes de criar a implantação. As opções de CPU são 1, 2, 4, 6 ou 8 vCPU, e as opções de memória vão de 2 a 32 GiB; tamanhos de memória maiores precisam de mais vCPU (por exemplo, 16 GiB requer pelo menos 4 vCPU), e a caixa de diálogo explica qualquer combinação inválida. O tamanho padrão (1 vCPU, 2 GiB) é gratuito e reduz a zero quando fica inativo. Os tamanhos personalizados mantêm uma instância aquecida e são cobrados pela tarifa horária regional exibida desde que ficam prontas até interromperes o endpoint, incluindo o tempo ocioso. Criar, iniciar ou redimensionar para um tamanho personalizado requer créditos disponíveis, e os endpoints de tamanho personalizado são interrompidos automaticamente quando o espaço de trabalho fica sem créditos. Agentes reutiliza esta caixa de diálogo quando selecionas Nova implantação….

Caixa de diálogo de nova implantação da Ultralytics Platform com preços personalizados de CPU e memória

Nomes gerados automaticamente

O nome da implantação combina o nome do modelo com a cidade da região, por exemplo, yolo26n-iowa. Os nomes têm de ser exclusivos no espaço de trabalho: se o nome já estiver a ser utilizado, a caixa de diálogo apresenta um erro em linha e desativa Criar implantação até escolheres outro nome.

Separador Deploy (implantação rápida)#

A implantação a partir do separador Deploy do modelo abre a mesma caixa de diálogo, com o modelo e a região pré-selecionados. Consulta o tamanho dos recursos, os preços e o nome gerado automaticamente antes de criares o endpoint. A implantação aparece na lista de implantações do modelo, abaixo da tabela de regiões, enquanto está a ser criada.

Gerir endpoints#

Modos de visualização#

A lista de implantações permite três modos de visualização:

ModoDescrição
CartõesCartões com estado, tamanho, métricas, distância e data de implantação
CompactaGrelha de cartões menores com métricas principais
TabelaTabela de dados com colunas ordenáveis

Separador Deploy da Ultralytics Platform com vista de cartões das implantações ativas

Vistas compacta e de tabela

Os cartões compactos mostram a bandeira, o nome, a cidade, o estado e as três métricas. A vista de tabela permite ordenar por Nome, Região, Estado, CPU, Memória, Pedidos HTTP, Taxa de erros HTTP, Latência P95 HTTP, Distância e Implantação. Cada cartão e linha contém uma ligação para a página da implantação; as ações do ciclo de vida estão nessa página, e o ícone do caixote do lixo junto a uma implantação na barra lateral elimina-a.

Página da implantação#

Cada implantação tem a sua própria página em /{username}/deploy/{deployment}, que mostra:

  • Cabeçalho: bandeira da região, nome de apresentação (clica nele para o renomear; o URL da página e o caminho da API mudam para um slug do novo nome, mas o URL do endpoint não muda), indicador de estado, localização e tamanho da CPU e da memória
  • Ações: Atualizar configuração, Substituir modelo e Interromper implantação quando está Pronta; Iniciar implantação quando está Interrompida; e um menu Mais ações (…) com Informações, Atualizar e Eliminar implantação
  • Métricas: pedidos HTTP, taxa de erros HTTP e latência P95 HTTP ao longo de 24 horas, com minigráficos, além de um cartão com uma ligação para o modelo implantado
  • Separadores: Overview, Monitoring, Predict e Logs
  • Mensagem de estado: o motivo da falha, quando uma implantação falha

O separador Overview mostra o mapa de localização, o cartão Endpoint com o URL do endpoint que podes copiar, uma ligação para a documentação da API e uma verificação de estado, além de um cartão Informações da implantação com preços, região, CPU e memória. O separador Logs mostra as entradas de registo recentes, com filtragem por gravidade (Todas / Erros). O separador Predict disponibiliza um painel de previsão em linha para testar diretamente na implantação; o separador de resultados Docs contém exemplos de código prontos a utilizar em Python, JavaScript e cURL, preenchidos com o URL do endpoint e, para os proprietários do espaço de trabalho, com a chave de API associada (consulta Monitorização). A caixa de diálogo Informações apresenta as propriedades da implantação e permite-te editar metadados personalizados.

Atualizar CPU e memória#

  1. Abre a página da implantação de um endpoint Pronto.
  2. Clica em Atualizar configuração.
  3. Escolhe CPU e Memória e consulta o custo horário apresentado.
  4. Clica em Atualizar configuração. A configuração atual continua a servir pedidos até a nova estar pronta.

Atualização da configuração de CPU e memória da implantação na Ultralytics Platform

Os recursos personalizados são cobrados pelo tempo de atividade e mantêm uma instância ativa, o que também permite manter uma câmara IP em execução sem custos adicionais (consulta Câmara em segundo plano). Regressar aos recursos predefinidos restaura o comportamento de redução a zero e remove a câmara em segundo plano.

Dados temporários de monitorização

Os gráficos de monitorização e as imagens de exemplo são dados leves mantidos na memória. Interromper, reiniciar, reimplantar, redimensionar ou substituir um modelo pode apagá-los. Iniciar o endpoint novamente não restaura o histórico. Guarda os exemplos úteis num conjunto de dados e aguarda a conclusão da ingestão antes de alterar o endpoint. As métricas operacionais e os registos têm períodos de histórico separados.

Substituir um modelo#

Substitui o modelo associado a um endpoint pronto sem alterar o respetivo URL:

  1. Abre a página da implantação
  2. Clica em Substituir modelo
  3. Seleciona outro modelo concluído do mesmo espaço de trabalho
  4. Se quiseres, edita o nome da implantação
  5. Clica em Substituir modelo

O modelo atual continua a servir pedidos enquanto o modelo de substituição é iniciado. Quando o modelo de substituição fica pronto, o tráfego passa para o novo modelo. O ID da implantação, o URL, a região e a chave de API mantêm-se inalterados; o nome de apresentação só muda se introduzires um novo. Se a substituição falhar, o modelo e o nome anteriores continuam ativos.

A substituição requer todos os seguintes requisitos; caso contrário, é rejeitada:

  • A implantação está Pronta e não há nenhuma outra operação de ciclo de vida em andamento
  • O modelo de substituição tem pesos e pertence ao mesmo espaço de trabalho que a implantação
  • O modelo de substituição não é o que já está implantado
Um modelo por endpoint

A substituição remove o modelo anterior da implantação. Cada endpoint atende um modelo; crie outra implantação quando precisar que os dois modelos estejam disponíveis ao mesmo tempo.

Status das implantações#

StatusDescrição
CriandoA implantação está sendo configurada
ImplantandoO contêiner está iniciando
ProntoO endpoint está ativo e aceitando solicitações
ParandoO endpoint está sendo encerrado
ParadoO endpoint está pausado e indisponível
FalhouFalha na implantação (consulte a mensagem de erro)

Em uma implantação Pronta, o selo da página exibe Iniciando até o endpoint responder à primeira verificação de integridade e Sem resposta se a verificação falhar.

URL do endpoint#

Cada endpoint tem uma URL exclusiva, por exemplo:

https://predict-<deployment-id>-<hash>-<region>.a.run.app

Cartão de implantação da Ultralytics Platform com URL do endpoint e botão para copiar

Clique no botão de copiar para copiar a URL. Clique em Documentação da API para abrir a referência da API do próprio endpoint. O endpoint oferece estes caminhos:

CaminhoMétodoDescrição
/predictPOSTExecuta a inferência; requer a chave de API da implantação
/healthGETVerificação de atividade que informa o status do serviço e o número de modelos em cache
/GETResumo do status do serviço implantado
/docsGETReferência interativa da API gerada para esta implantação, modelo e região

Gerenciamento do ciclo de vida#

Controle o estado do endpoint:

graph LR
    R[Ready]:::out -->|Stop| S[Stopped]:::extern
    S -->|Start| R
    R -->|Delete| D[Deleted]:::error
    S -->|Delete| D

    classDef out fill:#9C27B0,color:#fff
    classDef error fill:#F44336,color:#fff
    classDef extern fill:#607D8B,color:#fff
AçãoDescrição
IniciarRetome um endpoint parado
PararPause o endpoint
EliminarRemova o endpoint permanentemente

Parar endpoint#

Pare um endpoint quando não quiser que ele aceite solicitações:

  1. Clique em Parar implantação na página da implantação
  2. O status do endpoint muda para "Parando" e, em seguida, para "Parado"

Endpoints parados:

  • Não aceitam solicitações nem informam métricas em tempo real ou o status de integridade
  • Deixam de acumular cobranças por tempo de atividade
  • Perdem as estatísticas temporárias de monitoramento e as imagens de exemplo quando a instância de atendimento é encerrada
  • Mantêm a URL, a região e a chave de API vinculada, e podem ser reiniciados a qualquer momento
  • Continuam contando para a cota de implantações do seu plano — exclua um endpoint para liberar sua vaga

Excluir endpoint#

Remova um endpoint permanentemente:

  1. Abra Mais ações (…) na página da implantação e clique em Excluir implantação, ou clique no ícone da lixeira ao lado da implantação na barra lateral
  2. Confirme com Excluir
Ação permanente

A exclusão é imediata e permanente — as implantações não vão para a Lixeira. Excluir o endpoint remove seu serviço e libera uma vaga na cota de implantações. Você sempre pode criar um novo endpoint, mas ele receberá uma nova URL.

As implantações também são removidas quando o modelo ou projeto é excluído permanentemente, ou quando um modelo ou projeto na lixeira chega ao fim do período de retenção.

Usar endpoints#

Autenticação#

Cada implantação é vinculada a uma única chave de API do espaço de trabalho que contém o modelo. Inclua essa chave nas solicitações:

Authorization: Bearer YOUR_API_KEY

O endpoint aceita apenas a chave vinculada na criação, então nenhuma outra chave dá acesso a ele — nem mesmo outra chave ativa no mesmo espaço de trabalho. Para controlar qual chave será vinculada, faça a implantação pela API autenticada com a chave do proprietário do espaço de trabalho: essa chave específica será vinculada, e você já terá acesso a ela. As implantações criadas de qualquer outra forma (pela interface da Platform ou por uma chamada à API autenticada como membro da equipe) vinculam automaticamente uma das chaves ativas do espaço de trabalho proprietário — peça o valor ao proprietário do espaço de trabalho, pois só ele pode consultar os valores das chaves (consulte Chaves de API). Os membros da equipe sem a chave vinculada ainda podem executar inferências pelo proxy de previsão da Platform no navegador.

Excluir a chave vinculada não bloqueia o endpoint

Excluir ou desativar a chave de API vinculada não revoga o acesso direto ao endpoint — qualquer pessoa que tenha a sequência da chave ainda pode chamar a URL do endpoint. O que deixa de funcionar é o proxy de previsão da Platform, que verifica a chave em tempo real e informa que ela não está mais disponível. Para revogar totalmente o acesso, pare ou exclua a implantação; depois de alternar as chaves, crie o endpoint novamente para vinculá-lo à nova chave.

Solicitações diretas ao endpoint#

Envie solicitações de produção diretamente à URL exibida na página da implantação. Essas solicitações não passam pelo limitador de taxa da API da Platform, então o limite de previsão de 20 solicitações por minuto não se aplica. O endpoint ainda tem seu próprio limite de capacidade:

  • Uma única instância atende cada endpoint, processando um número limitado de solicitações simultâneas
  • Solicitações que não podem ser atendidas prontamente retornam 429 com um cabeçalho Retry-After
  • Uma única solicitação pode levar até 1 hora, o que permite concluir a inferência de vídeo
  • O corpo das solicitações tem limite de 32 MB; uploads maiores são rejeitados com 413
  • Respostas maiores que 1 KB são compactadas com gzip, e solicitações do navegador entre origens diferentes são permitidas

Exemplo de solicitação#

import requests

# Endpoint da implantação
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"

# Cabeçalhos com sua chave de API da implantação
headers = {"Authorization": "Bearer YOUR_API_KEY"}

# Parâmetros de inferência
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}

# Envie uma imagem para inferência
with open("image.jpg", "rb") as f:
    response = requests.post(url, headers=headers, data=data, files={"file": f})

print(response.json())

Parâmetros do pedido#

ParâmetroTipoPadrãoIntervaloDescrição
fileficheiro--Ficheiro de imagem ou vídeo (obrigatório, a menos que source esteja definido)
conffloat0.250.01 – 1.0Limiar mínimo de confiança
ioufloat0.70.0 – 0.95Limiar de IoU da NMS
imgszint-32 – 1280Tamanho da imagem de entrada em píxeis; por predefinição, usa o tamanho de treino do modelo (640, se não estiver disponível)
normalizeboolfalse-Devolve as coordenadas da caixa delimitadora entre 0 e 1
decimalsint50 – 10Precisão decimal dos valores das coordenadas
vid_strideint1≥ 1Prevê em cada N-ésimo fotograma do vídeo; as imagens ignoram este parâmetro
bitsint88, 12, 16Quantização do mapa de profundidade; apenas para modelos de profundidade
sourcestring--URL da imagem ou string em base64 (alternativa a file); máximo de 4,096 caracteres através da API da Platform

Um endpoint mantém o ambiente de execução de inferência da última implantação, então comportamentos mais recentes, como o padrão de tamanho de treinamento imgsz ou o vid_stride acima, chegam ao endpoint quando uma nova revisão é implantada, por exemplo, depois que você substitui o modelo ou altera a CPU ou a memória. Passe imgsz explicitamente para fixar o tamanho da entrada.

Consulte Respostas de profundidade para saber como bits altera o mapa de profundidade retornado e como interpretá-lo.

Inferência de vídeo

Endpoints dedicados aceitam imagens e vídeos por meio do parâmetro file.

  • Formatos de imagem (até 32 MB por solicitação): AVIF, BMP, DNG, HEIC, HEIF, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
  • Formatos de vídeo (até 32 MB por solicitação): ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV

Os resultados são retornados para cada quadro de vídeo processado; os modelos de profundidade aceitam apenas imagens. Você também pode passar uma URL pública de imagem ou uma imagem codificada em base64 pelo parâmetro source, em vez de file. Uploads acima do limite são rejeitados com 413.

Formato da resposta#

Igual à inferência compartilhada, com campos específicos da tarefa.

Perguntas frequentes#

  • Os limites de endpoints dependem do plano:

    • Gratuito: até 3 implantações
    • Pro: até 10 implantações
    • Enterprise: implantações ilimitadas

    Cada modelo ainda pode ser implantado em várias regiões, dentro da cota do seu plano. A cota é contabilizada no espaço de trabalho que contém o modelo, então membros da equipe que implantam um modelo compartilhado consomem a cota do proprietário. Ao atingir o limite, é exibido um erro solicitando que você exclua primeiro uma implantação existente.

  • Não, as regiões são fixas. Para mudar de região:

    1. Exclua o endpoint existente
    2. Crie um novo endpoint na região desejada

    O novo endpoint recebe uma nova URL. Para alterar apenas o modelo por trás de um endpoint, use a substituição de modelo, que mantém a URL.

  • Para ter cobertura global:

    1. Implante em várias regiões
    2. Use um balanceador de carga ou roteamento DNS
    3. Direcione os usuários ao endpoint mais próximo
  • O tempo de inicialização a frio depende do modelo e de o endpoint ter sido reduzido a zero; a inicialização a partir da inatividade pode levar até cerca de um minuto, e a Platform permite que um endpoint inativo tenha mais tempo para iniciar antes de considerá-lo não íntegro. Abrir a página da implantação ou executar novamente a verificação de integridade aquece um endpoint inativo, então faça uma dessas ações antes de chegar um pico de tráfego.

  • Não. Cada implantação atende o tráfego na URL gerada para o endpoint e exibida na página da implantação. Essa URL permanece estável durante toda a vida útil da implantação — inclusive quando o modelo é substituído.

Comentários