Ultralytics YOLO27:
Get Started

Implantação#

A Ultralytics Platform oferece opções abrangentes de implantação de modelos para colocar seus modelos YOLO em produção. Teste modelos com inferência no navegador, implante em endpoints dedicados em 42 regiões do mundo e monitore o desempenho em tempo real.



Assista: Comece a usar a plataforma Ultralytics: implantação

Visão geral#

A seção Implantação ajuda você a:

  • Testar modelos diretamente no navegador usando a aba Predict
  • Implantar em endpoints dedicados em 42 regiões do mundo
  • Monitorar métricas de solicitações, registros, verificações de integridade e previsões temporárias em cada endpoint dedicado
  • Escolher recursos: os endpoints padrão reduzem a escala a zero; os tamanhos personalizados mantêm uma instância ativa com cobrança pelo tempo de atividade

Mapa-múndi da aba Deployments da Ultralytics Platform com cartões de visão geral

Opções de implantação#

A Ultralytics Platform oferece vários caminhos de implantação:

OpçãoDescriçãoIdeal para
Aba PredictImagem, webcam, exemplos; câmara IP nos teus próprios endpointsDesenvolvimento, validação
Inferência compartilhadaServiço multi-inquilino em 3 regiões de dadosUso leve, testes
Endpoints dedicadosServiços de inquilino único em 42 regiõesProdução, baixa latência
ExportaçãoBaixe pesos em 22 formatos para execução local ou na bordaOff-line, no dispositivo

Fluxo de trabalho#

EstágioDescrição
TesteValide o modelo usando a aba Predict
ConfigurarSelecione um modelo, uma região, uma CPU e a memória; confira os preços e o nome da implantação
ImplantarCrie um endpoint dedicado na aba Deploy
MonitorarInspecione as métricas do endpoint e as previsões temporárias em Monitoramento

Arquitetura#

Inferência compartilhada#

O serviço de inferência compartilhada funciona em 3 regiões principais. As solicitações a um modelo são encaminhadas ao serviço na sua região de dados, para que os resultados permaneçam na região onde o modelo está armazenado:

RegiãoRótuloLocalizaçãoIdeal para
USAméricasIowa, EUAUsuários das Américas; menor latência para as Américas
EUEuropa, Oriente Médio e ÁfricaBélgica, EuropaUsuários europeus; conformidade com o GDPR
APÁsia-PacíficoTaiwan, Ásia-PacíficoUsuários da Ásia-Pacífico; menor latência na região APAC

Endpoints dedicados#

Implante em 42 regiões do mundo na Ultralytics Cloud:

  • Américas: 14 regiões
  • Europa: 13 regiões
  • Ásia-Pacífico: 12 regiões
  • Oriente Médio e África: 3 regiões

Cada endpoint é um serviço de inquilino único com:

  • CPU e memória configuráveis, com preços exibidos antes da implantação
  • Redução da escala a zero para recursos padrão; instância ativa com cobrança pelo tempo de atividade para recursos personalizados
  • URL de endpoint exclusiva com referência interativa da API própria em /docs
  • Vinculação à própria chave de API, para que somente essa chave possa chamar o endpoint
  • Monitoramento, registros e verificações de integridade independentes

Aba Deployments#

Todas as suas implantações aparecem na aba Deployments do seu perfil (/{username}?tab=deployments), ao lado de Datasets e Projects. A seção Deployments da barra lateral lista suas implantações, cada uma com um link para sua página, um botão + para criar uma implantação e um link para a aba completa. A aba mostra:

  • Mapa-múndi com marcadores das regiões implantadas; clique em uma região para abrir a caixa de diálogo New Deployment
  • Cartões de visão geral: implantações ativas, solicitações HTTP (24 h), taxa de erros HTTP (24 h), latência HTTP P95 (24 h)
  • Lista de implantações com pesquisa, classificação e três modos de visualização: cartões, compacta e tabela; cada implantação tem um link para sua própria página, com as abas Overview, Monitoring, Predict e Logs
  • Botão Nova implantação para criar endpoints a partir de qualquer modelo concluído

Cartões de visão geral e lista de implantações da aba Deployments da Ultralytics Platform

Atualização automática

A aba é atualizada automaticamente e com mais frequência enquanto uma implantação está mudando de estado (creating, deploying ou stopping). Consulte Monitoramento para mais detalhes.

Monitoramento leve e temporário

Cada endpoint dedicado pronto oferece gráficos e imagens de exemplo armazenados apenas na memória da instância de serviço. Parar, reiniciar, implantar novamente, redimensionar ou substituir o modelo pode apagar esses dados. Salve os exemplos em um conjunto de dados e aguarde a conclusão da ingestão para mantê-los. Consulte Monitoramento.

Principais funcionalidades#

Cobertura global#

Implante perto dos seus usuários com 42 regiões que abrangem:

  • América do Norte, América do Sul
  • Europa, Oriente Médio, África
  • Ásia-Pacífico, Oceania

Comportamento de escalabilidade#

Atualmente, os endpoints funcionam da seguinte forma:

  • Recursos padrão: endpoints ociosos reduzem a escala a zero e iniciam a frio na próxima solicitação
  • Recursos personalizados: uma instância permanece ativa e acumula cobranças pelo tempo de atividade até ser parada
  • Uma única instância ativa: atualmente, cada endpoint atende a todas as solicitações a partir de uma única instância, em todos os planos
  • Limitação de carga: as solicitações recebem respostas 429 quando o endpoint está temporariamente no limite da capacidade — consulte Solicitações diretas a endpoints
  • Tempo limite da solicitação: as solicitações diretas ao endpoint têm duração máxima de 1 hora; consulte Inferência para ver as entradas compatíveis

Implantação regional#

Use a latência medida por região para posicionar um endpoint perto de quem o utiliza. A latência real da inferência depende do modelo, do tamanho da entrada, do estado do endpoint e do percurso da rede.

Verificações de integridade#

Cada implantação em execução inclui uma verificação automática de integridade com:

  • Indicador de status em tempo real (saudável/não saudável)
  • Exibição da latência de resposta
  • Nova tentativa automática quando não está saudável, interrompida assim que fica saudável
  • Botão para verificar novamente manualmente

Início rápido#

Criar uma implantação:

  1. Treine ou carregue um modelo em um projeto
  2. Acede ao separador Deploy do modelo
  3. Clica em Deploy para uma região na tabela de latência
  4. Revê a CPU, a memória, o preço e o nome na caixa de diálogo de implementação
  5. Clica em Create Deployment e aguarda até o estado da implementação passar a Ready
Implementação rápida
Model → Deploy tab → Deploy in a region → Review configuration → Create Deployment

O nome da implementação é gerado a partir do nome do modelo e da cidade da região, e pode ser editado antes da implementação. Depois da implementação, usa o URL do endpoint com a tua chave de API para enviar pedidos de inferência a partir de qualquer aplicação.

Perguntas frequentes#

  • FuncionalidadePartilhadaDedicada
    ServiçoPartilhado entre os utilizadores da PlatformDedicado a uma implementação
    EscalabilidadeGerida pela PlatformPredefinição: reduz a zero; personalizada: permanece ativa
    Regiões3 regiões de dadosEscolhe entre 42 regiões de implementação
    URLAPI de modelos da PlatformURL do endpoint de implementação gerado
    TestesSeparador Predict do modeloSeparador Predict da página de implementação ou API
    Limites de taxa20 pedidos/minutoSem limite de taxa da Platform para chamadas diretas
    AutenticaçãoQualquer chave de API do espaço de trabalhoApenas a chave de API associada à implementação
  • A implementação permanece no estado de criação ou implementação enquanto o serviço é iniciado. Fica disponível quando o estado passa a Ready; o tempo varia consoante o modelo e a região e, normalmente, demora alguns minutos.

  • Sim, cada modelo pode ter vários endpoints em regiões diferentes. O número de implementações é limitado pelo plano: Free 3, Pro 10, Enterprise unlimited. A quota é cobrada ao espaço de trabalho que detém o modelo, e cada endpoint serve exatamente um modelo de cada vez — usa a substituição de modelo para o trocar sem alterar o URL.

  • Os endpoints com recursos predefinidos reduzem a zero quando ficam inativos:

    • O endpoint reduz a capacidade após um período de inatividade
    • O primeiro pedido inicia um arranque a frio
    • Os pedidos seguintes são rápidos

    Os primeiros pedidos após um período de inatividade iniciam um arranque a frio. Abrir a página de implementação executa uma verificação de integridade que mantém o endpoint ativo, para que uma previsão de teste seja rápida logo a seguir.

    Os endpoints com recursos personalizados permanecem ativos e são cobrados pelo tempo de atividade, incluindo o tempo de inatividade. Para interromper a cobrança pelo tempo de atividade, para o endpoint.

Comentários