Ultralytics YOLO27:

Implementação#

A Ultralytics Platform fornece opções abrangentes de implementação de modelos para colocar os seus modelos YOLO em produção. Teste modelos com inferência baseada no navegador, implemente-os em endpoints dedicados em 42 regiões globais e monitorize o desempenho em tempo real.



Watch: Get Started with Ultralytics Platform - Deploy

Visão geral#

A secção Implementação ajuda você a:

  • Testar modelos diretamente no navegador com o separador Predict
  • Implementar em endpoints dedicados em 42 regiões globais
  • Monitor métricas de solicitações, registros, verificações de integridade e previsões temporárias em endpoints pagos
  • Escolha os recursos: os endpoints padrão reduzem a zero; tamanhos personalizados mantêm uma instância ativa com cobrança por tempo de atividade

Mapa-múndi da página de implementação da Ultralytics Platform com cartões de visão geral

Opções de implementação#

A Ultralytics Platform oferece vários caminhos de implementação:

OpçãoDescriçãoMais indicado para
Separador PredictInferência baseada no navegador com imagens, webcam e exemplosDesenvolvimento, validação
Inferência partilhadaServiço multi-inquilino em 3 regiões de dadosUtilização ligeira, testes
Endpoints dedicadosServiços de inquilino único em 42 regiõesProdução, baixa latência
ExportarDescarregue pesos em 20 formatos para execução local ou na edgeOffline, no dispositivo

Fluxo de trabalho#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
EtapaDescrição
TestValide o modelo com o separador Predict
ConfigurarSelecione um modelo, região, CPU e memória; revise os preços e o nome do dimensionamento
ImplementarCrie um endpoint dedicado a partir do separador Deploy
MonitorizarInspecione as métricas do endpoint e as previsões temporárias em Monitoring

Arquitetura#

Inferência partilhada#

O serviço de inferência partilhada é executado em 3 regiões principais. Os pedidos para um modelo são encaminhados para o serviço na região de dados desse modelo, para que os resultados permaneçam na região onde o modelo está armazenado:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegiãoEtiquetaLocalizaçãoMais indicado para
USAméricasIowa, EUAUtilizadores das Américas, mais rápido para as Américas
EUEuropa, Médio Oriente e ÁfricaBélgica, EuropaUtilizadores europeus, conformidade com o RGPD
APÁsia-PacíficoTaiwan, Ásia-PacíficoUtilizadores da Ásia-Pacífico, menor latência na APAC

Endpoints dedicados#

Implemente em 42 regiões em todo o mundo na Ultralytics Cloud:

  • Américas: 14 regiões
  • Europa: 13 regiões
  • Ásia-Pacífico: 12 regiões
  • Médio Oriente e África: 3 regiões

Cada endpoint é um serviço de inquilino único com:

  • CPU e memória configuráveis com preços mostrados antes da implantação
  • Redução a zero para recursos padrão; uma instância ativa e cobrada por tempo de atividade para recursos personalizados
  • URL de endpoint exclusiva com a sua própria referência interativa da API em /docs
  • A sua própria associação de chave de API, para que apenas essa chave possa chamar o endpoint
  • Monitorização, registos e verificações de integridade independentes

Página de implementações#

Aceda à página global de implementações na barra lateral, em Deploy. Esta página apresenta:

  • Mapa-múndi com marcadores das regiões implementadas; clique numa região para abrir a caixa de diálogo New Deployment
  • Cartões de visão geral: Solicitações HTTP (24h), Implantações Ativas, Taxa de Erro HTTP (24h), Latência P95 HTTP (24h)
  • Lista de implementações com três modos de visualização: cartões, compacta e tabela
  • Botão Nova implementação para criar endpoints a partir de qualquer modelo concluído
  • Botão Atualizar e um carimbo de data/hora Updated no cabeçalho da página

Cartões de visão geral e lista de implementações da página de implementação da Ultralytics Platform

Sondagem automática

A página é atualizada automaticamente, fazendo a sondagem mais rapidamente enquanto as implementações estão num estado de transição (creating, deploying ou stopping). Consulte Monitorização para obter mais informações.

Monitoramento Temporário e Leve

Endpoints pagos fornecem gráficos e imagens de exemplo mantidas apenas na memória da instância de atendimento. Parar, reiniciar, reimplantar, redimensionar ou substituir o modelo pode limpar esses dados. Salve os exemplos em um conjunto de dados e aguarde a conclusão da ingestão para mantê-los. Consulte Monitoring.

Principais funcionalidades#

Cobertura global#

Implemente perto dos seus utilizadores com 42 regiões que abrangem:

  • América do Norte, América do Sul
  • Europa, Médio Oriente, África
  • Ásia-Pacífico, Oceânia

Comportamento de dimensionamento#

Atualmente, os endpoints comportam-se da seguinte forma:

  • Recursos padrão: endpoints ociosos reduzem a zero e passam por inicialização a frio na próxima solicitação
  • Recursos personalizados: uma instância permanece ativa e acumula cobranças por tempo de atividade até ser interrompida
  • Uma única instância ativa: atualmente, cada endpoint é servido por uma instância em todos os planos
  • Descartar carga: os pedidos recebem respostas 429 quando o endpoint está temporariamente no limite da capacidade — consulte Pedidos diretos a endpoints
  • Tempo limite da solicitação: solicitações diretas de endpoint têm uma duração máxima de 1 hora; consulte Inference para entradas suportadas

Implementação regional#

Utilize a latência medida da região para posicionar um endpoint perto dos respetivos clientes. A latência real da inferência depende do modelo, tamanho da entrada, estado do endpoint e caminho de rede.

Verificações de integridade#

Cada implementação em execução inclui uma verificação automática de integridade com:

  • Indicador de estado em tempo real (íntegro/não íntegro)
  • Apresentação da latência da resposta
  • Nova tentativa automática quando não está íntegro, interrompida assim que fica íntegro
  • Botão de atualização manual

Início rápido#

Crie uma implementação:

  1. Treine ou carregue um modelo para um projeto
  2. Aceda ao separador Implementar do modelo
  3. Clique em Deploy para uma região na tabela de latência
  4. Revise CPU, memória, preços e nome na caixa de diálogo de implantação
  5. Clique em Create Deployment e aguarde até que o status da implantação se torne Ready
Implementação rápida
Model → Deploy tab → Deploy in a region → Review configuration → Create Deployment

O nome da implantação é gerado a partir do nome do modelo e da cidade da região e pode ser editado antes da implantação. Uma vez implantado, use a URL do endpoint com sua API key para enviar solicitações de inferência de qualquer aplicativo.

Ligações rápidas#

Perguntas frequentes#

  • RecursoPartilhadaDedicada
    ServiçoPartilhado entre utilizadores da PlatformDedicado a uma implementação
    EscalaGerida pela PlatformPadrão: reduz a zero; personalizado: permanece ativo
    Regiões3 regiões de dadosEscolha entre 42 regiões de implementação
    URLAPI de modelos da PlatformURL de endpoint de implementação gerado
    TestesSeparador Predict do modeloSeparador Predict do cartão da implementação ou API
    Limites de taxa20 pedidos/minutoSem limite de taxa da Platform nas chamadas diretas
    AutenticaçãoQualquer chave de API do espaço de trabalhoApenas a chave de API associada à implementação
  • A implementação permanece no estado de criação ou implementação enquanto o serviço é iniciado. Torna-se utilizável quando o estado muda para Ready; o tempo varia consoante o modelo e a região e, normalmente, demora alguns minutos.

  • Sim, cada modelo pode ter vários endpoints em regiões diferentes. O número de implementações é limitado pelo plano: Gratuito 3, Pro 10, Enterprise unlimited. A quota é atribuída ao espaço de trabalho que detém o modelo, e um endpoint serve exatamente um modelo de cada vez — utiliza a substituição de modelos para o trocar sem alterar o URL.

  • Endpoints de recursos padrão reduzem a zero quando ociosos:

    • O endpoint reduz a escala após um período de inatividade
    • O primeiro pedido desencadeia um arranque a frio
    • Os pedidos seguintes são rápidos

    Os primeiros pedidos após um período de inatividade desencadeiam um arranque a frio. Abrir o cartão da implementação executa uma verificação de estado que aquece o endpoint, por isso uma previsão de teste feita logo depois responde rapidamente.

    Endpoints de recursos personalizados permanecem ativos e são cobrados pelo tempo de atividade, incluindo o tempo ocioso. Pare um endpoint para interromper a cobrança pelo tempo de atividade.

Comentários