YOLO Vision 2026:

Implementação#

Ultralytics Platform fornece opções de implantação de modelos abrangentes para colocar os teus modelos YOLO em produção. Testa modelos com inferência baseada no navegador, implanta em endpoints dedicados em 42 regiões globais e monitoriza o desempenho em tempo real.



Watch: Get Started with Ultralytics Platform - Deploy

Visão geral#

A secção de Implementação ajuda-te a:

  • Testa modelos diretamente no navegador com o separador Predict
  • Implanta em endpoints dedicados em 42 regiões globais
  • Monitorizar métricas de pedidos, registos e verificações de integridade
  • Escalar para zero quando inativo (as implementações executam atualmente uma única instância ativa)

Ultralytics Platform Deploy Page World Map With Overview Cards

Opções de Implementação#

A Ultralytics Platform oferece vários caminhos de implementação:

OpçãoDescriçãoMelhor para
Separador PredictInferência baseada no navegador com imagem, webcam e exemplosDesenvolvimento, validação
Inferência PartilhadaServiço multilocatário em 3 regiões de dadosUso leve, testes
Endpoints DedicadosServiços de tenant único em 42 regiõesProdução, baixa latência
ExportDescarrega os pesos em 20 formatos para execução local ou em edgeOffline, no dispositivo

Fluxo de trabalho#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
EtapaDescrição
TesteValida o modelo com o separador Predict
ConfigurarSeleciona uma região; o nome do deployment é gerado a partir do modelo e da cidade
DeployCria um endpoint dedicado a partir do separador Deploy
MonitorarAcompanha pedidos, latência, erros e registos em Monitorização

Arquitetura#

Inferência Partilhada#

O serviço de inferência partilhado é executado em 3 regiões principais. Os pedidos para um modelo são encaminhados para o serviço nessa data region do modelo, para que os resultados permaneçam dentro da região onde o modelo está armazenado:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegiãoRótuloLocalizaçãoMelhor para
USAméricasIowa, EUAUsuários das Américas, mais rápido para as Américas
EUEuropa, Oriente Médio e ÁfricaBélgica, EuropaUsuários europeus, conformidade com o GDPR
APÁsia-PacíficoTaiwan, Ásia-PacíficoUsuários da Ásia-Pacífico, menor latência APAC

Endpoints Dedicados#

Implanta em 42 regiões em todo o mundo na Ultralytics Cloud:

  • Américas: 14 regiões
  • Europa: 13 regiões
  • Ásia-Pacífico: 12 regiões
  • Oriente Médio e África: 3 regiões

Cada endpoint é um serviço single-tenant com:

  • Dimensionamento gerido pela plataforma (não configurável de momento)
  • Escalonamento para zero quando inativo
  • URL de endpoint exclusivo com a sua própria referência de API interativa em /docs
  • A sua própria associação de chave de API, para que apenas essa chave possa chamar o endpoint
  • Monitorização, registos e verificações de integridade independentes

Página de Implementações#

Acede à página de implantações globais a partir da barra lateral em Deploy. Esta página mostra:

  • Mapa-múndi com pins das regiões implementadas; clica numa região para abrir o diálogo New Deployment
  • Cartões de visão geral: Total de Pedidos (24h), Implementações Ativas, Taxa de Erro (24h), Latência P95 (24h)
  • Lista de implementações com três modos de visualização: cartões, compacto e tabela
  • Botão Nova Implementação para criar endpoints a partir de qualquer modelo concluído
  • Botão Refresh e um carimbo de data/hora Updated no cabeçalho da página

Ultralytics Platform Deploy Page Overview Cards And Deployments List

Sondagem Automática

A página atualiza-se automaticamente, fazendo polling mais rapidamente enquanto os deployments estão num estado de transição (creating, deploying ou stopping). Consulta Monitoring para mais detalhes.

Principais recursos#

Cobertura Global#

Implanta perto dos teus utilizadores com 42 regiões abrangendo:

  • América do Norte, América do Sul
  • Europa, Médio Oriente, África
  • Ásia-Pacífico, Oceânia

Comportamento de Escalonamento#

Os endpoints comportam-se atualmente da seguinte forma:

  • Scale to zero: os endpoints ociosos reduzem para zero e fazem um arranque a frio no próximo pedido
  • Single active instance: cada endpoint serve atualmente a partir de uma instância em todos os planos
  • Load shedding: os pedidos recebem respostas 429 quando o endpoint está temporariamente na capacidade máxima — consulta Direct Endpoint Requests
  • Request timeout: cada pedido pode ser executado por até 1 hora, o que é suficiente para inferência de vídeo

Implementação Regional#

Usa a latência de região medida para colocar um endpoint perto de quem o chama. A latência de inferência real depende do modelo, do tamanho de entrada, do estado do endpoint e do caminho de rede.

Verificações de Integridade#

Cada implementação em execução inclui uma verificação de integridade automática com:

  • Indicador de estado ao vivo (saudável/não saudável)
  • Exibição de latência de resposta
  • Nova tentativa automática quando não saudável, parando assim que estiver saudável
  • Botão de atualização manual

Início Rápido#

Criar uma implementação:

  1. Treina ou carrega um modelo para um projeto
  2. Vai para o separador Deploy do modelo
  3. Seleciona uma região na tabela de latência
  4. Clica em Deploy e espera que o estado da implementação passe a Ready
Implementação Rápida
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

O nome do deployment é gerado a partir do nome do modelo e da cidade da região, pelo que não é necessário nenhum passo de nomeação. Uma vez implementado, usa o URL do endpoint com a tua chave de API para enviar pedidos de inferência a partir de qualquer aplicação.

FAQ#

  • FuncionalidadePartilhadaDedicada
    ServiçoPartilhado entre os utilizadores da PlatformDedicado a uma única implementação
    EscalaGerido pela PlatformDimensionamento para zero, uma instância
    Regiões3 regiões de dadosEscolhe entre 42 regiões de implementação
    URLAPI de modelo da PlatformURL do endpoint de implementação gerado
    TestesSeparador Predict do modeloSeparador Predict do cartão de implantação ou API
    Rate limits20 pedidos/minutoSem limite de taxa da Plataforma em chamadas diretas
    AuthQualquer chave de API do workspaceApenas a chave de API associada ao deployment
  • O deployment permanece num estado de criação ou implementação enquanto o seu serviço inicia. Torna-se utilizável quando o estado muda para Ready; o tempo varia consoante o modelo e a região, demorando normalmente alguns minutos.

  • Sim, cada modelo pode ter múltiplos endpoints em diferentes regiões. As contagens de deployment são limitadas por plano: Free 3, Pro 10, Enterprise unlimited. A quota é cobrada ao workspace proprietário do modelo, e um endpoint serve exatamente um modelo de cada vez — usa a model replacement para o substituir sem alterar o URL.

  • Com scale-to-zero ativado:

    • O endpoint reduz a escala após inatividade
    • A primeira solicitação dispara um cold start
    • Solicitações subsequentes são rápidas

    Os primeiros pedidos após um período de ociosidade desencadeiam um arranque a frio. Abrir o cartão de deployment executa uma verificação de saúde que aquece o endpoint, para que uma previsão de teste logo a seguir responda rapidamente.

Comentários