YOLO Vision 2026:

Implementação#

A Ultralytics Platform fornece opções de implantação de modelos abrangentes para colocar os teus modelos YOLO em produção. Testa modelos com inferência baseada no navegador, implanta em endpoints dedicados em 42 regiões globais e monitoriza o desempenho em tempo real.



Watch: Get Started with Ultralytics Platform - Deploy

Visão geral#

A secção de Implementação ajuda-te a:

  • Testar modelos diretamente no navegador com o separador Predict
  • Implanta em endpoints dedicados em 42 regiões globais
  • Monitorizar métricas de pedidos, registos e verificações de integridade
  • Escalar para zero quando inativo (as implementações executam atualmente uma única instância ativa)

Ultralytics Platform Deploy Page World Map With Overview Cards

Opções de Implementação#

A Ultralytics Platform oferece vários caminhos de implementação:

OpçãoDescriçãoMelhor para
Separador PredictInferência baseada no navegador com imagem, webcam e exemplosDesenvolvimento, validação
Inferência PartilhadaServiço multitenant em 3 regiõesUso leve, testes
Endpoints DedicadosServiços de tenant único em 42 regiõesProdução, baixa latência

Fluxo de trabalho#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
EtapaDescrição
TesteValida o modelo com o separador Predict
ConfigurarSeleciona uma região e revê o nome de implementação editável e gerado automaticamente
DeployCria um endpoint dedicado a partir do separador Deploy
MonitorarRastreia pedidos, latência, erros e registos na Monitorização

Arquitetura#

Inferência Partilhada#

O serviço de inferência partilhada funciona em 3 regiões principais, encaminhando automaticamente os pedidos com base na região dos teus dados:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Region Router}:::decide
    Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegiãoRótuloLocalizaçãoMelhor para
USAméricasIowa, EUAUsuários das Américas, mais rápido para as Américas
EUEuropa, Oriente Médio e ÁfricaBélgica, EuropaUsuários europeus, conformidade com o GDPR
APÁsia-PacíficoTaiwan, Ásia-PacíficoUsuários da Ásia-Pacífico, menor latência APAC

Endpoints Dedicados#

Implanta em 42 regiões em todo o mundo na Ultralytics Cloud:

  • Américas: 14 regiões
  • Europa: 13 regiões
  • Ásia-Pacífico: 12 regiões
  • Oriente Médio e África: 3 regiões

Cada endpoint é um serviço single-tenant com:

  • Recursos padrão de 1 CPU, 2 GiB de memória, minInstances=0, maxInstances=1
  • Escalonamento para zero quando inativo
  • URL de endpoint exclusivo
  • Monitorização, registos e verificações de integridade independentes

Página de Implementações#

Acede à página global de implementações a partir da barra lateral em Deploy. Esta página mostra:

  • Mapa mundial com pinos das regiões implementadas (mapa interativo)
  • Cartões de visão geral: Total de Pedidos (24h), Implementações Ativas, Taxa de Erro (24h), Latência P95 (24h)
  • Lista de implementações com três modos de visualização: cartões, compacto e tabela
  • Botão Nova Implementação para criar endpoints a partir de qualquer modelo concluído

Ultralytics Platform Deploy Page Overview Cards And Deployments List

Sondagem Automática

A página verifica normalmente a cada 15 segundos. Quando as implementações estão num estado de transição (creating, deploying ou stopping), a sondagem aumenta para cada 3 segundos para um feedback mais rápido.

Principais recursos#

Cobertura Global#

Implanta perto dos teus utilizadores com 42 regiões abrangendo:

  • América do Norte, América do Sul
  • Europa, Médio Oriente, África
  • Ásia-Pacífico, Oceânia

Comportamento de Escalonamento#

Os endpoints comportam-se atualmente da seguinte forma:

  • Dimensionar para zero: minInstances tem por predefinição 0
  • Instância única ativa: maxInstances está atualmente limitado a 1 em todos os planos

Implementação Regional#

Usa a latência de região medida para colocar um endpoint perto de quem o chama. A latência de inferência real depende do modelo, do tamanho de entrada, do estado do endpoint e do caminho de rede.

Verificações de Integridade#

Cada implementação em execução inclui uma verificação de integridade automática com:

  • Indicador de estado ao vivo (saudável/não saudável)
  • Exibição de latência de resposta
  • Repetição automática quando não saudável (sondagem a cada 20 segundos)
  • Botão de atualização manual

Início Rápido#

Criar uma implementação:

  1. Treina ou carrega um modelo para um projeto
  2. Vai para o separador Deploy do modelo
  3. Seleciona uma região na tabela de latência
  4. Clica em Deploy e espera que o estado da implementação passe a Ready
Implementação Rápida
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

Uma vez implementado, utiliza o URL do endpoint com a tua chave API para enviar pedidos de inferência a partir de qualquer aplicação.

FAQ#

Qual é a diferença entre inferência partilhada e dedicada?#

FuncionalidadePartilhadaDedicada
ServiçoPartilhado entre os utilizadores da PlatformDedicado a uma única implementação
EscalaGerido pela PlatformDimensionamento para zero, uma instância
Regiões3 regiões de dadosEscolhe entre 42 regiões de implementação
URLAPI de modelo da PlatformURL do endpoint de implementação gerado
TestesSeparador Predict do modeloSeparador Predict do cartão de implementação ou API

Quanto tempo demora a implantação?#

A implementação permanece num estado de criação ou implementação enquanto o seu serviço arranca. Fica utilizável quando o estado muda para Ready; o tempo varia consoante o modelo e a região.

Posso implantar vários modelos?#

Sim, cada modelo pode ter múltiplos endpoints em diferentes regiões. As contagens de implantação são limitadas pelo plano: Free 3, Pro 10, Enterprise unlimited.

O que acontece quando um endpoint está ocioso?#

Com scale-to-zero ativado:

  • O endpoint reduz a escala após inatividade
  • A primeira solicitação dispara um cold start
  • Solicitações subsequentes são rápidas

As primeiras solicitações após um período de inatividade disparam um cold start.

Comentários