Implementação#
Ultralytics Platform fornece opções de implantação de modelos abrangentes para colocar os teus modelos YOLO em produção. Testa modelos com inferência baseada no navegador, implanta em endpoints dedicados em 42 regiões globais e monitoriza o desempenho em tempo real.
Watch: Get Started with Ultralytics Platform - Deploy
Visão geral#
A secção de Implementação ajuda-te a:
- Testa modelos diretamente no navegador com o separador
Predict - Implanta em endpoints dedicados em 42 regiões globais
- Monitorizar métricas de pedidos, registos e verificações de integridade
- Escalar para zero quando inativo (as implementações executam atualmente uma única instância ativa)

Opções de Implementação#
A Ultralytics Platform oferece vários caminhos de implementação:
| Opção | Descrição | Melhor para |
|---|---|---|
| Separador Predict | Inferência baseada no navegador com imagem, webcam e exemplos | Desenvolvimento, validação |
| Inferência Partilhada | Serviço multilocatário em 3 regiões de dados | Uso leve, testes |
| Endpoints Dedicados | Serviços de tenant único em 42 regiões | Produção, baixa latência |
| Export | Descarrega os pesos em 20 formatos para execução local ou em edge | Offline, no dispositivo |
Fluxo de trabalho#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Etapa | Descrição |
|---|---|
| Teste | Valida o modelo com o separador Predict |
| Configurar | Seleciona uma região; o nome do deployment é gerado a partir do modelo e da cidade |
| Deploy | Cria um endpoint dedicado a partir do separador Deploy |
| Monitorar | Acompanha pedidos, latência, erros e registos em Monitorização |
Arquitetura#
Inferência Partilhada#
O serviço de inferência partilhado é executado em 3 regiões principais. Os pedidos para um modelo são encaminhados para o serviço nessa data region do modelo, para que os resultados permaneçam dentro da região onde o modelo está armazenado:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Região | Rótulo | Localização | Melhor para |
|---|---|---|---|
| US | Américas | Iowa, EUA | Usuários das Américas, mais rápido para as Américas |
| EU | Europa, Oriente Médio e África | Bélgica, Europa | Usuários europeus, conformidade com o GDPR |
| AP | Ásia-Pacífico | Taiwan, Ásia-Pacífico | Usuários da Ásia-Pacífico, menor latência APAC |
Endpoints Dedicados#
Implanta em 42 regiões em todo o mundo na Ultralytics Cloud:
- Américas: 14 regiões
- Europa: 13 regiões
- Ásia-Pacífico: 12 regiões
- Oriente Médio e África: 3 regiões
Cada endpoint é um serviço single-tenant com:
- Dimensionamento gerido pela plataforma (não configurável de momento)
- Escalonamento para zero quando inativo
- URL de endpoint exclusivo com a sua própria referência de API interativa em
/docs - A sua própria associação de chave de API, para que apenas essa chave possa chamar o endpoint
- Monitorização, registos e verificações de integridade independentes
Página de Implementações#
Acede à página de implantações globais a partir da barra lateral em Deploy. Esta página mostra:
- Mapa-múndi com pins das regiões implementadas; clica numa região para abrir o diálogo
New Deployment - Cartões de visão geral: Total de Pedidos (24h), Implementações Ativas, Taxa de Erro (24h), Latência P95 (24h)
- Lista de implementações com três modos de visualização: cartões, compacto e tabela
- Botão Nova Implementação para criar endpoints a partir de qualquer modelo concluído
- Botão Refresh e um carimbo de data/hora
Updatedno cabeçalho da página

A página atualiza-se automaticamente, fazendo polling mais rapidamente enquanto os deployments estão num estado de transição (creating, deploying ou stopping). Consulta Monitoring para mais detalhes.
Principais recursos#
Cobertura Global#
Implanta perto dos teus utilizadores com 42 regiões abrangendo:
- América do Norte, América do Sul
- Europa, Médio Oriente, África
- Ásia-Pacífico, Oceânia
Comportamento de Escalonamento#
Os endpoints comportam-se atualmente da seguinte forma:
- Scale to zero: os endpoints ociosos reduzem para zero e fazem um arranque a frio no próximo pedido
- Single active instance: cada endpoint serve atualmente a partir de uma instância em todos os planos
- Load shedding: os pedidos recebem respostas
429quando o endpoint está temporariamente na capacidade máxima — consulta Direct Endpoint Requests - Request timeout: cada pedido pode ser executado por até 1 hora, o que é suficiente para inferência de vídeo
Implementação Regional#
Usa a latência de região medida para colocar um endpoint perto de quem o chama. A latência de inferência real depende do modelo, do tamanho de entrada, do estado do endpoint e do caminho de rede.
Verificações de Integridade#
Cada implementação em execução inclui uma verificação de integridade automática com:
- Indicador de estado ao vivo (saudável/não saudável)
- Exibição de latência de resposta
- Nova tentativa automática quando não saudável, parando assim que estiver saudável
- Botão de atualização manual
Início Rápido#
Criar uma implementação:
- Treina ou carrega um modelo para um projeto
- Vai para o separador Deploy do modelo
- Seleciona uma região na tabela de latência
- Clica em Deploy e espera que o estado da implementação passe a Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyO nome do deployment é gerado a partir do nome do modelo e da cidade da região, pelo que não é necessário nenhum passo de nomeação. Uma vez implementado, usa o URL do endpoint com a tua chave de API para enviar pedidos de inferência a partir de qualquer aplicação.
Links Rápidos#
- Inferência: Testa modelos no navegador
- Endpoints: Implanta endpoints dedicados
- Monitoring: Rastreie o desempenho da implantação
FAQ#
Funcionalidade Partilhada Dedicada Serviço Partilhado entre os utilizadores da Platform Dedicado a uma única implementação Escala Gerido pela Platform Dimensionamento para zero, uma instância Regiões 3 regiões de dados Escolhe entre 42 regiões de implementação URL API de modelo da Platform URL do endpoint de implementação gerado Testes Separador Predictdo modeloSeparador Predictdo cartão de implantação ou APIRate limits 20 pedidos/minuto Sem limite de taxa da Plataforma em chamadas diretas Auth Qualquer chave de API do workspace Apenas a chave de API associada ao deployment O deployment permanece num estado de criação ou implementação enquanto o seu serviço inicia. Torna-se utilizável quando o estado muda para Ready; o tempo varia consoante o modelo e a região, demorando normalmente alguns minutos.
Sim, cada modelo pode ter múltiplos endpoints em diferentes regiões. As contagens de deployment são limitadas por plano: Free
3, Pro10, Enterpriseunlimited. A quota é cobrada ao workspace proprietário do modelo, e um endpoint serve exatamente um modelo de cada vez — usa a model replacement para o substituir sem alterar o URL.Com scale-to-zero ativado:
- O endpoint reduz a escala após inatividade
- A primeira solicitação dispara um cold start
- Solicitações subsequentes são rápidas
Os primeiros pedidos após um período de ociosidade desencadeiam um arranque a frio. Abrir o cartão de deployment executa uma verificação de saúde que aquece o endpoint, para que uma previsão de teste logo a seguir responda rapidamente.