Implementação#
A Ultralytics Platform fornece opções abrangentes de implementação de modelos para colocar os seus modelos YOLO em produção. Teste modelos com inferência baseada no navegador, implemente-os em endpoints dedicados em 42 regiões globais e monitorize o desempenho em tempo real.
Watch: Get Started with Ultralytics Platform - Deploy
Visão geral#
A secção Implementação ajuda você a:
- Testar modelos diretamente no navegador com o separador
Predict - Implementar em endpoints dedicados em 42 regiões globais
- Monitor métricas de solicitações, registros, verificações de integridade e previsões temporárias em endpoints pagos
- Escolha os recursos: os endpoints padrão reduzem a zero; tamanhos personalizados mantêm uma instância ativa com cobrança por tempo de atividade

Opções de implementação#
A Ultralytics Platform oferece vários caminhos de implementação:
| Opção | Descrição | Mais indicado para |
|---|---|---|
| Separador Predict | Inferência baseada no navegador com imagens, webcam e exemplos | Desenvolvimento, validação |
| Inferência partilhada | Serviço multi-inquilino em 3 regiões de dados | Utilização ligeira, testes |
| Endpoints dedicados | Serviços de inquilino único em 42 regiões | Produção, baixa latência |
| Exportar | Descarregue pesos em 20 formatos para execução local ou na edge | Offline, no dispositivo |
Fluxo de trabalho#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Etapa | Descrição |
|---|---|
| Test | Valide o modelo com o separador Predict |
| Configurar | Selecione um modelo, região, CPU e memória; revise os preços e o nome do dimensionamento |
| Implementar | Crie um endpoint dedicado a partir do separador Deploy |
| Monitorizar | Inspecione as métricas do endpoint e as previsões temporárias em Monitoring |
Arquitetura#
Inferência partilhada#
O serviço de inferência partilhada é executado em 3 regiões principais. Os pedidos para um modelo são encaminhados para o serviço na região de dados desse modelo, para que os resultados permaneçam na região onde o modelo está armazenado:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Região | Etiqueta | Localização | Mais indicado para |
|---|---|---|---|
| US | Américas | Iowa, EUA | Utilizadores das Américas, mais rápido para as Américas |
| EU | Europa, Médio Oriente e África | Bélgica, Europa | Utilizadores europeus, conformidade com o RGPD |
| AP | Ásia-Pacífico | Taiwan, Ásia-Pacífico | Utilizadores da Ásia-Pacífico, menor latência na APAC |
Endpoints dedicados#
Implemente em 42 regiões em todo o mundo na Ultralytics Cloud:
- Américas: 14 regiões
- Europa: 13 regiões
- Ásia-Pacífico: 12 regiões
- Médio Oriente e África: 3 regiões
Cada endpoint é um serviço de inquilino único com:
- CPU e memória configuráveis com preços mostrados antes da implantação
- Redução a zero para recursos padrão; uma instância ativa e cobrada por tempo de atividade para recursos personalizados
- URL de endpoint exclusiva com a sua própria referência interativa da API em
/docs - A sua própria associação de chave de API, para que apenas essa chave possa chamar o endpoint
- Monitorização, registos e verificações de integridade independentes
Página de implementações#
Aceda à página global de implementações na barra lateral, em Deploy. Esta página apresenta:
- Mapa-múndi com marcadores das regiões implementadas; clique numa região para abrir a caixa de diálogo
New Deployment - Cartões de visão geral: Solicitações HTTP (24h), Implantações Ativas, Taxa de Erro HTTP (24h), Latência P95 HTTP (24h)
- Lista de implementações com três modos de visualização: cartões, compacta e tabela
- Botão Nova implementação para criar endpoints a partir de qualquer modelo concluído
- Botão Atualizar e um carimbo de data/hora
Updatedno cabeçalho da página

A página é atualizada automaticamente, fazendo a sondagem mais rapidamente enquanto as implementações estão num estado de transição (creating, deploying ou stopping). Consulte Monitorização para obter mais informações.
Endpoints pagos fornecem gráficos e imagens de exemplo mantidas apenas na memória da instância de atendimento. Parar, reiniciar, reimplantar, redimensionar ou substituir o modelo pode limpar esses dados. Salve os exemplos em um conjunto de dados e aguarde a conclusão da ingestão para mantê-los. Consulte Monitoring.
Principais funcionalidades#
Cobertura global#
Implemente perto dos seus utilizadores com 42 regiões que abrangem:
- América do Norte, América do Sul
- Europa, Médio Oriente, África
- Ásia-Pacífico, Oceânia
Comportamento de dimensionamento#
Atualmente, os endpoints comportam-se da seguinte forma:
- Recursos padrão: endpoints ociosos reduzem a zero e passam por inicialização a frio na próxima solicitação
- Recursos personalizados: uma instância permanece ativa e acumula cobranças por tempo de atividade até ser interrompida
- Uma única instância ativa: atualmente, cada endpoint é servido por uma instância em todos os planos
- Descartar carga: os pedidos recebem respostas
429quando o endpoint está temporariamente no limite da capacidade — consulte Pedidos diretos a endpoints - Tempo limite da solicitação: solicitações diretas de endpoint têm uma duração máxima de 1 hora; consulte Inference para entradas suportadas
Implementação regional#
Utilize a latência medida da região para posicionar um endpoint perto dos respetivos clientes. A latência real da inferência depende do modelo, tamanho da entrada, estado do endpoint e caminho de rede.
Verificações de integridade#
Cada implementação em execução inclui uma verificação automática de integridade com:
- Indicador de estado em tempo real (íntegro/não íntegro)
- Apresentação da latência da resposta
- Nova tentativa automática quando não está íntegro, interrompida assim que fica íntegro
- Botão de atualização manual
Início rápido#
Crie uma implementação:
- Treine ou carregue um modelo para um projeto
- Aceda ao separador Implementar do modelo
- Clique em Deploy para uma região na tabela de latência
- Revise CPU, memória, preços e nome na caixa de diálogo de implantação
- Clique em Create Deployment e aguarde até que o status da implantação se torne Ready
Model → Deploy tab → Deploy in a region → Review configuration → Create DeploymentO nome da implantação é gerado a partir do nome do modelo e da cidade da região e pode ser editado antes da implantação. Uma vez implantado, use a URL do endpoint com sua API key para enviar solicitações de inferência de qualquer aplicativo.
Ligações rápidas#
- Inferência: Teste modelos no navegador
- Endpoints: Implemente endpoints dedicados
- Monitorização: Acompanha o desempenho da implementação
Perguntas frequentes#
Recurso Partilhada Dedicada Serviço Partilhado entre utilizadores da Platform Dedicado a uma implementação Escala Gerida pela Platform Padrão: reduz a zero; personalizado: permanece ativo Regiões 3 regiões de dados Escolha entre 42 regiões de implementação URL API de modelos da Platform URL de endpoint de implementação gerado Testes Separador Predictdo modeloSeparador Predictdo cartão da implementação ou APILimites de taxa 20 pedidos/minuto Sem limite de taxa da Platform nas chamadas diretas Autenticação Qualquer chave de API do espaço de trabalho Apenas a chave de API associada à implementação A implementação permanece no estado de criação ou implementação enquanto o serviço é iniciado. Torna-se utilizável quando o estado muda para Ready; o tempo varia consoante o modelo e a região e, normalmente, demora alguns minutos.
Sim, cada modelo pode ter vários endpoints em regiões diferentes. O número de implementações é limitado pelo plano: Gratuito
3, Pro10, Enterpriseunlimited. A quota é atribuída ao espaço de trabalho que detém o modelo, e um endpoint serve exatamente um modelo de cada vez — utiliza a substituição de modelos para o trocar sem alterar o URL.Endpoints de recursos padrão reduzem a zero quando ociosos:
- O endpoint reduz a escala após um período de inatividade
- O primeiro pedido desencadeia um arranque a frio
- Os pedidos seguintes são rápidos
Os primeiros pedidos após um período de inatividade desencadeiam um arranque a frio. Abrir o cartão da implementação executa uma verificação de estado que aquece o endpoint, por isso uma previsão de teste feita logo depois responde rapidamente.
Endpoints de recursos personalizados permanecem ativos e são cobrados pelo tempo de atividade, incluindo o tempo ocioso. Pare um endpoint para interromper a cobrança pelo tempo de atividade.