Despliegue#
Ultralytics Platform ofrece opciones completas de implementación de modelos para poner tus modelos YOLO en producción. Prueba los modelos con inferencia desde el navegador, impleméntalos en endpoints dedicados en 42 regiones de todo el mundo y supervisa el rendimiento en tiempo real.
Watch: Get Started with Ultralytics Platform - Deploy
Descripción general#
La sección Implementación te ayuda a:
- Probar modelos directamente en el navegador con la pestaña
Predict - Implementar en endpoints dedicados en 42 regiones de todo el mundo
- Supervisa las métricas de solicitudes, registros, comprobaciones de estado y predicciones temporales en los endpoints de pago
- Elige recursos: los endpoints predeterminados se escalan a cero; los tamaños personalizados mantienen una instancia activa con facturación por tiempo de actividad

Opciones de implementación#
Ultralytics Platform ofrece varias vías de implementación:
| Opción | Descripción | Ideal para |
|---|---|---|
| Pestaña Predecir | Inferencia desde el navegador con imágenes, cámara web y ejemplos | Desarrollo, validación |
| Inferencia compartida | Servicio multiinquilino en 3 regiones de datos | Uso ligero, pruebas |
| Endpoints dedicados | Servicios para un único inquilino en 42 regiones | Producción, baja latencia |
| Exportar | Descarga los pesos en 20 formatos para ejecutarlos localmente o en el edge | Sin conexión, en el dispositivo |
Flujo de trabajo#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Etapa | Descripción |
|---|---|
| Test | Valida el modelo con la pestaña Predict |
| Configurar | Selecciona un modelo, una región, una CPU y memoria; revisa los precios y el nombre del despliegue |
| Desplegar | Crea un endpoint dedicado desde la pestaña Deploy |
| Supervisar | Inspecciona las métricas del endpoint y las predicciones temporales en Monitoring |
Arquitectura#
Inferencia compartida#
El servicio de inferencia compartida se ejecuta en 3 regiones clave. Las solicitudes a un modelo se enrutan al servicio de la región de datos de ese modelo, por lo que los resultados permanecen dentro de la región donde está almacenado el modelo:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Región | Etiqueta | Ubicación | Ideal para |
|---|---|---|---|
| US | América | Iowa, EE. UU. | Usuarios de América, la opción más rápida para América |
| EU | Europa, Oriente Medio y África | Bélgica, Europa | Usuarios europeos, cumplimiento del RGPD |
| AP | Asia-Pacífico | Taiwán, Asia-Pacífico | Usuarios de Asia-Pacífico, menor latencia de APAC |
Endpoints dedicados#
Implementa en 42 regiones de todo el mundo en Ultralytics Cloud:
- América: 14 regiones
- Europa: 13 regiones
- Asia-Pacífico: 12 regiones
- Oriente Medio y África: 3 regiones
Cada endpoint es un servicio para un único inquilino con:
- CPU y memoria configurables con precios mostrados antes del despliegue
- Escalado a cero para recursos predeterminados; una instancia activa facturada por tiempo de actividad para recursos personalizados
- URL de endpoint única con su propia referencia interactiva de la API en
/docs - Su propia asociación de clave de API, de modo que solo esa clave pueda llamar al endpoint
- Supervisión, registros y comprobaciones de estado independientes
Página de implementaciones#
Accede a la página de implementaciones globales desde la barra lateral, en Deploy. Esta página muestra:
- Mapa mundial con marcadores de las regiones implementadas; haz clic en una región para abrir el cuadro de diálogo
New Deployment - Tarjetas de resumen: Solicitudes HTTP (24h), Despliegues activos, Tasa de errores HTTP (24h), Latencia HTTP P95 (24h)
- Lista de implementaciones con tres modos de vista: tarjetas, compacta y tabla
- Botón Nueva implementación para crear endpoints a partir de cualquier modelo completado
- Botón Actualizar y una marca de tiempo
Updateden la cabecera de la página

La página se actualiza automáticamente y realiza sondeos más frecuentes mientras las implementaciones se encuentran en un estado de transición (creating, deploying o stopping). Consulta Supervisión para obtener más información.
Los endpoints de pago proporcionan gráficos e imágenes de ejemplo que se mantienen únicamente en la memoria de la instancia de servicio. Detener, reiniciar, volver a desplegar, cambiar el tamaño o reemplazar el modelo puede borrar estos datos. Guarda los ejemplos en un conjunto de datos y espera a que finalice la ingesta para conservarlos. Consulta Monitoring.
Características principales#
Cobertura global#
Implementa cerca de tus usuarios con 42 regiones que cubren:
- Norteamérica, Sudamérica
- Europa, Oriente Medio, África
- Asia-Pacífico, Oceanía
Comportamiento del escalado#
Actualmente, los endpoints se comportan de la siguiente manera:
- Recursos predeterminados: los endpoints inactivos se reducen a cero y se inician en frío en la siguiente solicitud
- Recursos personalizados: una instancia se mantiene activa y acumula cargos por tiempo de actividad hasta que se detiene
- Una única instancia activa: actualmente, cada endpoint presta servicio desde una instancia en todos los planes
- Reducción de carga: las solicitudes reciben respuestas
429cuando el endpoint alcanza temporalmente su capacidad; consulta Solicitudes directas a endpoints - Tiempo de espera de solicitud: las solicitudes directas al endpoint tienen una duración máxima de 1 hora; consulta Inference para ver las entradas compatibles
Implementación regional#
Usa la latencia medida de las regiones para colocar un endpoint cerca de quienes lo llaman. La latencia real de inferencia depende del modelo, el tamaño de entrada, el estado del endpoint y la ruta de red.
Comprobaciones de estado#
Cada implementación en ejecución incluye una comprobación de estado automática con:
- Indicador de estado en directo (saludable/no saludable)
- Visualización de la latencia de respuesta
- Reintento automático cuando no está saludable, que se detiene cuando vuelve a estar saludable
- Botón de actualización manual
Inicio rápido#
Crea una implementación:
- Entrena o sube un modelo a un proyecto
- Ve a la pestaña Implementar del modelo
- Haz clic en Deploy para una región en la tabla de latencia
- Revisa la CPU, la memoria, los precios y el nombre en el cuadro de diálogo de despliegue
- Haz clic en Create Deployment y espera a que el estado del despliegue pase a Ready
Model → Deploy tab → Deploy in a region → Review configuration → Create DeploymentEl nombre del despliegue se genera a partir del nombre del modelo y la ciudad de la región y se puede editar antes del despliegue. Una vez desplegado, utiliza la URL del endpoint con tu clave de API para enviar solicitudes de inferencia desde cualquier aplicación.
Enlaces rápidos#
- Inferencia: prueba modelos en el navegador
- Endpoints: implementa endpoints dedicados
- Supervisión: Realiza un seguimiento del rendimiento del despliegue
Preguntas frecuentes#
Característica Compartida Dedicada Servicio Compartido entre los usuarios de Platform Dedicado a una implementación Escalado Gestionado por Platform Predeterminado: se escala a cero; personalizado: se mantiene activo Regiones 3 regiones de datos Elige entre 42 regiones de implementación URL API de modelos de Platform URL de endpoint de implementación generada Pruebas Pestaña Predictdel modeloPestaña Predictde la tarjeta de implementación o APILímites de frecuencia 20 solicitudes por minuto Sin límite de frecuencia de Platform en llamadas directas Autenticación Cualquier clave de API del espacio de trabajo Solo la clave de API asociada a la implementación El despliegue permanece en estado de creación o despliegue mientras se inicia el servicio. Pasa a estar disponible cuando el estado cambia a Ready; el tiempo varía según el modelo y la región, y normalmente tarda unos minutos.
Sí, cada modelo puede tener varios endpoints en distintas regiones. El número de despliegues está limitado según el plan: Free
3, Pro10, Enterpriseunlimited. La cuota se aplica al espacio de trabajo propietario del modelo, y un endpoint sirve exactamente para un modelo a la vez; usa el reemplazo de modelos para cambiarlo sin modificar la URL.Los endpoints con recursos predeterminados se escalan a cero cuando están inactivos:
- El endpoint reduce su escala tras un periodo de inactividad
- La primera solicitud activa un arranque en frío
- Las solicitudes posteriores son rápidas
Las primeras solicitudes después de un periodo de inactividad activan un arranque en frío. Al abrir la tarjeta del despliegue se ejecuta una comprobación de estado que calienta el endpoint, por lo que una predicción de prueba responde rápidamente justo después.
Los endpoints con recursos personalizados se mantienen activos y se les cobra por el tiempo de actividad, incluido el tiempo de inactividad. Detén un endpoint para detener su cargo por tiempo de actividad.