Despliegue#
Ultralytics Platform ofrece opciones integrales de despliegue de modelos para poner tus modelos YOLO en producción. Prueba los modelos con inferencia basada en navegador, despliega en puntos de conexión dedicados en 42 regiones globales y supervisa el rendimiento en tiempo real.
Watch: Get Started with Ultralytics Platform - Deploy
Descripción general#
La sección de Despliegue te ayuda a:
- Probar modelos directamente en el navegador con la pestaña
Predict - Despliega en puntos de conexión dedicados en 42 regiones globales
- Supervisar métricas de peticiones, registros y comprobaciones de estado
- Escalar a cero cuando esté inactivo (los despliegues ejecutan actualmente una única instancia activa)

Opciones de despliegue#
Ultralytics Platform ofrece múltiples rutas de despliegue:
| Opción | Descripción | Ideal para |
|---|---|---|
| Pestaña Predict | Inferencia basada en navegador con imágenes, webcam y ejemplos | Desarrollo, validación |
| Inferencia compartida | Servicio multiinquilino en 3 regiones | Uso ligero, pruebas |
| Puntos de conexión dedicados | Servicios de inquilino único en 42 regiones | Producción, baja latencia |
Flujo de trabajo#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Etapa | Descripción |
|---|---|
| Probar | Valida el modelo con la pestaña Predict |
| Configurar | Selecciona una región y revisa el nombre de despliegue editable y generado automáticamente |
| Deploy (Desplegar) | Crea un punto de conexión dedicado desde la pestaña Deploy |
| Monitorizar | Realiza el seguimiento de peticiones, latencia, errores y registros en Monitoring |
Arquitectura#
Inferencia compartida#
El servicio de inferencia compartida se ejecuta en 3 regiones clave, dirigiendo automáticamente las peticiones según tu región de datos:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Region Router}:::decide
Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Región | Etiqueta | Ubicación | Ideal para |
|---|---|---|---|
| US | América | Iowa, EE. UU. | Usuarios de América, la más rápida para América |
| EU | Europa, Oriente Medio y África | Bélgica, Europa | Usuarios europeos, cumplimiento de GDPR |
| AP | Asia-Pacífico | Taiwán, Asia-Pacífico | Usuarios de Asia-Pacífico, menor latencia APAC |
Puntos de conexión dedicados#
Despliega en 42 regiones de todo el mundo en Ultralytics Cloud:
- América: 14 regiones
- Europa: 13 regiones
- Asia-Pacífico: 12 regiones
- Oriente Medio y África: 3 regiones
Cada punto de conexión es un servicio de inquilino único con:
- Recursos predeterminados de
1 CPU,2 GiBde memoria,minInstances=0,maxInstances=1 - Escalado a cero cuando esté inactivo
- URL de punto de conexión única
- Supervisión, registros y comprobaciones de estado independientes
Página de despliegues#
Accede a la página de despliegues globales desde la barra lateral en Deploy. Esta página muestra:
- Mapa mundial con chinchetas de regiones desplegadas (mapa interactivo)
- Tarjetas de resumen: Peticiones totales (24 h), Despliegues activos, Tasa de errores (24 h), Latencia P95 (24 h)
- Lista de despliegues con tres modos de visualización: tarjetas, compacto y tabla
- Botón Nuevo despliegue para crear puntos de conexión desde cualquier modelo completado

La página realiza sondeos cada 15 segundos normalmente. Cuando los despliegues están en un estado de transición (creating, deploying o stopping), el sondeo aumenta a cada 3 segundos para una respuesta más rápida.
Características clave#
Cobertura global#
Despliega cerca de tus usuarios con 42 regiones que cubren:
- Norteamérica, Sudamérica
- Europa, Oriente Medio, África
- Asia Pacífico, Oceanía
Comportamiento de escalado#
Los puntos de conexión funcionan actualmente de la siguiente manera:
- Escalar a cero:
minInstancestiene un valor predeterminado de0 - Única instancia activa:
maxInstancesestá limitado actualmente a1en todos los planes
Despliegue regional#
Utiliza la latencia de región medida para ubicar un endpoint cerca de quienes lo llaman. La latencia de inferencia real depende del modelo, el tamaño de entrada, el estado del endpoint y la ruta de red.
Comprobaciones de estado#
Cada despliegue en ejecución incluye una comprobación de estado automática con:
- Indicador de estado en vivo (saludable/no saludable)
- Visualización de la latencia de respuesta
- Reintento automático cuando no es saludable (sondea cada 20 segundos)
- Botón de actualización manual
Inicio rápido#
Crea un despliegue:
- Entrena o carga un modelo en un proyecto
- Ve a la pestaña Deploy del modelo
- Selecciona una región de la tabla de latencia
- Haz clic en Deploy y espera a que el estado del despliegue cambie a Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyUna vez desplegado, utiliza la URL del punto de conexión con tu clave de API para enviar peticiones de inferencia desde cualquier aplicación.
Enlaces rápidos#
- Inferencia: Prueba modelos en el navegador
- Puntos de conexión: Despliega puntos de conexión dedicados
- Supervisión: Realiza el seguimiento del rendimiento del despliegue
FAQ#
¿Cuál es la diferencia entre la inferencia compartida y la dedicada?#
| Característica | Compartida | Dedicada |
|---|---|---|
| Servicio | Compartido entre los usuarios de Platform | Dedicado a un solo despliegue |
| Escalado | Gestionado por Platform | Escalado a cero, una instancia |
| Regiones | 3 regiones de datos | Elige entre 42 regiones de despliegue |
| URL | API de modelo de Platform | URL de endpoint de despliegue generada |
| Pruebas | Pestaña Predict del modelo | Pestaña Predict de la tarjeta de despliegue o API |
¿Cuánto tarda el despliegue?#
El despliegue permanece en estado de creación o despliegue mientras se inicia su servicio. Se puede utilizar cuando el estado cambia a Ready; el tiempo varía según el modelo y la región.
¿Puedo desplegar varios modelos?#
Sí, cada modelo puede tener múltiples endpoints en diferentes regiones. El número de despliegues está limitado por tu plan: Free 3, Pro 10, Enterprise unlimited.
¿Qué ocurre cuando un endpoint está inactivo?#
Con el escalado a cero activado:
- El endpoint se reduce tras un periodo de inactividad
- La primera petición activa un arranque en frío
- Las peticiones posteriores son rápidas
Las primeras peticiones tras un periodo de inactividad activan un arranque en frío.