Despliegue#
Ultralytics Platform ofrece opciones de despliegue de modelos completas para poner tus modelos YOLO en producción. Prueba los modelos con inferencia basada en navegador, despliega en endpoints dedicados en 42 regiones globales y supervisa el rendimiento en tiempo real.
Watch: Get Started with Ultralytics Platform - Deploy
Descripción general#
La sección de Despliegue te ayuda a:
- Prueba los modelos directamente en el navegador con la pestaña
Predict - Despliega en puntos de conexión dedicados en 42 regiones globales
- Supervisar métricas de peticiones, registros y comprobaciones de estado
- Escalar a cero cuando esté inactivo (los despliegues ejecutan actualmente una única instancia activa)

Opciones de despliegue#
Ultralytics Platform ofrece múltiples rutas de despliegue:
| Opción | Descripción | Ideal para |
|---|---|---|
| Pestaña Predict | Inferencia basada en navegador con imágenes, webcam y ejemplos | Desarrollo, validación |
| Inferencia compartida | Servicio multiinquilino en 3 regiones de datos | Uso ligero, pruebas |
| Endpoints dedicados | Servicios de inquilino único en 42 regiones | Producción, baja latencia |
| Exportar | Descarga los pesos en 20 formatos para ejecución local o en el borde | Sin conexión, en el dispositivo |
Flujo de trabajo#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Etapa | Descripción |
|---|---|
| Probar | Valida el modelo con la pestaña Predict |
| Configurar | Selecciona una región; el nombre del despliegue se genera a partir del modelo y la ciudad |
| Deploy (Desplegar) | Crea un endpoint dedicado desde la pestaña Deploy |
| Monitorizar | Haz un seguimiento de las solicitudes, la latencia, los errores y los registros en Supervisión |
Arquitectura#
Inferencia compartida#
El servicio de inferencia compartido se ejecuta en 3 regiones clave. Las solicitudes a un modelo se enrutan al servicio en la región de datos de ese modelo, por lo que los resultados permanecen dentro de la región donde se almacena el modelo:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Región | Etiqueta | Ubicación | Ideal para |
|---|---|---|---|
| US | América | Iowa, EE. UU. | Usuarios de América, la más rápida para América |
| EU | Europa, Oriente Medio y África | Bélgica, Europa | Usuarios europeos, cumplimiento de GDPR |
| AP | Asia-Pacífico | Taiwán, Asia-Pacífico | Usuarios de Asia-Pacífico, menor latencia APAC |
Puntos de conexión dedicados#
Despliega en 42 regiones de todo el mundo en Ultralytics Cloud:
- América: 14 regiones
- Europa: 13 regiones
- Asia-Pacífico: 12 regiones
- Oriente Medio y África: 3 regiones
Cada punto de conexión es un servicio de inquilino único con:
- Dimensionamiento gestionado por la plataforma (no configurable actualmente)
- Escalado a cero cuando esté inactivo
- URL de endpoint única con su propia referencia de API interactiva en
/docs - Su propia vinculación de clave de API, de modo que solo esa clave pueda llamar al endpoint
- Supervisión, registros y comprobaciones de estado independientes
Página de despliegues#
Accede a la página de despliegues globales desde la barra lateral en Deploy. Esta página muestra:
- Mapa del mundo con marcadores de regiones desplegadas; haz clic en una región para abrir el diálogo de
New Deployment - Tarjetas de resumen: Peticiones totales (24 h), Despliegues activos, Tasa de errores (24 h), Latencia P95 (24 h)
- Lista de despliegues con tres modos de visualización: tarjetas, compacto y tabla
- Botón Nuevo despliegue para crear puntos de conexión desde cualquier modelo completado
- Botón de Actualizar y una marca de tiempo de
Updateden el encabezado de la página

La página se actualiza automáticamente, sondeando más rápido mientras los despliegues se encuentran en un estado de transición (creating, deploying o stopping). Consulta Monitoreo para obtener más detalles.
Características clave#
Cobertura global#
Despliega cerca de tus usuarios con 42 regiones que cubren:
- Norteamérica, Sudamérica
- Europa, Oriente Medio, África
- Asia Pacífico, Oceanía
Comportamiento de escalado#
Los puntos de conexión funcionan actualmente de la siguiente manera:
- Escalar a cero: los endpoints inactivos se reducen a cero y realizan un arranque en frío en la siguiente solicitud
- Instancia activa única: cada endpoint sirve actualmente desde una única instancia en todos los planes
- Descarte de carga: las solicitudes reciben respuestas de
429cuando el endpoint está temporalmente a su máxima capacidad; consulta Solicitudes de Endpoint Directas - Tiempo de espera de solicitud: cada solicitud puede ejecutarse hasta por 1 hora, lo cual es suficiente para la inferencia de video
Despliegue regional#
Utiliza la latencia de región medida para ubicar un endpoint cerca de quienes lo llaman. La latencia de inferencia real depende del modelo, el tamaño de entrada, el estado del endpoint y la ruta de red.
Comprobaciones de estado#
Cada despliegue en ejecución incluye una comprobación de estado automática con:
- Indicador de estado en vivo (saludable/no saludable)
- Visualización de la latencia de respuesta
- Reintento automático en caso de fallo de salud, deteniéndose una vez que vuelva a estar saludable
- Botón de actualización manual
Inicio rápido#
Crea un despliegue:
- Entrena o carga un modelo en un proyecto
- Ve a la pestaña Deploy del modelo
- Selecciona una región de la tabla de latencia
- Haz clic en Deploy y espera a que el estado del despliegue cambie a Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyEl nombre del despliegue se genera a partir del nombre del modelo y la ciudad de la región, por lo que no se requiere ningún paso de nomenclatura. Una vez desplegado, utiliza la URL del endpoint con tu clave de API para enviar solicitudes de inferencia desde cualquier aplicación.
Enlaces rápidos#
- Inferencia: Prueba los modelos en el navegador
- Endpoints: Despliega endpoints dedicados
- Monitoring: Supervisa el rendimiento del despliegue
FAQ#
Característica Compartida Dedicada Servicio Compartido entre los usuarios de Platform Dedicado a un solo despliegue Escalado Gestionado por Platform Escalado a cero, una instancia Regiones 3 regiones de datos Elige entre 42 regiones de despliegue URL API de modelo de Platform URL de endpoint de despliegue generada Pruebas Pestaña Predictdel modeloPestaña Predictde la tarjeta de despliegue o APILímites de tasa 20 solicitudes/minuto Sin límite de tasa de la plataforma en llamadas directas Autenticación Cualquier clave de API del espacio de trabajo Solo la clave de API vinculada al despliegue El despliegue permanece en un estado de creación o despliegue mientras se inicia su servicio. Se vuelve utilizable cuando el estado cambia a Listo; el tiempo varía según el modelo y la región, y típicamente toma unos pocos minutos.
Sí, cada modelo puede tener múltiples endpoints en diferentes regiones. Los recuentos de despliegues están limitados por plan: Free
3, Pro10, Enterpriseunlimited. La cuota se cobra al espacio de trabajo que posee el modelo, y un endpoint sirve exactamente a un modelo a la vez; utiliza el reemplazo de modelo para cambiarlo sin alterar la URL.Con el escalado a cero activado:
- El endpoint se reduce tras un periodo de inactividad
- La primera petición activa un arranque en frío
- Las peticiones posteriores son rápidas
Las primeras solicitudes después de un período de inactividad desencadenan un arranque en frío. Abrir la tarjeta de despliegue ejecuta una verificación de salud que calienta el endpoint, por lo que una predicción de prueba justo después responde rápidamente.