YOLO Vision 2026:

Despliegue#

Ultralytics Platform ofrece opciones integrales de despliegue de modelos para poner tus modelos YOLO en producción. Prueba los modelos con inferencia basada en navegador, despliega en puntos de conexión dedicados en 42 regiones globales y supervisa el rendimiento en tiempo real.



Watch: Get Started with Ultralytics Platform - Deploy

Descripción general#

La sección de Despliegue te ayuda a:

  • Probar modelos directamente en el navegador con la pestaña Predict
  • Despliega en puntos de conexión dedicados en 42 regiones globales
  • Supervisar métricas de peticiones, registros y comprobaciones de estado
  • Escalar a cero cuando esté inactivo (los despliegues ejecutan actualmente una única instancia activa)

Ultralytics Platform Deploy Page World Map With Overview Cards

Opciones de despliegue#

Ultralytics Platform ofrece múltiples rutas de despliegue:

OpciónDescripciónIdeal para
Pestaña PredictInferencia basada en navegador con imágenes, webcam y ejemplosDesarrollo, validación
Inferencia compartidaServicio multiinquilino en 3 regionesUso ligero, pruebas
Puntos de conexión dedicadosServicios de inquilino único en 42 regionesProducción, baja latencia

Flujo de trabajo#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
EtapaDescripción
ProbarValida el modelo con la pestaña Predict
ConfigurarSelecciona una región y revisa el nombre de despliegue editable y generado automáticamente
Deploy (Desplegar)Crea un punto de conexión dedicado desde la pestaña Deploy
MonitorizarRealiza el seguimiento de peticiones, latencia, errores y registros en Monitoring

Arquitectura#

Inferencia compartida#

El servicio de inferencia compartida se ejecuta en 3 regiones clave, dirigiendo automáticamente las peticiones según tu región de datos:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Region Router}:::decide
    Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegiónEtiquetaUbicaciónIdeal para
USAméricaIowa, EE. UU.Usuarios de América, la más rápida para América
EUEuropa, Oriente Medio y ÁfricaBélgica, EuropaUsuarios europeos, cumplimiento de GDPR
APAsia-PacíficoTaiwán, Asia-PacíficoUsuarios de Asia-Pacífico, menor latencia APAC

Puntos de conexión dedicados#

Despliega en 42 regiones de todo el mundo en Ultralytics Cloud:

  • América: 14 regiones
  • Europa: 13 regiones
  • Asia-Pacífico: 12 regiones
  • Oriente Medio y África: 3 regiones

Cada punto de conexión es un servicio de inquilino único con:

  • Recursos predeterminados de 1 CPU, 2 GiB de memoria, minInstances=0, maxInstances=1
  • Escalado a cero cuando esté inactivo
  • URL de punto de conexión única
  • Supervisión, registros y comprobaciones de estado independientes

Página de despliegues#

Accede a la página de despliegues globales desde la barra lateral en Deploy. Esta página muestra:

  • Mapa mundial con chinchetas de regiones desplegadas (mapa interactivo)
  • Tarjetas de resumen: Peticiones totales (24 h), Despliegues activos, Tasa de errores (24 h), Latencia P95 (24 h)
  • Lista de despliegues con tres modos de visualización: tarjetas, compacto y tabla
  • Botón Nuevo despliegue para crear puntos de conexión desde cualquier modelo completado

Ultralytics Platform Deploy Page Overview Cards And Deployments List

Sondeo automático

La página realiza sondeos cada 15 segundos normalmente. Cuando los despliegues están en un estado de transición (creating, deploying o stopping), el sondeo aumenta a cada 3 segundos para una respuesta más rápida.

Características clave#

Cobertura global#

Despliega cerca de tus usuarios con 42 regiones que cubren:

  • Norteamérica, Sudamérica
  • Europa, Oriente Medio, África
  • Asia Pacífico, Oceanía

Comportamiento de escalado#

Los puntos de conexión funcionan actualmente de la siguiente manera:

  • Escalar a cero: minInstances tiene un valor predeterminado de 0
  • Única instancia activa: maxInstances está limitado actualmente a 1 en todos los planes

Despliegue regional#

Utiliza la latencia de región medida para ubicar un endpoint cerca de quienes lo llaman. La latencia de inferencia real depende del modelo, el tamaño de entrada, el estado del endpoint y la ruta de red.

Comprobaciones de estado#

Cada despliegue en ejecución incluye una comprobación de estado automática con:

  • Indicador de estado en vivo (saludable/no saludable)
  • Visualización de la latencia de respuesta
  • Reintento automático cuando no es saludable (sondea cada 20 segundos)
  • Botón de actualización manual

Inicio rápido#

Crea un despliegue:

  1. Entrena o carga un modelo en un proyecto
  2. Ve a la pestaña Deploy del modelo
  3. Selecciona una región de la tabla de latencia
  4. Haz clic en Deploy y espera a que el estado del despliegue cambie a Ready
Despliegue rápido
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

Una vez desplegado, utiliza la URL del punto de conexión con tu clave de API para enviar peticiones de inferencia desde cualquier aplicación.

Enlaces rápidos#

FAQ#

¿Cuál es la diferencia entre la inferencia compartida y la dedicada?#

CaracterísticaCompartidaDedicada
ServicioCompartido entre los usuarios de PlatformDedicado a un solo despliegue
EscaladoGestionado por PlatformEscalado a cero, una instancia
Regiones3 regiones de datosElige entre 42 regiones de despliegue
URLAPI de modelo de PlatformURL de endpoint de despliegue generada
PruebasPestaña Predict del modeloPestaña Predict de la tarjeta de despliegue o API

¿Cuánto tarda el despliegue?#

El despliegue permanece en estado de creación o despliegue mientras se inicia su servicio. Se puede utilizar cuando el estado cambia a Ready; el tiempo varía según el modelo y la región.

¿Puedo desplegar varios modelos?#

Sí, cada modelo puede tener múltiples endpoints en diferentes regiones. El número de despliegues está limitado por tu plan: Free 3, Pro 10, Enterprise unlimited.

¿Qué ocurre cuando un endpoint está inactivo?#

Con el escalado a cero activado:

  • El endpoint se reduce tras un periodo de inactividad
  • La primera petición activa un arranque en frío
  • Las peticiones posteriores son rápidas

Las primeras peticiones tras un periodo de inactividad activan un arranque en frío.

Comentarios