YOLO Vision 2026:

Despliegue#

Ultralytics Platform ofrece opciones de despliegue de modelos completas para poner tus modelos YOLO en producción. Prueba los modelos con inferencia basada en navegador, despliega en endpoints dedicados en 42 regiones globales y supervisa el rendimiento en tiempo real.



Watch: Get Started with Ultralytics Platform - Deploy

Descripción general#

La sección de Despliegue te ayuda a:

  • Prueba los modelos directamente en el navegador con la pestaña Predict
  • Despliega en puntos de conexión dedicados en 42 regiones globales
  • Supervisar métricas de peticiones, registros y comprobaciones de estado
  • Escalar a cero cuando esté inactivo (los despliegues ejecutan actualmente una única instancia activa)

Ultralytics Platform Deploy Page World Map With Overview Cards

Opciones de despliegue#

Ultralytics Platform ofrece múltiples rutas de despliegue:

OpciónDescripciónIdeal para
Pestaña PredictInferencia basada en navegador con imágenes, webcam y ejemplosDesarrollo, validación
Inferencia compartidaServicio multiinquilino en 3 regiones de datosUso ligero, pruebas
Endpoints dedicadosServicios de inquilino único en 42 regionesProducción, baja latencia
ExportarDescarga los pesos en 20 formatos para ejecución local o en el bordeSin conexión, en el dispositivo

Flujo de trabajo#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
EtapaDescripción
ProbarValida el modelo con la pestaña Predict
ConfigurarSelecciona una región; el nombre del despliegue se genera a partir del modelo y la ciudad
Deploy (Desplegar)Crea un endpoint dedicado desde la pestaña Deploy
MonitorizarHaz un seguimiento de las solicitudes, la latencia, los errores y los registros en Supervisión

Arquitectura#

Inferencia compartida#

El servicio de inferencia compartido se ejecuta en 3 regiones clave. Las solicitudes a un modelo se enrutan al servicio en la región de datos de ese modelo, por lo que los resultados permanecen dentro de la región donde se almacena el modelo:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegiónEtiquetaUbicaciónIdeal para
USAméricaIowa, EE. UU.Usuarios de América, la más rápida para América
EUEuropa, Oriente Medio y ÁfricaBélgica, EuropaUsuarios europeos, cumplimiento de GDPR
APAsia-PacíficoTaiwán, Asia-PacíficoUsuarios de Asia-Pacífico, menor latencia APAC

Puntos de conexión dedicados#

Despliega en 42 regiones de todo el mundo en Ultralytics Cloud:

  • América: 14 regiones
  • Europa: 13 regiones
  • Asia-Pacífico: 12 regiones
  • Oriente Medio y África: 3 regiones

Cada punto de conexión es un servicio de inquilino único con:

  • Dimensionamiento gestionado por la plataforma (no configurable actualmente)
  • Escalado a cero cuando esté inactivo
  • URL de endpoint única con su propia referencia de API interactiva en /docs
  • Su propia vinculación de clave de API, de modo que solo esa clave pueda llamar al endpoint
  • Supervisión, registros y comprobaciones de estado independientes

Página de despliegues#

Accede a la página de despliegues globales desde la barra lateral en Deploy. Esta página muestra:

  • Mapa del mundo con marcadores de regiones desplegadas; haz clic en una región para abrir el diálogo de New Deployment
  • Tarjetas de resumen: Peticiones totales (24 h), Despliegues activos, Tasa de errores (24 h), Latencia P95 (24 h)
  • Lista de despliegues con tres modos de visualización: tarjetas, compacto y tabla
  • Botón Nuevo despliegue para crear puntos de conexión desde cualquier modelo completado
  • Botón de Actualizar y una marca de tiempo de Updated en el encabezado de la página

Ultralytics Platform Deploy Page Overview Cards And Deployments List

Sondeo automático

La página se actualiza automáticamente, sondeando más rápido mientras los despliegues se encuentran en un estado de transición (creating, deploying o stopping). Consulta Monitoreo para obtener más detalles.

Características clave#

Cobertura global#

Despliega cerca de tus usuarios con 42 regiones que cubren:

  • Norteamérica, Sudamérica
  • Europa, Oriente Medio, África
  • Asia Pacífico, Oceanía

Comportamiento de escalado#

Los puntos de conexión funcionan actualmente de la siguiente manera:

  • Escalar a cero: los endpoints inactivos se reducen a cero y realizan un arranque en frío en la siguiente solicitud
  • Instancia activa única: cada endpoint sirve actualmente desde una única instancia en todos los planes
  • Descarte de carga: las solicitudes reciben respuestas de 429 cuando el endpoint está temporalmente a su máxima capacidad; consulta Solicitudes de Endpoint Directas
  • Tiempo de espera de solicitud: cada solicitud puede ejecutarse hasta por 1 hora, lo cual es suficiente para la inferencia de video

Despliegue regional#

Utiliza la latencia de región medida para ubicar un endpoint cerca de quienes lo llaman. La latencia de inferencia real depende del modelo, el tamaño de entrada, el estado del endpoint y la ruta de red.

Comprobaciones de estado#

Cada despliegue en ejecución incluye una comprobación de estado automática con:

  • Indicador de estado en vivo (saludable/no saludable)
  • Visualización de la latencia de respuesta
  • Reintento automático en caso de fallo de salud, deteniéndose una vez que vuelva a estar saludable
  • Botón de actualización manual

Inicio rápido#

Crea un despliegue:

  1. Entrena o carga un modelo en un proyecto
  2. Ve a la pestaña Deploy del modelo
  3. Selecciona una región de la tabla de latencia
  4. Haz clic en Deploy y espera a que el estado del despliegue cambie a Ready
Despliegue rápido
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

El nombre del despliegue se genera a partir del nombre del modelo y la ciudad de la región, por lo que no se requiere ningún paso de nomenclatura. Una vez desplegado, utiliza la URL del endpoint con tu clave de API para enviar solicitudes de inferencia desde cualquier aplicación.

Enlaces rápidos#

FAQ#

  • CaracterísticaCompartidaDedicada
    ServicioCompartido entre los usuarios de PlatformDedicado a un solo despliegue
    EscaladoGestionado por PlatformEscalado a cero, una instancia
    Regiones3 regiones de datosElige entre 42 regiones de despliegue
    URLAPI de modelo de PlatformURL de endpoint de despliegue generada
    PruebasPestaña Predict del modeloPestaña Predict de la tarjeta de despliegue o API
    Límites de tasa20 solicitudes/minutoSin límite de tasa de la plataforma en llamadas directas
    AutenticaciónCualquier clave de API del espacio de trabajoSolo la clave de API vinculada al despliegue
  • El despliegue permanece en un estado de creación o despliegue mientras se inicia su servicio. Se vuelve utilizable cuando el estado cambia a Listo; el tiempo varía según el modelo y la región, y típicamente toma unos pocos minutos.

  • Sí, cada modelo puede tener múltiples endpoints en diferentes regiones. Los recuentos de despliegues están limitados por plan: Free 3, Pro 10, Enterprise unlimited. La cuota se cobra al espacio de trabajo que posee el modelo, y un endpoint sirve exactamente a un modelo a la vez; utiliza el reemplazo de modelo para cambiarlo sin alterar la URL.

  • Con el escalado a cero activado:

    • El endpoint se reduce tras un periodo de inactividad
    • La primera petición activa un arranque en frío
    • Las peticiones posteriores son rápidas

    Las primeras solicitudes después de un período de inactividad desencadenan un arranque en frío. Abrir la tarjeta de despliegue ejecuta una verificación de salud que calienta el endpoint, por lo que una predicción de prueba justo después responde rápidamente.

Comentarios