Ultralytics YOLO27:

Despliegue#

Ultralytics Platform ofrece opciones completas de implementación de modelos para poner tus modelos YOLO en producción. Prueba los modelos con inferencia desde el navegador, impleméntalos en endpoints dedicados en 42 regiones de todo el mundo y supervisa el rendimiento en tiempo real.



Watch: Get Started with Ultralytics Platform - Deploy

Descripción general#

La sección Implementación te ayuda a:

  • Probar modelos directamente en el navegador con la pestaña Predict
  • Implementar en endpoints dedicados en 42 regiones de todo el mundo
  • Supervisa las métricas de solicitudes, registros, comprobaciones de estado y predicciones temporales en los endpoints de pago
  • Elige recursos: los endpoints predeterminados se escalan a cero; los tamaños personalizados mantienen una instancia activa con facturación por tiempo de actividad

Mapa mundial de la página de implementación de Ultralytics Platform con tarjetas de resumen

Opciones de implementación#

Ultralytics Platform ofrece varias vías de implementación:

OpciónDescripciónIdeal para
Pestaña PredecirInferencia desde el navegador con imágenes, cámara web y ejemplosDesarrollo, validación
Inferencia compartidaServicio multiinquilino en 3 regiones de datosUso ligero, pruebas
Endpoints dedicadosServicios para un único inquilino en 42 regionesProducción, baja latencia
ExportarDescarga los pesos en 20 formatos para ejecutarlos localmente o en el edgeSin conexión, en el dispositivo

Flujo de trabajo#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
EtapaDescripción
TestValida el modelo con la pestaña Predict
ConfigurarSelecciona un modelo, una región, una CPU y memoria; revisa los precios y el nombre del despliegue
DesplegarCrea un endpoint dedicado desde la pestaña Deploy
SupervisarInspecciona las métricas del endpoint y las predicciones temporales en Monitoring

Arquitectura#

Inferencia compartida#

El servicio de inferencia compartida se ejecuta en 3 regiones clave. Las solicitudes a un modelo se enrutan al servicio de la región de datos de ese modelo, por lo que los resultados permanecen dentro de la región donde está almacenado el modelo:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegiónEtiquetaUbicaciónIdeal para
USAméricaIowa, EE. UU.Usuarios de América, la opción más rápida para América
EUEuropa, Oriente Medio y ÁfricaBélgica, EuropaUsuarios europeos, cumplimiento del RGPD
APAsia-PacíficoTaiwán, Asia-PacíficoUsuarios de Asia-Pacífico, menor latencia de APAC

Endpoints dedicados#

Implementa en 42 regiones de todo el mundo en Ultralytics Cloud:

  • América: 14 regiones
  • Europa: 13 regiones
  • Asia-Pacífico: 12 regiones
  • Oriente Medio y África: 3 regiones

Cada endpoint es un servicio para un único inquilino con:

  • CPU y memoria configurables con precios mostrados antes del despliegue
  • Escalado a cero para recursos predeterminados; una instancia activa facturada por tiempo de actividad para recursos personalizados
  • URL de endpoint única con su propia referencia interactiva de la API en /docs
  • Su propia asociación de clave de API, de modo que solo esa clave pueda llamar al endpoint
  • Supervisión, registros y comprobaciones de estado independientes

Página de implementaciones#

Accede a la página de implementaciones globales desde la barra lateral, en Deploy. Esta página muestra:

  • Mapa mundial con marcadores de las regiones implementadas; haz clic en una región para abrir el cuadro de diálogo New Deployment
  • Tarjetas de resumen: Solicitudes HTTP (24h), Despliegues activos, Tasa de errores HTTP (24h), Latencia HTTP P95 (24h)
  • Lista de implementaciones con tres modos de vista: tarjetas, compacta y tabla
  • Botón Nueva implementación para crear endpoints a partir de cualquier modelo completado
  • Botón Actualizar y una marca de tiempo Updated en la cabecera de la página

Tarjetas de resumen y lista de implementaciones de la página de implementación de Ultralytics Platform

Sondeo automático

La página se actualiza automáticamente y realiza sondeos más frecuentes mientras las implementaciones se encuentran en un estado de transición (creating, deploying o stopping). Consulta Supervisión para obtener más información.

Supervisión ligera y temporal

Los endpoints de pago proporcionan gráficos e imágenes de ejemplo que se mantienen únicamente en la memoria de la instancia de servicio. Detener, reiniciar, volver a desplegar, cambiar el tamaño o reemplazar el modelo puede borrar estos datos. Guarda los ejemplos en un conjunto de datos y espera a que finalice la ingesta para conservarlos. Consulta Monitoring.

Características principales#

Cobertura global#

Implementa cerca de tus usuarios con 42 regiones que cubren:

  • Norteamérica, Sudamérica
  • Europa, Oriente Medio, África
  • Asia-Pacífico, Oceanía

Comportamiento del escalado#

Actualmente, los endpoints se comportan de la siguiente manera:

  • Recursos predeterminados: los endpoints inactivos se reducen a cero y se inician en frío en la siguiente solicitud
  • Recursos personalizados: una instancia se mantiene activa y acumula cargos por tiempo de actividad hasta que se detiene
  • Una única instancia activa: actualmente, cada endpoint presta servicio desde una instancia en todos los planes
  • Reducción de carga: las solicitudes reciben respuestas 429 cuando el endpoint alcanza temporalmente su capacidad; consulta Solicitudes directas a endpoints
  • Tiempo de espera de solicitud: las solicitudes directas al endpoint tienen una duración máxima de 1 hora; consulta Inference para ver las entradas compatibles

Implementación regional#

Usa la latencia medida de las regiones para colocar un endpoint cerca de quienes lo llaman. La latencia real de inferencia depende del modelo, el tamaño de entrada, el estado del endpoint y la ruta de red.

Comprobaciones de estado#

Cada implementación en ejecución incluye una comprobación de estado automática con:

  • Indicador de estado en directo (saludable/no saludable)
  • Visualización de la latencia de respuesta
  • Reintento automático cuando no está saludable, que se detiene cuando vuelve a estar saludable
  • Botón de actualización manual

Inicio rápido#

Crea una implementación:

  1. Entrena o sube un modelo a un proyecto
  2. Ve a la pestaña Implementar del modelo
  3. Haz clic en Deploy para una región en la tabla de latencia
  4. Revisa la CPU, la memoria, los precios y el nombre en el cuadro de diálogo de despliegue
  5. Haz clic en Create Deployment y espera a que el estado del despliegue pase a Ready
Implementación rápida
Model → Deploy tab → Deploy in a region → Review configuration → Create Deployment

El nombre del despliegue se genera a partir del nombre del modelo y la ciudad de la región y se puede editar antes del despliegue. Una vez desplegado, utiliza la URL del endpoint con tu clave de API para enviar solicitudes de inferencia desde cualquier aplicación.

Enlaces rápidos#

Preguntas frecuentes#

  • CaracterísticaCompartidaDedicada
    ServicioCompartido entre los usuarios de PlatformDedicado a una implementación
    EscaladoGestionado por PlatformPredeterminado: se escala a cero; personalizado: se mantiene activo
    Regiones3 regiones de datosElige entre 42 regiones de implementación
    URLAPI de modelos de PlatformURL de endpoint de implementación generada
    PruebasPestaña Predict del modeloPestaña Predict de la tarjeta de implementación o API
    Límites de frecuencia20 solicitudes por minutoSin límite de frecuencia de Platform en llamadas directas
    AutenticaciónCualquier clave de API del espacio de trabajoSolo la clave de API asociada a la implementación
  • El despliegue permanece en estado de creación o despliegue mientras se inicia el servicio. Pasa a estar disponible cuando el estado cambia a Ready; el tiempo varía según el modelo y la región, y normalmente tarda unos minutos.

  • Sí, cada modelo puede tener varios endpoints en distintas regiones. El número de despliegues está limitado según el plan: Free 3, Pro 10, Enterprise unlimited. La cuota se aplica al espacio de trabajo propietario del modelo, y un endpoint sirve exactamente para un modelo a la vez; usa el reemplazo de modelos para cambiarlo sin modificar la URL.

  • Los endpoints con recursos predeterminados se escalan a cero cuando están inactivos:

    • El endpoint reduce su escala tras un periodo de inactividad
    • La primera solicitud activa un arranque en frío
    • Las solicitudes posteriores son rápidas

    Las primeras solicitudes después de un periodo de inactividad activan un arranque en frío. Al abrir la tarjeta del despliegue se ejecuta una comprobación de estado que calienta el endpoint, por lo que una predicción de prueba responde rápidamente justo después.

    Los endpoints con recursos personalizados se mantienen activos y se les cobra por el tiempo de actividad, incluido el tiempo de inactividad. Detén un endpoint para detener su cargo por tiempo de actividad.

Comentarios