Ultralytics YOLO27:
Get Started

Endpoints dedicados#

Ultralytics Platform permite desplegar modelos YOLO en endpoints dedicados de 42 regiones de todo el mundo. Cada endpoint es un servicio de inquilino único con una URL de endpoint exclusiva y supervisión independiente. El tamaño predeterminado de los recursos se reduce a cero cuando están inactivos; los tamaños personalizados mantienen una instancia activa y se facturan por tiempo de actividad.

Pestaña de despliegue de Ultralytics Platform con mapa de regiones y tabla

Crear endpoint#

Desde la pestaña Deploy#

Despliega un modelo desde su pestaña Deploy:

  1. Ve a tu modelo
  2. Haz clic en la pestaña Deploy
  3. Consulta el mapa del mundo y la tabla de regiones, ordenada según la latencia medida desde tu ubicación
  4. Haz clic en Deploy en la fila de la región que quieras usar
  5. En el cuadro de diálogo, revisa la CPU, la memoria, el precio y el nombre del despliegue; después, haz clic en Create Deployment

El nombre sugerido combina el nombre del modelo y la ciudad de la región (por ejemplo, yolo26n-iowa) y se puede editar antes del despliegue. El modelo debe tener pesos; de lo contrario, la pestaña mostrará un estado vacío en lugar de la tabla de regiones.

Desde la pestaña Deployments#

Crea un despliegue desde la pestaña Deployments de tu perfil o desde la barra lateral:

  1. Haz clic en New Deployment en la pestaña Deployments o en +, junto a Deployments, en la barra lateral
  2. Selecciona un modelo en el selector de modelos, que muestra los modelos que has completado
  3. Selecciona una región en el minimapa o en la tabla de latencia
  4. Elige la CPU y la memoria, revisa el precio y edita el nombre de despliegue sugerido si es necesario
  5. Haz clic en Create Deployment

Cuadro de diálogo de nuevo despliegue de Ultralytics Platform con selector de modelo y mapa de regiones

Ciclo de vida del despliegue#

Conecta las alertas de Slack para recibir un mensaje cuando un despliegue esté listo o no se inicie.

Selección de región#

Elige entre 42 regiones de todo el mundo. El mapa interactivo de regiones y la tabla muestran:

  • Indicadores de región: codificados por colores según la latencia, con un gradiente de verde a rojo (las regiones más rápidas aparecen en tonos más verdes y las más lentas, en tonos más rojos)
  • Regiones desplegadas: resaltadas con una etiqueta «Deployed» en la tabla
  • Regiones en despliegue: indicador de pulso animado en el marcador y en la fila de la tabla
  • Resaltado bidireccional: al pasar el cursor por el mapa, se resalta la fila correspondiente de la tabla, y viceversa

Tabla de latencia de regiones de la pestaña Deploy de Ultralytics Platform ordenada por latencia

La tabla de regiones de la pestaña Deploy del modelo incluye:

ColumnaDescripción
UbicaciónCiudad y país con el icono de la bandera
ZonaIdentificador de región
LatenciaTiempo de ping medido desde tu navegador
DistanciaDistancia en km desde tu ubicación aproximada
AccionesBotón Deploy o etiqueta de estado «Deployed»

La tabla se puede buscar por ciudad, país y zona, y se ordena por latencia de forma predeterminada.

Cuadro de diálogo de nuevo despliegue

El cuadro de diálogo New Deployment (desde la pestaña Deployments o la barra lateral) muestra una tabla de regiones más sencilla, con solo las columnas Ubicación, Latencia y Seleccionar. Incluye las 20 regiones más rápidas y una nota sobre las demás. Usa el minimapa para elegir cualquier otra región.

Cómo se mide la latencia

Tu navegador mide la latencia de cada una de las 42 regiones. Los resultados se almacenan en caché durante 30 minutos y se comparten entre la pestaña Deploy y el cuadro de diálogo New Deployment. Usa el botón Rescan de la pestaña Deploy del modelo para volver a medirla desde tu red actual. La distancia se calcula a partir de la ubicación aproximada de tu solicitud, por lo que es una referencia aproximada, no un valor preciso.

Regiones disponibles#

ZonaUbicación
us-central1Iowa, EE. UU.
us-east1Carolina del Sur, EE. UU.
us-east4Virginia del Norte, EE. UU.
us-east5Columbus, EE. UU.
us-south1Dallas, EE. UU.
us-west1Oregón, EE. UU.
us-west2Los Ángeles, EE. UU.
us-west3Salt Lake City, EE. UU.
us-west4Las Vegas, EE. UU.
northamerica-northeast1Montreal, Canadá
northamerica-northeast2Toronto, Canadá
northamerica-south1Querétaro, México
southamerica-east1São Paulo, Brasil
southamerica-west1Santiago, Chile

Configuración del endpoint#

Cuadro de diálogo para crear una implementación#

El cuadro de diálogo New Deployment te permite seleccionar un modelo, una región, los recursos y el nombre de la implementación:

CampoDescripción
ModeloCualquier modelo completado del espacio de trabajo, seleccionado mediante el selector
RegiónRegión de implementación, seleccionada en el minimapa o en la tabla de latencia
CPU y memoriaSelecciona el tamaño de los recursos y consulta el precio que se muestra
Nombre de la implementaciónSe genera automáticamente cuando se seleccionan el modelo y la región, y se puede editar

Cuadro de diálogo de Ultralytics Platform para crear una implementación con valores predeterminados fijos para los recursos

Selecciona el tamaño de CPU y memoria en los controles de recursos y consulta el precio que se muestra antes de crear la implementación. Las opciones de CPU son 1, 2, 4, 6 u 8 vCPU, y las de memoria van de 2 a 32 GiB; los tamaños de memoria mayores requieren más vCPU (por ejemplo, 16 GiB requieren al menos 4 vCPU), y el cuadro de diálogo explica las combinaciones no válidas. El tamaño predeterminado (1 vCPU, 2 GiB) es gratuito y se reduce a cero cuando está inactivo. Los tamaños personalizados mantienen una instancia activa y se cobran según la tarifa horaria regional que se muestra, desde que están listas hasta que detienes el endpoint, incluido el tiempo de inactividad. Para crear, iniciar o cambiar el tamaño a uno personalizado, necesitas tener créditos disponibles; los endpoints de tamaño personalizado se detienen automáticamente cuando el espacio de trabajo se queda sin créditos. Agentes reutiliza este cuadro de diálogo cuando seleccionas Nueva implementación….

Cuadro de diálogo de Ultralytics Platform para crear una implementación con precios de CPU y memoria personalizados

Nombres generados automáticamente

El nombre de la implementación combina el nombre del modelo con la ciudad de la región, por ejemplo, yolo26n-iowa. Los nombres deben ser únicos en cada espacio de trabajo: si el nombre ya está en uso, el cuadro de diálogo muestra un error en línea y desactiva Crear implementación hasta que elijas otro nombre.

Pestaña Deploy (implementación rápida)#

Al implementar desde la pestaña Deploy del modelo, se abre el mismo cuadro de diálogo con el modelo y la región ya seleccionados. Revisa el tamaño de los recursos, el precio y el nombre generado automáticamente antes de crear el endpoint. Mientras se crea, la implementación aparece en la lista de implementaciones del modelo, debajo de la tabla de regiones.

Gestionar endpoints#

Modos de vista#

La lista de implementaciones ofrece tres modos de visualización:

ModoDescripción
TarjetasTarjetas con el estado, el tamaño, las métricas, la distancia y la fecha de implementación
CompactaCuadrícula de tarjetas más pequeñas con métricas clave
TablaTabla de datos con columnas ordenables

Pestaña Deploy de Ultralytics Platform con la vista de tarjetas de las implementaciones activas

Vistas compacta y de tabla

Las tarjetas compactas muestran la bandera, el nombre, la ciudad, el estado y las tres métricas. La vista de tabla permite ordenar por nombre, región, estado, CPU, memoria, solicitudes HTTP, tasa de errores HTTP, latencia P95 HTTP, distancia y fecha de implementación. Cada tarjeta y fila enlaza con la página de la implementación; las acciones del ciclo de vida están en esa página, y el icono de papelera junto a una implementación en la barra lateral permite eliminarla.

Página de la implementación#

Cada implementación tiene su propia página en /{username}/deploy/{deployment}, que muestra:

  • Cabecera: Bandera de la región, nombre visible (haz clic en él para cambiarlo; la URL de la página y la ruta de la API cambian para reflejar el nuevo nombre, pero la URL del endpoint no), insignia de estado, ubicación y tamaño de CPU y memoria
  • Acciones: Actualizar configuración, Reemplazar modelo y Detener implementación cuando está Lista; Iniciar implementación cuando está Detenida; y un menú de Más acciones (…) con Información, Actualizar y Eliminar implementación
  • Métricas: solicitudes HTTP, tasa de errores HTTP y latencia P95 HTTP durante 24 horas, con minigráficos, además de una tarjeta que enlaza con el modelo implementado
  • Pestañas: Overview, Monitoring, Predict y Logs
  • Mensaje de estado: Motivo del error, si ha fallado una implementación

La pestaña Overview muestra el mapa de ubicación, la tarjeta Endpoint con la URL del endpoint, que se puede copiar, un enlace a la documentación de la API y una comprobación de estado; también incluye una tarjeta de Información de la implementación con el precio, la región, la CPU y la memoria. La pestaña Logs muestra las entradas de registro recientes y permite filtrar por gravedad (Todos / Errores). La pestaña Predict ofrece un panel de predicción en línea para probar directamente la implementación; la pestaña de resultados Docs incluye ejemplos de código listos para usar en Python, JavaScript y cURL, rellenados con la URL del endpoint y, para los propietarios del espacio de trabajo, con la clave de API asociada (consulta Supervisión). El cuadro de diálogo Información enumera las propiedades de la implementación y te permite editar los metadatos personalizados.

Actualizar CPU y memoria#

  1. Abre la página de una implementación cuyo endpoint esté Listo.
  2. Haz clic en Actualizar configuración.
  3. Elige CPU y Memoria, y consulta el coste por hora que se muestra.
  4. Haz clic en Actualizar configuración. La configuración actual seguirá atendiendo solicitudes hasta que la nueva esté lista.

Actualización de la configuración de CPU y memoria de una implementación en Ultralytics Platform

Los recursos personalizados se facturan por tiempo de actividad y mantienen una instancia activa, lo que también permite mantener una cámara IP en funcionamiento sin coste adicional (consulta Cámara en segundo plano). Al volver a los recursos predeterminados, se restaura el comportamiento de reducción a cero y se elimina la cámara en segundo plano.

Datos de supervisión temporales

Los gráficos de supervisión y las imágenes de ejemplo son datos ligeros almacenados en memoria. Al detener, reiniciar, volver a implementar, cambiar el tamaño o reemplazar un modelo, estos datos pueden borrarse. Al volver a iniciar el endpoint, no se restaura el historial. Guarda los ejemplos útiles en un conjunto de datos y espera a que termine la ingesta antes de modificar el endpoint. Las métricas operativas y los registros tienen periodos de retención independientes.

Reemplazar un modelo#

Reemplaza el modelo de un endpoint listo sin cambiar su URL:

  1. Abre la página de la implementación
  2. Haz clic en Reemplazar modelo
  3. Selecciona otro modelo completado del mismo espacio de trabajo
  4. Si quieres, edita el nombre de la implementación
  5. Haz clic en Reemplazar modelo

El modelo actual seguirá atendiendo solicitudes mientras se inicia el modelo de reemplazo. Cuando el modelo de reemplazo esté listo, el tráfico se dirigirá al nuevo modelo. El ID de la implementación, la URL, la región y la clave de API no cambian; el nombre visible solo cambia si introduces uno nuevo. Si se produce un error al reemplazar el modelo, el modelo y el nombre anteriores seguirán activos.

Para que se acepte el reemplazo, deben cumplirse todos los requisitos siguientes:

  • La implementación está Lista y no hay ninguna otra operación del ciclo de vida en curso
  • El modelo de sustitución tiene pesos y pertenece al mismo espacio de trabajo que la implementación
  • El modelo de sustitución no es el que ya está implementado
Un modelo por endpoint

La sustitución elimina el modelo anterior de la implementación. Cada endpoint sirve un modelo; crea otra implementación si necesitas que ambos modelos estén disponibles al mismo tiempo.

Estados de la implementación#

EstadoDescripción
CreandoSe está configurando la implementación
ImplementandoEl contenedor está arrancando
ListaEl endpoint está activo y acepta solicitudes
DeteniendoEl endpoint se está apagando
DetenidoEn pausa o no se ha podido iniciar; haz clic en Iniciar

En una implementación Lista, la insignia de la página muestra Iniciando hasta que el endpoint responde a su primera comprobación de estado, y No responde si la comprobación falla.

URL del endpoint#

Cada endpoint tiene una URL única, por ejemplo:

https://predict-<deployment-id>-<hash>-<region>.a.run.app

Tarjeta de implementación de Ultralytics Platform: URL del endpoint con botón para copiar

Haz clic en el botón de copia para copiar la URL. Haz clic en Documentación de la API para abrir la referencia de API del endpoint. El endpoint sirve estas rutas:

RutaMétodoDescripción
/predictPOSTEjecutar inferencia; requiere la clave de API de la implementación
/healthGETComprobación de disponibilidad que informa del estado del servicio y del número de modelos en caché
/GETResumen del estado del servicio implementado
/docsGETReferencia interactiva de la API generada para esta implementación, modelo y región

Gestión del ciclo de vida#

Controla el estado de tu endpoint:

AcciónDescripción
IniciarReanudar un endpoint detenido
DetenerPoner el endpoint en pausa
EliminarEliminar el endpoint de forma permanente

Detener el endpoint#

Detén un endpoint si no quieres que acepte solicitudes:

  1. Haz clic en Detener implementación en la página de la implementación
  2. El estado del endpoint cambia a «Deteniendo» y, después, a «Detenido»

Los endpoints detenidos:

  • No aceptan solicitudes ni muestran métricas en tiempo real o el estado de salud del servicio
  • Dejan de acumular cargos por tiempo de actividad
  • Pierden las estadísticas de supervisión temporales y las imágenes de ejemplo cuando se apaga la instancia de servicio
  • Conservan su URL, región y clave de API asociada, y se pueden reiniciar en cualquier momento
  • Siguen contando para la cuota de implementaciones de tu plan; elimina un endpoint para liberar su espacio

Eliminar el endpoint#

Elimina un endpoint de forma permanente:

  1. Abre Más acciones (…) en la página de la implementación y haz clic en Eliminar implementación, o haz clic en el icono de la papelera junto a la implementación en la barra lateral
  2. Confirma con Eliminar
Acción permanente

La eliminación es inmediata y permanente: las implementaciones no se envían a la papelera. Al eliminar el endpoint, se quita su servicio y se libera un espacio de la cuota de implementaciones. Siempre puedes crear otro endpoint, pero tendrá una URL nueva.

Las implementaciones también se eliminan cuando se borra de forma permanente su modelo o proyecto, o cuando un modelo o proyecto enviado a la papelera llega al final de su periodo de conservación.

Uso de endpoints#

Autenticación#

Cada implementación está asociada a una única clave de API del espacio de trabajo propietario del modelo. Inclúyela en las solicitudes:

Authorization: Bearer YOUR_API_KEY

El endpoint solo acepta la clave asociada durante su creación, así que ninguna otra clave permite acceder a él, ni siquiera otra clave activa del mismo espacio de trabajo. Para controlar qué clave se asocia, implementa mediante la API autenticada con la clave del propietario del espacio de trabajo: se asocia esa clave exacta y ya la tienes. Las implementaciones creadas de cualquier otra forma (mediante la interfaz de Platform o una llamada a la API autenticada como miembro del equipo) asocian automáticamente una de las claves activas del espacio de trabajo propietario. Pídele su valor al propietario del espacio de trabajo, ya que solo él puede ver los valores de las claves (consulta Claves de API). Los miembros del equipo que no tengan la clave asociada pueden seguir ejecutando inferencias a través del proxy de predicción de Platform en el navegador.

Eliminar la clave asociada no bloquea el endpoint

Eliminar o desactivar la clave de API asociada no revoca el acceso directo al endpoint: cualquiera que tenga la cadena de la clave puede seguir llamando a la URL del endpoint. Lo que deja de funcionar es el proxy de predicción de Platform, que comprueba la clave en tiempo real e indica que ya no está disponible. Para revocar el acceso por completo, detén o elimina la implementación; después de rotar las claves, vuelve a crear el endpoint para asociarlo a la nueva clave.

Solicitudes directas al endpoint#

Envía las solicitudes de producción directamente a la URL que aparece en la página de la implementación. Estas solicitudes no pasan por el limitador de velocidad de la API de Platform, por lo que no se aplica el límite de predicción de 20 solicitudes por minuto. El endpoint sigue teniendo su propio límite de capacidad:

  • Una única instancia sirve cada endpoint y procesa un número limitado de solicitudes a la vez
  • Las solicitudes que no se pueden atender rápidamente devuelven 429 con una cabecera Retry-After
  • Una solicitud puede ejecutarse durante un máximo de 1 hora, lo que permite completar la inferencia de vídeo
  • El tamaño del cuerpo de las solicitudes está limitado a 32 MB; las cargas más grandes se rechazan con 413
  • Las respuestas de más de 1 KB se comprimen con gzip y se permiten las solicitudes del navegador entre orígenes distintos

Ejemplo de solicitud#

import requests

# Endpoint de la implementación
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"

# Cabeceras con tu clave de API de la implementación
headers = {"Authorization": "Bearer YOUR_API_KEY"}

# Parámetros de inferencia
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}

# Enviar una imagen para inferencia
with open("image.jpg", "rb") as f:
    response = requests.post(url, headers=headers, data=data, files={"file": f})

print(response.json())

Parámetros de la solicitud#

ParámetroTipoPredeterminadoIntervaloDescripción
filefile--Archivo de imagen o vídeo (obligatorio, salvo que se haya definido source)
conffloat0.250.01 – 1.0Umbral mínimo de confianza
ioufloat0.70.0 – 0.95Umbral de IoU de NMS
imgszint-32 – 1280Tamaño de la imagen de entrada en píxeles; de forma predeterminada, se utiliza el tamaño de entrenamiento del modelo (640 si no está disponible)
normalizeboolfalse-Devuelve las coordenadas de las cajas delimitadoras en el intervalo 0 – 1
decimalsint50 – 10Precisión decimal de los valores de las coordenadas
vid_strideint1≥ 1Predice cada N fotogramas del vídeo; se ignora en las imágenes
bitsint88, 12, 16Cuantización del mapa de profundidad; solo para modelos de profundidad
sourcestring--URL de imagen o cadena en base64 (alternativa a file); máximo de 4,096 caracteres mediante la API de Platform

Un endpoint conserva el entorno de ejecución de inferencia de su último despliegue, por lo que los cambios de comportamiento más recientes, como el valor predeterminado de tamaño de entrenamiento imgsz o el vid_stride anterior, le llegan cuando se publica una nueva revisión, por ejemplo, después de sustituir su modelo o cambiar su CPU o memoria. Pasa imgsz explícitamente para fijar el tamaño de entrada.

Consulta Respuestas de profundidad para saber cómo bits modifica el mapa de profundidad devuelto y cómo decodificarlo.

Inferencia de vídeo

Los endpoints dedicados aceptan imágenes y vídeos mediante el parámetro file.

  • Formatos de imagen (hasta 32 MB por solicitud): AVIF, BMP, DNG, HEIC, HEIF, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
  • Formatos de vídeo (hasta 32 MB por solicitud): ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV

Los resultados se devuelven para cada fotograma de vídeo procesado; los modelos de profundidad solo aceptan imágenes. También puedes pasar una URL pública de imagen o una imagen codificada en base64 mediante el parámetro source en lugar de file. Las cargas que superen el tamaño máximo se rechazan con 413.

Formato de respuesta#

Igual que la inferencia compartida, con campos específicos de la tarea.

Preguntas frecuentes#

  • Los límites de endpoints dependen del plan:

    • Free: hasta 3 implementaciones
    • Pro: hasta 10 implementaciones
    • Enterprise: implementaciones ilimitadas

    Cada modelo puede seguir implementándose en varias regiones dentro de la cuota de tu plan. La cuota se descuenta del espacio de trabajo propietario del modelo, así que los miembros del equipo que implementen un modelo compartido consumirán el límite del propietario. Si alcanzas el límite, se mostrará un error que te pedirá eliminar primero una implementación existente.

  • No, las regiones son fijas. Para cambiar de región:

    1. Elimina el endpoint existente
    2. Crea un endpoint nuevo en la región deseada

    El nuevo endpoint recibe una URL nueva. Para cambiar solo el modelo asociado a un endpoint, usa la sustitución del modelo, que conserva la URL.

  • Para tener cobertura global:

    1. Implementa en varias regiones
    2. Usa un balanceador de carga o enrutamiento DNS
    3. Dirige a los usuarios al endpoint más cercano
  • El tiempo de arranque en frío depende del modelo y de si el endpoint ha escalado a cero. El arranque desde un estado inactivo puede tardar hasta aproximadamente un minuto, y Platform permite que un endpoint inactivo disponga de algo más de tiempo para arrancar antes de marcarlo como no saludable. Abrir la página de la implementación o volver a ejecutar su comprobación de estado activa un endpoint inactivo, así que haz una de estas dos cosas antes de que llegue un pico de tráfico.

  • No. Cada implementación sirve el tráfico en la URL generada del endpoint que se muestra en su página de implementación, que permanece estable durante toda la vida de la implementación, incluso cuando se sustituye el modelo.

Comentarios