Limitación y puesta en cola de solicitudes de IA
Aprenda a proteger el backend de su SaaS de IA frente a la sobrecarga y los costes descontrolados mediante limitación de solicitudes, colas de peticiones y backpressure controlado.
Limitación y puesta en cola de solicitudes de IA es una lección gratuita de AI SaaS Builder en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI SaaS Builder, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI SaaS Builder incluye 4 lecciones en total.
Por qué limitar las solicitudes de IA
Los endpoints de IA son lentos y costosos. Sin límites, unos pocos usuarios —o un error— pueden agotar su presupuesto o bloquear el servicio.
- Controlar los costes
- Proteger la estabilidad
- Garantizar la equidad
Fundamentos de la limitación de solicitudes
Un límite de solicitudes restringe cuántas solicitudes puede enviar un cliente en un intervalo de tiempo; por ejemplo, 60 solicitudes por minuto.
Algoritmo del depósito de tokens
El depósito de tokens se rellena con el tiempo. Cada solicitud consume un token; si el depósito está vacío, la solicitud se rechaza o debe esperar.
class TokenBucket:
def __init__(self, capacity, refill_per_sec):
self.capacity = capacity
self.tokens = capacity
self.refill = refill_per_sec
def allow(self):
if self.tokens >= 1:
self.tokens -= 1
return True
return FalseLímites por usuario frente a límites globales
Aplique límites por usuario para garantizar la equidad y un límite global para proteger todo el sistema y la cuota de su proveedor.
Devolver 429
Cuando un cliente supera el límite, responda con HTTP 429 Too Many Requests y una cabecera Retry-After.
res.status(429)
.set('Retry-After', '30')
.json({ error: 'rate_limited' })Por qué poner en cola los trabajos largos
La generación de IA puede tardar varios segundos. Mantener abierta la conexión HTTP desperdicia recursos. Una cola permite aceptar el trabajo y procesarlo de forma asíncrona.
Patrón de cola de trabajos
Acepte la solicitud, añada un trabajo a la cola y devuelva inmediatamente un identificador del trabajo. Los workers extraen los trabajos y ejecutan la llamada a la IA.
POST /generate -> { jobId: 'abc123', status: 'queued' }
# worker processes job
GET /jobs/abc123 -> { status: 'done', result: ... }Contrapresión
Cuando la cola crezca demasiado, aplique contrapresión: rechace trabajos nuevos de baja prioridad o avise a los usuarios de las demoras, en lugar de acumularlos silenciosamente.
Límites de concurrencia para workers
Limite cuántas llamadas a la IA se ejecutan simultáneamente para respetar los límites de su proveedor y mantener una latencia predecible.
# worker config
MAX_CONCURRENT_AI_CALLS = 5Reintentos con retroceso
Los proveedores de IA fallan ocasionalmente o aplican límites de solicitudes. Reintente los errores transitorios con retroceso exponencial, pero limite el número de intentos para evitar bucles.
delay = base * (2 ** attempt) # 1s, 2s, 4s, 8s ...Observabilidad
Supervise la profundidad de la cola, la tasa de rechazos y la latencia media. Las métricas le indican cuándo ampliar los workers o endurecer los límites.
Comprobación rápida
Compruebe sus conocimientos sobre escalabilidad.
Repaso
Ha aprendido a proteger un backend de IA mediante limitación de solicitudes (depósito de tokens, límites por usuario y globales), devolver respuestas 429, descargar el trabajo lento en una cola de trabajos, aplicar contrapresión y límites de concurrencia, reintentar con retroceso y supervisar el estado de la cola.
Preguntas frecuentes
¿La lección «Limitación y puesta en cola de solicitudes de IA» es gratis?
Sí — el texto completo de «Limitación y puesta en cola de solicitudes de IA» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI SaaS Builder, actualiza a CoddyKit PRO. El curso de AI SaaS Builder incluye 4 lecciones en total.
¿Qué aprenderé en «Limitación y puesta en cola de solicitudes de IA»?
Aprenda a proteger el backend de su SaaS de IA frente a la sobrecarga y los costes descontrolados mediante limitación de solicitudes, colas de peticiones y backpressure controlado. Practicas AI SaaS Builder con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar AI SaaS Builder?
No se requiere experiencia previa. AI SaaS Builder en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.
¿Cuánto tiempo toma la lección «Limitación y puesta en cola de solicitudes de IA»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de AI SaaS Builder?
Sí. Cada lección de AI SaaS Builder incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Diseño de API RESTful
- Gestión de bases de datos para SaaS
- Autenticación y autorización de usuarios
- Limitación y puesta en cola de solicitudes de IA