0Pricing
AI Prompt Engineering · Lección

Qué son las barreras de seguridad

Barreras de seguridad y calidad.

Qué son las barreras de seguridad es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.

Definición de los guardrails

Los guardrails son comprobaciones programáticas que rodean a un LLM para aplicar seguridad, políticas y calidad. Se ejecutan en la entrada (la entrada del usuario) y en la salida (la salida del modelo), y controlan qué llega al modelo y qué llega al usuario.

El modelo es probabilístico; los guardrails son una aplicación determinista de políticas superpuesta al modelo.

Por qué no basta con prompting

Las instrucciones del prompt del sistema, como 'no revele nunca secretos', son blandas: los jailbreaks pueden anularlas, pueden perder fuerza en contextos largos o ignorarse ante un cambio de distribución. Los guardrails son estrictos porque son código externo al modelo con el que no se puede negociar.

Defensa en profundidad: indique al modelo qué debe hacer y rodéelo de comprobaciones independientes.

Guardrails de entrada y de salida

Dos ubicaciones con funciones diferentes:

  • Los guardrails de entrada bloquean la inyección de prompts, las solicitudes no permitidas y la PII antes de que los tokens generen costes.
  • Los guardrails de salida detectan contenido inseguro, datos filtrados, alucinaciones e incumplimientos del esquema antes de la entrega.

Las comprobaciones de entrada ahorran costes; las de salida protegen a los usuarios.

Bloquear, redactar, regenerar y escalar

Un guardrail debe decidir qué acción tomar cuando se activa:

  • Bloquear — rechazar la solicitud y devolver un mensaje seguro.
  • Redactar — eliminar el fragmento problemático y continuar.
  • Regenerar — volver a solicitar la respuesta indicando la infracción.
  • Escalar — derivar el caso a una persona o a un modelo más estricto.

La acción adecuada depende de la gravedad y de la confianza del usuario.

def on_violation(severity):
    if severity == 'critical': return 'block'
    if severity == 'pii': return 'redact'
    if severity == 'quality': return 'regenerate'
    return 'escalate'

La canalización de guardrails

Componga los guardrails como una canalización ordenada y falle rápidamente ante la primera infracción grave.

def guarded_generate(user_input):
    for g in INPUT_GUARDS:
        verdict = g.check(user_input)
        if verdict.block:
            return safe_refusal(verdict)
    output = call_model(user_input)
    for g in OUTPUT_GUARDS:
        verdict = g.check(output)
        if verdict.block:
            return verdict.handle(output)
    return output

Guardrails deterministas frente a guardrails basados en modelos

Dos estilos de implementación:

  • Deterministas — expresiones regulares, esquemas, listas de permitidos o denegados y clasificadores con umbrales fijos. Son rápidos, económicos y auditables.
  • Basados en modelos — un modelo de moderación o un LLM evaluador analiza políticas matizadas. Son flexibles, pero más lentos y falibles.

Use guardrails deterministas para reglas estrictas y guardrails basados en modelos para decisiones que requieren criterio.

Presupuestos de latencia y costes

Cada guardrail añade latencia. Estrategias para mantener la rapidez:

  • Ejecute los guardrails de salida independientes en paralelo.
  • Ordene las comprobaciones deterministas económicas antes que las comprobaciones costosas basadas en modelos.
  • Interrumpa el procesamiento ante el primer bloqueo grave.
  • Transmita la salida, pero retenga la entrega hasta que se superen los guardrails críticos.
verdicts = await asyncio.gather(*[g.check(out) for g in OUTPUT_GUARDS])
if any(v.block for v in verdicts):
    return handle(verdicts)

Los falsos positivos tienen un coste real

Los guardrails demasiado agresivos bloquean solicitudes legítimas y frustran a los usuarios (el mensaje 'No puedo ayudarle con eso' ante consultas inofensivas). Ajuste los umbrales con un conjunto etiquetado y realice un seguimiento de la tasa de falsos positivos como una métrica fundamental, no solo de la exhaustividad frente a los ataques.

La transmisión complica los guardrails de salida

Si transmite los tokens al usuario, una infracción detectada tarde puede haber aparecido ya en pantalla. Algunas opciones:

  • Almacenar la respuesta completa, aplicar los guardrails y después liberarla (es lo más seguro, pero aumenta la latencia).
  • Aplicar los guardrails en los límites de las oraciones durante la transmisión.
  • Transmitir de forma optimista, pero retirar o sustituir la salida si se detecta una infracción.

Elija según el daño que podría causar la filtración de una salida parcial.

Auditabilidad y registro

Los guardrails son evidencias de cumplimiento. Registre cada veredicto con el hash de entrada, el identificador del guardrail, la gravedad y la acción tomada, teniendo cuidado de no registrar el contenido sensible. Este registro demuestra la aplicación de las políticas durante las auditorías y permite realizar ajustes.

audit.log({'guard': g.id, 'verdict': verdict.label,
           'action': verdict.action, 'input_hash': sha256(inp)})

Los guardrails no sustituyen al diseño

Los guardrails reducen el riesgo, pero no lo eliminan. Un modelo sin acceso a un secreto no puede filtrarlo. Dé prioridad a los controles arquitectónicos (mínimo privilegio, herramientas con alcance limitado y ausencia de datos sensibles en el contexto) y use los guardrails como última capa, no como única defensa.

Comprobación rápida

¿Qué ubicación de un guardrail reduce principalmente el gasto de tokens en solicitudes no permitidas?

Repaso

Fundamentos de los guardrails:

  • Políticas deterministas superpuestas a un modelo probabilístico.
  • Los guardrails de entrada ahorran costes; los de salida protegen a los usuarios.
  • Acciones: bloquear, redactar, regenerar y escalar.
  • Combine comprobaciones deterministas y basadas en modelos, y ejecútelas en paralelo.
  • Realice un seguimiento de los falsos positivos, registre los veredictos y dé prioridad a la arquitectura frente a los parches.

A continuación: filtrado de entradas y salidas en profundidad.

Preguntas frecuentes

¿La lección «Qué son las barreras de seguridad» es gratis?

Sí — el texto completo de «Qué son las barreras de seguridad» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué aprenderé en «Qué son las barreras de seguridad»?

Barreras de seguridad y calidad. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Prompt Engineering?

No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.

¿Cuánto tiempo toma la lección «Qué son las barreras de seguridad»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?

Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Qué son las barreras de seguridad
  2. Filtrado de entradas y salidas
  3. Validadores de schemas y reglas
  4. Validación mediante autocrítica
← Volver a AI Prompt Engineering