O que são barreiras de proteção
Barreiras de segurança e qualidade.
O que são barreiras de proteção é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 4 aulas no total.
Definição de barreiras de proteção
Barreiras de proteção são verificações programáticas que envolvem um LLM para impor segurança, políticas e qualidade. Elas atuam na entrada (entrada do usuário) e na saída (saída do modelo), controlando o que chega ao modelo e o que chega ao usuário.
O modelo é probabilístico; as barreiras de proteção são a aplicação determinística de políticas em uma camada superior.
Por que apenas as instruções não são suficientes
Instruções no prompt do sistema, como 'nunca revele segredos', são flexíveis: podem ser anuladas por ataques de contorno, perder força em contextos longos ou ser ignoradas diante de uma mudança de distribuição. As barreiras de proteção são rígidas porque são código externo ao modelo, com o qual não é possível negociar.
Defesa em profundidade: instrua o modelo e envolva-o em verificações independentes.
Barreiras de proteção de entrada e saída
Duas posições, com funções diferentes:
- Entrada: as barreiras de proteção bloqueiam injeções de instruções, solicitações não permitidas e PII antes que os tokens gerem custos.
- Saída: as barreiras de proteção detectam conteúdo inseguro, dados vazados, alucinações e violações do esquema antes da entrega.
As verificações de entrada economizam custos; as verificações de saída protegem os usuários.
Bloquear, Redact, regenerar, encaminhar
Uma barreira de proteção deve decidir o que fazer quando é acionada:
- Bloquear — recusar e retornar uma mensagem segura.
- Redact — remover o trecho problemático e continuar.
- Regenerar — solicitar novamente, informando a violação.
- Encaminhar — direcionar para uma pessoa ou para um modelo mais rigoroso.
A ação correta depende da gravidade e da confiança do usuário.
def on_violation(severity):
if severity == 'critical': return 'block'
if severity == 'pii': return 'redact'
if severity == 'quality': return 'regenerate'
return 'escalate'O fluxo das barreiras de proteção
Componha as barreiras de proteção em um fluxo ordenado; interrompa imediatamente na primeira violação grave.
def guarded_generate(user_input):
for g in INPUT_GUARDS:
verdict = g.check(user_input)
if verdict.block:
return safe_refusal(verdict)
output = call_model(user_input)
for g in OUTPUT_GUARDS:
verdict = g.check(output)
if verdict.block:
return verdict.handle(output)
return outputBarreiras determinísticas e baseadas em modelo
Há dois estilos de implementação:
- Determinístico — expressões regulares, esquemas, listas de permissões ou bloqueios e classificadores com limites fixos. Rápido, barato e auditável.
- Baseado em modelo — um modelo de moderação ou um LLM avaliador analisa políticas sutis. Flexível, mas mais lento e também sujeito a falhas.
Use barreiras determinísticas para regras rígidas e barreiras baseadas em modelo para decisões que exigem julgamento.
Orçamentos de latência e custo
Cada barreira de proteção acrescenta latência. Estratégias para manter a velocidade:
- Execute barreiras de saída independentes em paralelo.
- Ordene as verificações determinísticas baratas antes das verificações caras baseadas em modelo.
- Interrompa na primeira decisão de bloqueio grave.
- Transmita a saída, mas retenha a entrega até que as barreiras essenciais sejam aprovadas.
verdicts = await asyncio.gather(*[g.check(out) for g in OUTPUT_GUARDS])
if any(v.block for v in verdicts):
return handle(verdicts)Falsos positivos têm um custo real
Barreiras de proteção agressivas demais bloqueiam solicitações legítimas e frustram os usuários (o 'não posso ajudar com isso' diante de consultas inofensivas). Ajuste os limites usando um conjunto rotulado e acompanhe a taxa de falsos positivos como uma métrica essencial, não apenas a revocação em ataques.
A transmissão contínua complica as barreiras de saída
Se você transmite tokens ao usuário, uma violação detectada tarde pode já estar na tela. Opções:
- Armazene tudo, faça as verificações e depois libere (mais seguro, com maior latência).
- Faça a verificação nos limites das frases durante a transmissão.
- Transmita de forma otimista, mas retire ou substitua o conteúdo quando houver uma violação.
Escolha com base no quanto uma saída parcial vazada seria prejudicial.
Auditabilidade e registro de eventos
As barreiras de proteção são registros de conformidade. Registre cada decisão com o resumo criptográfico da entrada, o identificador da barreira, a gravidade e a ação realizada, tendo o cuidado de não registrar o conteúdo sensível em si. Esse registro comprova a aplicação das políticas durante auditorias e orienta os ajustes.
audit.log({'guard': g.id, 'verdict': verdict.label,
'action': verdict.action, 'input_hash': sha256(inp)})Barreiras de proteção não substituem o design
As barreiras de proteção reduzem o risco, mas não o eliminam. Um modelo sem acesso a um segredo não pode vazá-lo. Dê preferência a controles arquiteturais (privilégio mínimo, ferramentas com escopo definido e nenhum dado sensível no contexto) e use barreiras de proteção como última camada, não como a única.
Verificação rápida
Qual posição de uma barreira de proteção reduz principalmente o gasto de tokens com solicitações não permitidas?
Recapitulação
Fundamentos das barreiras de proteção:
- Política determinística aplicada ao redor de um modelo probabilístico.
- As barreiras de entrada economizam custos; as barreiras de saída protegem os usuários.
- Ações: bloquear, Redact, regenerar e encaminhar.
- Combine verificações determinísticas e baseadas em modelo; execute-as em paralelo.
- Acompanhe os falsos positivos, registre as decisões e dê preferência à arquitetura em vez de correções pontuais.
A seguir: filtragem de entrada e saída em profundidade.
Aprenda AI Prompt Engineering com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 53
- Aulas
- 199
Perguntas Frequentes
A aula “O que são barreiras de proteção” é grátis?
Sim — o texto completo de “O que são barreiras de proteção” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 4 aulas no total.
O que vou aprender em “O que são barreiras de proteção”?
Barreiras de segurança e qualidade. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Prompt Engineering?
Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “O que são barreiras de proteção”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Prompt Engineering?
Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- O que são barreiras de proteção
- Filtragem de entrada e saída
- Validadores de esquemas e regras
- Validação por autocrítica