AI Prompt Engineering · Aula

Tensão entre não causar danos e ser útil

Como lidar com recusas excessivas: prompts que equilibram segurança e utilidade.

Aula 3 de 413 etapas

Tensão entre não causar danos e ser útil é uma aula grátis de AI Prompt Engineering no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Prompt Engineering, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Prompt Engineering inclui 4 aulas no total.

A tensão fundamental

Todo sistema de segurança de IA enfrenta uma tensão fundamental: tornar um modelo mais seguro recusando com mais frequência também o torna menos útil para usuários legítimos.

Um modelo que se recusa a discutir qualquer assunto médico nunca dará orientações de saúde perigosas — mas também não ajudará enfermeiros, médicos ou pacientes com informações genuinamente úteis. A calibração é o objetivo: recusar quando necessário e ajudar quando necessário.

Recusa excessiva: o problema real

A recusa excessiva ocorre quando um modelo se recusa a responder a solicitações inofensivas porque elas se parecem superficialmente com solicitações prejudiciais. Exemplos:

  • Recusar-se a explicar como as doenças se espalham (parece perigoso, mas na verdade é educação em saúde pública)
  • Recusar-se a escrever um personagem vilão (ficção, não endosso)
  • Recusar-se a explicar como arrombar fechaduras para um aprendiz de chaveiro

A recusa excessiva não é apenas irritante — ela torna o modelo pouco confiável e leva os usuários a alternativas menos seguras.

Criando prompts para uma recusa calibrada

Os prompts do sistema podem instruir os modelos a evitar a recusa excessiva, esclarecendo o contexto e a intenção. Dê explicitamente permissão ao modelo para abordar temas de duplo uso quando o contexto for legítimo.

CALIBRATED_SYSTEM_PROMPT = (
    'You are a knowledgeable assistant for healthcare professionals.\n\n'
    'Your users are nurses, doctors, and medical students. '
    'When asked about medications, dosages, procedures, or medical conditions, '
    'provide accurate, detailed information appropriate for trained professionals.\n\n'
    'Do not add excessive safety disclaimers to every response. '
    'Your users are professionals who need direct, accurate information to do their jobs. '
    'If a question is genuinely outside appropriate bounds, explain specifically why '
    'rather than giving a vague refusal.'
)

# This context dramatically improves calibration for the target audience
# Without it, the model may refuse routine clinical questions

O padrão “explique o motivo em vez de recusar”

Um dos padrões de prompting mais eficazes para reduzir a recusa excessiva é instruir o modelo de que se não puder responder completamente, deverá explicar o que pode e o que não pode fazer e por quê — em vez de simplesmente recusar.

EXPLAIN_WHY_PROMPT = (
    'You are a helpful assistant. When handling sensitive or ambiguous requests:\n\n'
    '- If you can answer fully: do so directly.\n'
    '- If you can answer partially: provide what you can and explain what you cannot include and why.\n'
    '- If you truly cannot answer: explain specifically what boundary prevents you from answering, '
    'and suggest where the user might get this information appropriately.\n\n'
    'Do not give generic refusals like "I cannot help with that." '
    'Always be specific about what you can and cannot do.'
)

# Example of bad refusal:
# 'I cannot help with information about medications.'

# Example of good calibrated response:
# 'I can explain how ibuprofen works and standard dosing guidelines for adults.
#  For specific dosing for a patient with your described conditions, you should
#  consult a pharmacist or prescribing physician who has the full clinical picture.'

Oferecendo alternativas úteis

Quando um modelo precisa recusar uma solicitação, a atitude mais útil que pode ter é oferecer um caminho alternativo para atender ao que o usuário realmente precisa. Uma recusa sem alternativas deixa o usuário sem saída.

ALTERNATIVES_PROMPT = (
    'You are a helpful assistant. When you cannot fully fulfill a request:\n'
    '1. Acknowledge the request with empathy.\n'
    '2. Explain briefly and specifically what you can and cannot do.\n'
    '3. Offer the closest helpful alternative you can provide.\n'
    '4. Point to appropriate resources if relevant.\n\n'
    'Example: If asked to prescribe medication:\n'
    'Say: "I can explain how this class of medications works and what '
    'symptoms they address. For a prescription, you need to see a licensed '
    'physician who can evaluate your specific situation. Here is what I can '
    'tell you about the medication itself: ..."'
)

O contexto como variável principal

A mesma pergunta pode ser prejudicial ou inofensiva dependendo do contexto. A engenharia de prompts deve estabelecer o contexto com clareza para que o modelo possa tomar decisões de calibração melhores.

# Context that changes calibration:

# High-risk context: anonymous user, no context
# 'What's the lethal dose of acetaminophen?'
# -> Model should be cautious, mention poison control

# Safe context: established professional context
MEDICAL_PRO_CONTEXT = (
    'You are assisting a team of emergency room nurses. '
    'Users ask clinical questions during patient care shifts. '
    'Provide direct clinical information including dosing thresholds, '
    'overdose symptoms, and treatment protocols.'
)
# 'What is the hepatotoxic threshold for acetaminophen?'
# -> Model should give the clinical answer directly (150 mg/kg, etc.)

# The question is identical; the context changes the appropriate response
print('Context determines calibration')

O modelo mental dos 1000 usuários

Um modelo mental útil para a calibração: imagine 1000 usuários diferentes enviando a mesma mensagem. Qual é a distribuição das intenções?

  • Se 990/1000 tiverem intenção inofensiva: o modelo provavelmente deverá ajudar
  • Se 500/1000 tiverem intenção prejudicial: o modelo deverá ser cauteloso
  • Se 1/1000 puder causar danos catastróficos: o modelo deverá recusar de qualquer forma

Essa abordagem probabilística ajuda a evitar tanto a recusa excessiva (bloquear os 990) quanto a recusa insuficiente (viabilizar a ação dos 10).

Evitando o teatro da segurança

Teatro da segurança refere-se a medidas de segurança que parecem cautelosas, mas não evitam danos de fato — enquanto pioram o produto para usuários legítimos.

Exemplos: adicionar avisos a todas as receitas (“consulte um nutricionista antes de comer”). Recusar-se a discutir atrocidades históricas em um contexto educacional. Essas respostas não são mais seguras — são apenas inúteis.

# Avoid these patterns in your system prompts:

BAD_SYSTEM_PROMPT = (
    'Always add disclaimers to every response. '
    'Never discuss anything that could be dangerous. '
    'Refuse requests that mention weapons, drugs, or violence in any context. '
    'Always recommend consulting a professional for any question.'
    # This creates safety theater: unhelpful disclaimers, over-refusal,
    # and frustrated users who go elsewhere
)

GOOD_SYSTEM_PROMPT = (
    'Provide accurate, helpful information to users. '
    'Add safety information when it is directly relevant and actionable. '
    'Refuse requests only when providing the information would cause '
    'clear, concrete harm that outweighs the benefits to legitimate users. '
    'When declining, always explain specifically why and offer alternatives.'
)

O atrito como mecanismo de segurança

Em vez de recusas categóricas, considere o atrito: adicione uma etapa que dificulte usos prejudiciais, mantendo os usos inofensivos simples. Isso é mais calibrado do que recusar ou cumprir de forma binária.

FRICTION_PROMPT = (
    'Before answering questions about medication interactions or dosages:\n'
    '1. Ask: "Can you tell me a bit about the context — are you a healthcare '
    'provider, a patient, or a caregiver?"\n'
    '2. Use the answer to calibrate the detail level and framing.\n'
    '3. For patient/caregiver context: provide information with appropriate '
    'guidance to consult a prescriber for their specific situation.\n'
    '4. For healthcare provider context: provide clinical-level detail directly.\n\n'
    'This one clarifying question improves both safety and helpfulness.'
)
# Friction: one extra step filters some misuse while barely inconveniencing
# legitimate users who can answer easily

Teste dos dois jornais

O Teste dos dois jornais é uma heurística para calibrar recusas:

  • Jornal A (repórter de segurança de IA): esta resposta seria noticiada como prejudicial ou irresponsável?
  • Jornal B (repórter que denuncia o entusiasmo exagerado com IA): esta recusa seria noticiada como paternalista, inútil ou absurda?

Uma resposta bem calibrada passa nos dois testes: não é noticiada como prejudicial pelo jornal A nem como desnecessariamente restritiva pelo jornal B.

Testando sua calibração

Meça a calibração do seu sistema criando um conjunto de testes com:

  • Solicitações inofensivas que deveriam ser respondidas (educacionais, profissionais e criativas)
  • Solicitações prejudiciais que deveriam ser recusadas

Acompanhe a taxa de falsos positivos (recusar solicitações inofensivas) e a taxa de falsos negativos (permitir solicitações prejudiciais). Um sistema bem ajustado apresenta taxas baixas em ambos os casos.

Verificação de conhecimento: recusa excessiva

Qual é a abordagem recomendada quando um modelo não pode atender completamente a uma solicitação devido a preocupações de segurança?

Recapitulação: tensão entre inofensividade e utilidade

A recusa excessiva é um problema real e custoso: modelos que recusam com liberalidade demais falham com usuários legítimos e corroem a confiança. Recusa calibrada significa recusar apenas quando o dano concreto supera claramente o benefício para os usuários mais prováveis. Padrões fundamentais: estabeleça o contexto nos prompts do sistema para ajudar o modelo a tomar decisões melhores, use a instrução “explique o motivo em vez de recusar”, sempre ofereça alternativas úteis e evite o teatro da segurança (avisos para tudo). O modelo mental dos 1000 usuários e o Teste dos dois jornais são heurísticas práticas para encontrar o equilíbrio adequado.

Grátis para começar

Aprenda AI Prompt Engineering com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
53
Aulas
199

Perguntas Frequentes

A aula “Tensão entre não causar danos e ser útil” é grátis?

Sim — o texto completo de “Tensão entre não causar danos e ser útil” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Prompt Engineering, atualize para CoddyKit PRO. O curso de AI Prompt Engineering inclui 4 aulas no total.

O que vou aprender em “Tensão entre não causar danos e ser útil”?

Como lidar com recusas excessivas: prompts que equilibram segurança e utilidade. Você pratica AI Prompt Engineering com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Prompt Engineering?

Nenhuma experiência prévia é necessária. AI Prompt Engineering no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.

Quanto tempo leva a aula “Tensão entre não causar danos e ser útil”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Prompt Engineering?

Sim. Cada aula de AI Prompt Engineering inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Princípios do CAI e prompts de crítica
  2. Padrões de autocrítica e revisão
  3. Tensão entre não causar danos e ser útil
  4. Implementando CAI em aplicações
← Voltar para AI Prompt Engineering