Ketegangan antara Tidak Membahayakan dan Membantu
Atasi penolakan berlebihan dengan prompt yang menyeimbangkan keamanan dan kegunaan.
Ketegangan antara Tidak Membahayakan dan Membantu adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Ketegangan Utama
Setiap sistem keamanan AI menghadapi ketegangan mendasar: menjadikan model lebih aman dengan lebih sering menolak juga membuatnya kurang membantu bagi pengguna yang memiliki kebutuhan sah.
Model yang menolak membahas apa pun tentang medis memang tidak akan pernah memberikan saran kesehatan yang berbahaya—tetapi model tersebut juga tidak akan membantu perawat, dokter, atau pasien memperoleh informasi yang benar-benar berguna. Tujuannya adalah kalibrasi: menolak ketika memang seharusnya menolak, dan membantu ketika memang seharusnya membantu.
Penolakan Berlebihan: Masalah Sebenarnya
Penolakan berlebihan terjadi ketika model menolak menjawab permintaan yang tidak berbahaya karena secara sekilas tampak mirip dengan permintaan berbahaya. Contohnya:
- Menolak menjelaskan cara penyakit menyebar (terdengar berbahaya, padahal sebenarnya merupakan edukasi kesehatan masyarakat)
- Menolak menulis karakter penjahat (fiksi, bukan dukungan terhadap kejahatan)
- Menolak menjelaskan cara membuka kunci dengan alat khusus kepada peserta magang ahli kunci
Penolakan berlebihan bukan sekadar mengganggu—hal ini membuat model tidak dapat dipercaya dan mendorong pengguna beralih ke alternatif yang kurang aman.
Membuat Perintah untuk Penolakan yang Terkalibrasi
Perintah sistem dapat mengarahkan model untuk menghindari penolakan berlebihan dengan memperjelas konteks dan maksud. Berikan izin secara eksplisit kepada model untuk membahas topik penggunaan ganda ketika konteksnya sah.
CALIBRATED_SYSTEM_PROMPT = (
'You are a knowledgeable assistant for healthcare professionals.\n\n'
'Your users are nurses, doctors, and medical students. '
'When asked about medications, dosages, procedures, or medical conditions, '
'provide accurate, detailed information appropriate for trained professionals.\n\n'
'Do not add excessive safety disclaimers to every response. '
'Your users are professionals who need direct, accurate information to do their jobs. '
'If a question is genuinely outside appropriate bounds, explain specifically why '
'rather than giving a vague refusal.'
)
# This context dramatically improves calibration for the target audience
# Without it, the model may refuse routine clinical questionsPola "Jelaskan Alasannya, Jangan Sekadar Menolak"
Salah satu pola pemberian perintah yang paling efektif untuk mengurangi penolakan berlebihan adalah menginstruksikan model bahwa jika tidak dapat menjawab sepenuhnya, model harus menjelaskan hal yang dapat dan tidak dapat dilakukannya beserta alasannya, alih-alih memberikan penolakan begitu saja.
EXPLAIN_WHY_PROMPT = (
'You are a helpful assistant. When handling sensitive or ambiguous requests:\n\n'
'- If you can answer fully: do so directly.\n'
'- If you can answer partially: provide what you can and explain what you cannot include and why.\n'
'- If you truly cannot answer: explain specifically what boundary prevents you from answering, '
'and suggest where the user might get this information appropriately.\n\n'
'Do not give generic refusals like "I cannot help with that." '
'Always be specific about what you can and cannot do.'
)
# Example of bad refusal:
# 'I cannot help with information about medications.'
# Example of good calibrated response:
# 'I can explain how ibuprofen works and standard dosing guidelines for adults.
# For specific dosing for a patient with your described conditions, you should
# consult a pharmacist or prescribing physician who has the full clinical picture.'Menawarkan Alternatif yang Membantu
Ketika model harus menolak sebuah permintaan, hal paling membantu yang dapat dilakukannya adalah menawarkan jalur alternatif untuk memenuhi kebutuhan pengguna yang sebenarnya. Penolakan tanpa alternatif membuat pengguna tidak dapat melanjutkan.
ALTERNATIVES_PROMPT = (
'You are a helpful assistant. When you cannot fully fulfill a request:\n'
'1. Acknowledge the request with empathy.\n'
'2. Explain briefly and specifically what you can and cannot do.\n'
'3. Offer the closest helpful alternative you can provide.\n'
'4. Point to appropriate resources if relevant.\n\n'
'Example: If asked to prescribe medication:\n'
'Say: "I can explain how this class of medications works and what '
'symptoms they address. For a prescription, you need to see a licensed '
'physician who can evaluate your specific situation. Here is what I can '
'tell you about the medication itself: ..."'
)Konteks sebagai Variabel Kunci
Pertanyaan yang sama dapat berbahaya atau tidak berbahaya, bergantung pada konteksnya. Rekayasa perintah harus menetapkan konteks dengan jelas agar model dapat membuat keputusan kalibrasi yang lebih baik.
# Context that changes calibration:
# High-risk context: anonymous user, no context
# 'What's the lethal dose of acetaminophen?'
# -> Model should be cautious, mention poison control
# Safe context: established professional context
MEDICAL_PRO_CONTEXT = (
'You are assisting a team of emergency room nurses. '
'Users ask clinical questions during patient care shifts. '
'Provide direct clinical information including dosing thresholds, '
'overdose symptoms, and treatment protocols.'
)
# 'What is the hepatotoxic threshold for acetaminophen?'
# -> Model should give the clinical answer directly (150 mg/kg, etc.)
# The question is identical; the context changes the appropriate response
print('Context determines calibration')Model Mental 1000 Pengguna
Model mental yang berguna untuk kalibrasi: bayangkan 1000 pengguna berbeda mengirimkan pesan yang sama. Bagaimana distribusi maksud mereka?
- Jika 990/1000 memiliki maksud yang tidak berbahaya: model mungkin sebaiknya membantu
- Jika 500/1000 memiliki maksud berbahaya: model sebaiknya berhati-hati
- Jika 1/1000 dapat menyebabkan bahaya katastrofik: model harus menolak tanpa pengecualian
Pembingkaian probabilistik ini membantu menghindari penolakan berlebihan (memblokir 990 pengguna) sekaligus penolakan yang kurang (memungkinkan 10 pengguna melakukan tindakan berbahaya).
Menghindari Teater Keamanan
Teater keamanan mengacu pada langkah-langkah keamanan yang tampak berhati-hati tetapi sebenarnya tidak mencegah bahaya, sekaligus memperburuk produk bagi pengguna yang memiliki kebutuhan sah.
Contohnya: menambahkan penafian pada setiap resep ("konsultasikan dengan ahli gizi sebelum makan"). Menolak membahas kekejaman bersejarah dalam konteks pendidikan. Respons seperti ini tidak lebih aman—hanya tidak membantu.
# Avoid these patterns in your system prompts:
BAD_SYSTEM_PROMPT = (
'Always add disclaimers to every response. '
'Never discuss anything that could be dangerous. '
'Refuse requests that mention weapons, drugs, or violence in any context. '
'Always recommend consulting a professional for any question.'
# This creates safety theater: unhelpful disclaimers, over-refusal,
# and frustrated users who go elsewhere
)
GOOD_SYSTEM_PROMPT = (
'Provide accurate, helpful information to users. '
'Add safety information when it is directly relevant and actionable. '
'Refuse requests only when providing the information would cause '
'clear, concrete harm that outweighs the benefits to legitimate users. '
'When declining, always explain specifically why and offer alternatives.'
)Hambatan sebagai Mekanisme Keamanan
Alih-alih penolakan tegas, pertimbangkan hambatan: tambahkan langkah yang mempersulit penggunaan berbahaya, tetapi tetap membuat penggunaan yang tidak berbahaya berjalan lancar. Pendekatan ini lebih terkalibrasi daripada pilihan biner antara menolak dan mematuhi.
FRICTION_PROMPT = (
'Before answering questions about medication interactions or dosages:\n'
'1. Ask: "Can you tell me a bit about the context — are you a healthcare '
'provider, a patient, or a caregiver?"\n'
'2. Use the answer to calibrate the detail level and framing.\n'
'3. For patient/caregiver context: provide information with appropriate '
'guidance to consult a prescriber for their specific situation.\n'
'4. For healthcare provider context: provide clinical-level detail directly.\n\n'
'This one clarifying question improves both safety and helpfulness.'
)
# Friction: one extra step filters some misuse while barely inconveniencing
# legitimate users who can answer easilyUji Dua Surat Kabar
Uji Dua Surat Kabar adalah heuristik untuk mengkalibrasi penolakan:
- Surat Kabar A (reporter keamanan AI): Apakah respons ini akan diberitakan sebagai sesuatu yang berbahaya atau tidak bertanggung jawab?
- Surat Kabar B (reporter yang meliput sensasi berlebihan tentang AI): Apakah penolakan ini akan diberitakan sebagai sikap paternalistik, tidak membantu, atau konyol?
Respons yang terkalibrasi dengan baik lolos dari kedua uji tersebut: tidak diberitakan sebagai sesuatu yang berbahaya oleh A dan tidak diberitakan sebagai pembatasan yang tidak perlu oleh B.
Menguji Kalibrasi Anda
Ukur kalibrasi sistem Anda dengan membuat kumpulan uji yang mencakup:
- Permintaan yang tidak berbahaya dan seharusnya dijawab (edukatif, profesional, kreatif)
- Permintaan berbahaya yang seharusnya ditolak
Lacak tingkat positif palsu (menolak permintaan yang tidak berbahaya) dan tingkat negatif palsu (mengizinkan permintaan berbahaya). Sistem yang disetel dengan baik memiliki tingkat yang rendah untuk keduanya.
Pemeriksaan Pengetahuan: Penolakan Berlebihan
Apa pendekatan yang disarankan ketika model tidak dapat memenuhi permintaan sepenuhnya karena masalah keamanan?
Rangkuman: Ketegangan antara Tidak Berbahaya dan Membantu
Penolakan berlebihan adalah masalah nyata dan mahal: model yang terlalu mudah menolak akan mengecewakan pengguna yang memiliki kebutuhan sah dan mengikis kepercayaan. Penolakan yang terkalibrasi berarti menolak hanya ketika bahaya nyata jelas lebih besar daripada manfaat bagi kemungkinan besar pengguna. Pola utamanya: tetapkan konteks dalam perintah sistem untuk membantu model membuat keputusan yang lebih baik, gunakan instruksi "jelaskan alasannya, jangan sekadar menolak", selalu tawarkan alternatif yang membantu, dan hindari teater keamanan (penafian untuk segala hal). Model mental 1000 pengguna dan Uji Dua Surat Kabar merupakan heuristik praktis untuk menemukan keseimbangan yang tepat.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Ketegangan antara Tidak Membahayakan dan Membantu” gratis?
Ya — teks lengkap “Ketegangan antara Tidak Membahayakan dan Membantu” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Ketegangan antara Tidak Membahayakan dan Membantu”?
Atasi penolakan berlebihan dengan prompt yang menyeimbangkan keamanan dan kegunaan. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?
Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.
Berapa lama pelajaran “Ketegangan antara Tidak Membahayakan dan Membantu” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?
Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Prinsip CAI dan Prompt Kritik
- Pola Kritik Mandiri dan Revisi
- Ketegangan antara Tidak Membahayakan dan Membantu
- Menerapkan CAI dalam Aplikasi