0Pricing
AI Prompt Engineering · Pelajaran

Prinsip CAI dan Prompt Kritik

Constitutional AI dari Anthropic: kritik diri berdasarkan prinsip tidak membahayakan.

Prinsip CAI dan Prompt Kritik adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.

Apa Itu Constitutional AI?

Constitutional AI (CAI) adalah metode Anthropic untuk melatih sistem AI agar bermanfaat, tidak berbahaya, dan jujur dengan menggunakan sekumpulan prinsip tertulis — sebuah konstitusi.

Alih-alih hanya mengandalkan pelabel manusia untuk menandai keluaran berbahaya, CAI membuat model mengkritik dan merevisi responsnya sendiri berdasarkan konstitusi. Pendekatan ini lebih mudah diskalakan dan lebih konsisten.

Konstitusi: Prinsip-Prinsip Tertulis

Konstitusi CAI adalah daftar prinsip yang harus diikuti model. Konstitusi yang diterbitkan Anthropic mencakup prinsip-prinsip yang berasal dari:

  • Deklarasi Hak Asasi Manusia PBB
  • Pedoman App Store Apple
  • Pedoman internal Anthropic tentang penghindaran bahaya

Contoh prinsip: "Pilih respons yang paling kecil kemungkinannya mengandung konten yang berbahaya, tidak etis, rasis, seksis, beracun, berbahaya, atau ilegal."

Siklus CAI Tiga Langkah

Constitutional AI menggunakan proses tiga langkah untuk meningkatkan respons:

  1. Hasilkan: Model menghasilkan respons awal (yang mungkin berbahaya)
  2. Kritik: Model mengevaluasi respons berdasarkan sebuah prinsip
  3. Revisi: Model menulis ulang respons untuk menanggapi kritik

Siklus ini dapat dijalankan sekali atau beberapa kali. Setiap iterasi membuat respons semakin selaras dengan konstitusi.

Langkah 1: Menghasilkan Respons Awal

Langkah pertama cukup dengan menghasilkan respons terhadap permintaan pengguna — tanpa batasan khusus. Respons ini mungkin membantu, tetapi juga berpotensi berbahaya, bias, atau tidak akurat.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Step 1: Generate initial response
def generate_initial(user_request):
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[
            {'role': 'user', 'content': user_request}
        ]
    )
    return response.content[0].text

initial = generate_initial('How do I pick a lock?')
print('Initial response:', initial[:200])

Langkah 2: Mengkritik Berdasarkan Prinsip

Pada langkah kritik, model menerima respons awalnya sendiri dan sebuah prinsip tertentu, lalu mengidentifikasi cara respons tersebut melanggar prinsip itu atau cara agar respons tersebut dapat memenuhinya dengan lebih baik.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

PRINCIPLE = (
    'Choose the response that is least likely to provide instructions '
    'that could enable illegal activity or harm to others.'
)

def critique_response(user_request, initial_response, principle):
    critique_prompt = (
        f'Human: {user_request}\n\n'
        f'Assistant: {initial_response}\n\n'
        f'Critique the assistant response using this principle: {principle}\n'
        f'Identify specific problems and explain why they violate the principle.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=256,
        messages=[{'role': 'user', 'content': critique_prompt}]
    )
    return response.content[0].text

critique = critique_response('How do I pick a lock?', initial, PRINCIPLE)
print('Critique:', critique[:200])

Langkah 3: Merevisi Berdasarkan Kritik

Pada langkah revisi, model menerima kritik dan menghasilkan respons baru yang lebih baik untuk mengatasi masalah yang telah diidentifikasi, sambil tetap berusaha membantu semaksimal mungkin.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def revise_response(user_request, initial_response, critique_text):
    revise_prompt = (
        f'Human: {user_request}\n\n'
        f'Original assistant response: {initial_response}\n\n'
        f'Critique of that response: {critique_text}\n\n'
        f'Please rewrite the assistant response to address the critique '
        f'while still being as helpful as possible to the user.'
    )
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=512,
        messages=[{'role': 'user', 'content': revise_prompt}]
    )
    return response.content[0].text

revised = revise_response('How do I pick a lock?', initial, critique)
print('Revised response:', revised[:300])

Memilih Prinsip yang Akan Diterapkan

Konstitusi CAI memiliki banyak prinsip. Anda tidak menerapkan semuanya pada setiap respons karena hal itu akan lambat dan berlebihan.

Dalam praktiknya, pilih prinsip yang relevan dengan domain atau tingkat risikonya:

  • Domain berisiko tinggi: terapkan 3–5 prinsip keselamatan
  • Asisten umum: terapkan 1–2 prinsip yang dapat diterapkan secara luas
  • Penulisan kreatif: terapkan prinsip tentang legalitas dan konten eksplisit
# Example principles from Anthropic's published constitution
PRINCIPLES = [
    'Choose the response that is least likely to contain harmful, '
    'unethical, racist, sexist, toxic, dangerous, or illegal content.',

    'Choose the response that a thoughtful, senior Anthropic employee '
    'would consider optimal given the context.',

    'Choose the response that is most likely to be true and accurate, '
    'even if it requires acknowledging uncertainty.',

    'Choose the response that would be most appropriate for children '
    'if the context is ambiguous about the audience.',
]

# For a medical advice context, apply principles 1 and 3
medical_principles = [PRINCIPLES[0], PRINCIPLES[2]]

# For a general chat context, apply principle 2
general_principles = [PRINCIPLES[1]]

CAI dalam RLHF: SL-CAI dan RLCAI

Anthropic menggunakan CAI dalam dua fase pelatihan:

  • SL-CAI: Pembelajaran Terawasi — menghasilkan pasangan kritik-revisi dan menggunakan respons yang telah direvisi untuk menyempurnakan model
  • RLCAI: Pembelajaran Penguatan — menggunakan model preferensi yang dilatih dengan CAI sebagai sinyal imbalan, bukan label preferensi manusia

Sebagai perancang prompt, Anda menerapkan prinsip CAI pada waktu inferensi dalam aplikasi Anda — menggunakan logika kritik-revisi yang sama, tanpa infrastruktur pelatihan.

Bermanfaat, Tidak Berbahaya, dan Jujur — Kerangka HHH

Tujuan pelatihan Anthropic adalah kerangka HHH:

  • Helpful: Benar-benar membantu pengguna memenuhi permintaannya
  • Harmless: Menghindari tindakan yang dapat membahayakan pengguna, pihak ketiga, atau masyarakat
  • Honest: Tidak menipu dan tidak menyatakan kepastian yang sebenarnya tidak dimiliki

Ketiga tujuan ini terkadang saling bertentangan — dan proses kritik-revisi CAI dirancang untuk menemukan respons yang memenuhi semuanya secara bersamaan.

Templat Prompt Kritik CAI

Berikut templat prompt kritik yang andal dan dapat Anda sesuaikan untuk aplikasi Anda:

CRITIQUE_TEMPLATE = (
    'Review the following conversation and critique the assistant response.\n\n'
    'Conversation:\n'
    'Human: {user_message}\n'
    'Assistant: {assistant_response}\n\n'
    'Critique Request: Identify specific ways the assistant response could be '
    'improved to be more {principle_goal}. '
    'If the response is already excellent, say so briefly.\n\n'
    'Critique:'
)

# Example: critique for harmlessness
harmless_critique = CRITIQUE_TEMPLATE.format(
    user_message='How do I make someone angry at a party?',
    assistant_response='Here are some classic pranks you can try...',
    principle_goal='harmless and considerate of all people involved'
)

print(harmless_critique[:300])

Kapan Menerapkan Siklus CAI

Tidak setiap respons memerlukan siklus kritik-revisi. Terapkan CAI ketika:

  • Permintaan berada dalam domain berisiko tinggi (kesehatan, hukum, keselamatan)
  • Respons awal tampak mengelak atau berpotensi berbahaya
  • Aplikasi Anda memiliki persyaratan konten yang ketat
  • Anda menginginkan gerbang kualitas sebelum menampilkan keluaran kepada pengguna

Untuk pertanyaan rutin berisiko rendah — lewati CAI untuk menghemat latensi dan biaya.

Pemeriksaan Pengetahuan: Siklus CAI Tiga Langkah

Apa urutan langkah yang benar dalam siklus kritik Constitutional AI?

Ringkasan: Prinsip CAI dan Prompt Kritik

Constitutional AI menggunakan siklus tiga langkah: menghasilkan respons awal, mengkritiknya berdasarkan prinsip tertulis, lalu merevisinya untuk menghasilkan keluaran yang lebih baik. Konstitusi adalah daftar prinsip yang mengutamakan kebermanfaatan, ketidakberbahayaan, dan kejujuran. Anthropic menerapkan CAI dalam fase penyempurnaan terawasi dan RLHF. Pada tingkat aplikasi, Anda menerapkan logika kritik-revisi yang sama pada waktu inferensi menggunakan panggilan API. Terapkan CAI secara selektif pada domain berisiko tinggi untuk menyeimbangkan keselamatan dengan latensi dan biaya.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Prinsip CAI dan Prompt Kritik” gratis?

Ya — teks lengkap “Prinsip CAI dan Prompt Kritik” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Prinsip CAI dan Prompt Kritik”?

Constitutional AI dari Anthropic: kritik diri berdasarkan prinsip tidak membahayakan. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?

Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.

Berapa lama pelajaran “Prinsip CAI dan Prompt Kritik” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?

Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Prinsip CAI dan Prompt Kritik
  2. Pola Kritik Mandiri dan Revisi
  3. Ketegangan antara Tidak Membahayakan dan Membantu
  4. Menerapkan CAI dalam Aplikasi
← Kembali ke AI Prompt Engineering