0Pricing
AI Prompt Engineering · Pelajaran

Hibrida: Prompt + Penyetelan Ringan

Menggabungkan kedua pendekatan.

Hibrida: Prompt + Penyetelan Ringan adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.

Pola Pikir Hibrida

Pemberian instruksi dan penyetelan bukanlah dua pihak yang bersaing—keduanya adalah lapisan. Pola yang digunakan oleh pakar adalah model yang disetel secara ringan untuk menangani perilaku stabil yang telah dipelajari, lalu dibungkus dengan instruksi tipis yang menyediakan konteks yang berubah-ubah untuk setiap permintaan.

  • Penyetelan menyerap hal yang stabil: format, suara, pembingkaian tugas
  • Pemberian instruksi menyediakan hal yang berubah-ubah: arahan, fakta yang diambil, status pengguna
  • Setiap lapisan melakukan hal yang paling dikuasainya; tidak ada yang memikul seluruh beban

Dekomposisi Stabil vs Volatil

Keterampilan inti hybrid adalah membagi perilaku berdasarkan sumbu stabil/volatil. Apa pun yang identik di setiap panggilan dan mahal jika terus diulang dalam prompt merupakan kandidat untuk tuning. Apa pun yang berubah di setiap panggilan harus tetap berada dalam prompt.

Jika pembagian ini keliru ke arah mana pun, Anda akan rugi: masukkan konten volatil ke dalam bobot, dan Anda harus melakukan tuning ulang untuk mengubahnya; pertahankan konten stabil dalam prompt, dan Anda akan terus membayar pajak tokennya.

# Classify each behavior element before deciding where it lives
def placement(element):
    # element: dict with 'changes_per_call' and 'repeated_every_call'
    if element['changes_per_call']:
        return 'PROMPT'        # volatile -> must stay dynamic
    if element['repeated_every_call']:
        return 'WEIGHTS'       # stable + repetitive -> distill into tuning
    return 'PROMPT'            # default to the flexible layer

print(placement({'changes_per_call': False, 'repeated_every_call': True}))
# WEIGHTS

Pola A: Distilasi Prompt

Inilah pola hybrid yang paling bernilai. Anda mengembangkan prompt yang panjang dan berkualitas tinggi, menggunakannya untuk menghasilkan penyelesaian acuan, lalu melakukan tuning model berdasarkan penyelesaian tersebut dengan prompt singkat.

Hasilnya: model berperilaku seolah-olah masih memiliki prompt yang panjang, tetapi Anda hanya perlu mengirim sebagian kecil token. Prompt yang mahal menjadi pengajar; prompt yang murah menjadi antarmuka saat runtime. Latensi, biaya, dan konsistensi semuanya meningkat sekaligus.

# Build distillation set: long prompt -> output, store with SHORT prompt
def distill_example(input_x, long_prompt, teacher):
    full = long_prompt + '\n\n' + input_x
    gold = teacher(full)                 # quality from the long prompt
    short = 'Task: process the input.\n' + input_x  # runtime prompt
    return {'messages': [
        {'role': 'user', 'content': short},
        {'role': 'assistant', 'content': gold},
    ]}

Pola B: Tuning untuk Bentuk, Prompt untuk Konten

Lakukan tuning model agar selalu menghasilkan bentuk yang tepat—skema ketat, gaya bahasa internal, atau DSL domain—dan biarkan prompt membawa substansi untuk setiap permintaan.

Ini ideal ketika kepatuhan format harus nyaris sempurna dan aturannya terlalu banyak untuk dicantumkan satu per satu, tetapi konten sebenarnya sepenuhnya dinamis. Model yang telah di-tuning berhenti menentang Anda dalam hal struktur, sehingga token prompt dapat digunakan untuk instruksi dan konteks hasil pencarian.

Pola C: Router yang Di-tuning + Pakar Berbasis Prompt

Dalam sistem multi-langkah, lakukan tuning pada model kecil yang cepat untuk keputusan yang sempit dan bervolume tinggi (klasifikasi, perutean, ekstraksi), dan gunakan model besar berbasis prompt untuk langkah-langkah penalaran terbuka.

Anda mendapatkan biaya dan latensi model kecil yang telah di-tuning saat tugasnya sempit, serta fleksibilitas prompting saat tugasnya luas. Router bersifat stabil dan telah di-tuning; model-model pakar tetap dapat diarahkan melalui prompt seiring berkembangnya persyaratan.

def pipeline(user_input, router_tuned, expert_prompted):
    route = router_tuned(user_input)        # cheap, fast, learned
    if route == 'simple':
        return router_tuned(user_input)     # small model handles it
    # complex -> hand to large prompted model with full instructions
    return expert_prompted(
        'Detailed instructions...\n' + user_input
    )

Pertahankan RAG di Lapisan Prompt

Bahkan dengan model yang telah di-tuning, pengetahuan tetap diperoleh melalui pencarian, bukan dilatih. Model hybrid mempelajari cara menggunakan konteks; prompt menyediakan konteks yang mana untuk permintaan ini.

Inilah alasan sistem hybrid tetap relevan dalam jangka panjang: perilaku dasar dibekukan dalam bobot, tetapi fakta diperbarui pada setiap panggilan melalui pencarian. Anda jarang melakukan tuning ulang (perilaku), tetapi terus memperbarui pengetahuan tanpa biaya pelatihan.

Tuning Ringan: LoRA dan Adaptor

Hybrid mengutamakan tuning ringan. Adaptor bergaya LoRA melatih sekumpulan kecil parameter tambahan, sementara model dasar tetap dibekukan. Adaptor ini murah, cepat diiterasi, dan dapat ditumpuk.

  • Latih beberapa adaptor untuk tugas berbeda pada satu model dasar
  • Tukar adaptor saat penyajian tanpa memuat ulang model dasar
  • Latih ulang adaptor dalam hitungan jam, bukan hari, ketika perilaku berubah

Dengan demikian, hybrid tetap mendekati kecepatan iterasi prompting sekaligus memperoleh manfaat konsistensi dari tuning.

Menghindari Spesifikasi Ganda

Bug hybrid klasik: model di-tuning untuk melakukan X dan prompt masih menginstruksikan X. Token prompt yang redundan menggagalkan tujuan distilasi dan bahkan dapat bertentangan dengan perilaku yang telah dipelajari.

Setelah tuning, pangkas prompt secara agresif dari segala sesuatu yang kini telah tertanam dalam bobot. Jalankan kembali evaluasi setelah pemangkasan untuk memastikan perilaku hasil tuning tetap bertahan tanpa instruksi yang redundan.

# After tuning, prune prompt lines that the model now does on its own
def trim_prompt(prompt_lines, behaviors_in_weights):
    return [ln for ln in prompt_lines
            if not any(b in ln for b in behaviors_in_weights)]

kept = trim_prompt(
    ['Use JSON schema', 'Write in formal tone', 'Answer the question'],
    behaviors_in_weights=['JSON schema', 'formal tone'])
print(kept)  # ['Answer the question']  -- only the volatile part remains

Membuat Versi Kedua Lapisan Secara Bersamaan

Hybrid memiliki dua artefak yang saling terkait: versi adaptor dan versi templat prompt. Keduanya harus dibuat versinya dan diterapkan sebagai pasangan—prompt yang ditulis untuk adaptor v3 mungkin berperilaku keliru pada adaptor v4.

Tetapkan pasangan tersebut dalam konfigurasi, jalankan evaluasi terhadap pasangan persis yang akan Anda kirimkan, dan lakukan pengembalian pasangan secara bersamaan. Memperlakukan keduanya secara terpisah merupakan sumber paling umum dari regresi hybrid yang tidak terlihat.

Frekuensi Tuning Ulang

Karena perilaku volatil berada dalam prompt, hybrid yang dibangun dengan baik hanya perlu melakukan tuning ulang sesekali—terutama ketika model dasar tidak lagi digunakan atau ketika perilaku stabil benar-benar berubah. Perubahan sehari-hari terjadi di lapisan prompt tanpa biaya pelatihan.

Jika Anda sering melakukan tuning ulang, berarti pembagian stabil/volatil Anda keliru: konten volatil telah merembes ke dalam bobot. Pindahkan kembali konten tersebut ke prompt.

Gambaran Hybrid dari Awal hingga Akhir

Alur lengkapnya: ambil konteks melalui pencarian, susun prompt singkat menggunakan adaptor yang telah di-tuning, lalu biarkan bobot menyediakan bentuk yang telah dipelajari. Pengetahuan dan instruksi tetap dinamis; struktur dan gaya bahasa tertanam di dalam model.

def hybrid_call(user_q, retriever, tuned_model, adapter_version):
    docs = retriever.search(user_q, k=4)          # volatile knowledge
    ctx = '\n'.join(d.text for d in docs)
    short_prompt = (
        'Answer from context.\n'                  # form is in weights
        '<context>' + ctx + '</context>\n'
        '<q>' + user_q + '</q>'
    )
    return tuned_model.generate(short_prompt, adapter=adapter_version)

Pemeriksaan Singkat

Anda mendistilasi prompt panjang menjadi adaptor LoRA sehingga model kini selalu menghasilkan skema JSON ketat dan gaya bahasa internal Anda. Apa yang seharusnya terjadi pada prompt saat runtime?

Ringkasan

Hybrid = di-tuning untuk perilaku stabil, menggunakan prompt untuk konteks volatil. Bagi perilaku berdasarkan sumbu stabil/volatil, lalu biarkan setiap lapisan melakukan hal yang paling dikuasainya.

  • Distilasi prompt: prompt panjang mengajar, prompt singkat melayani
  • Lakukan tuning untuk bentuk, gunakan prompt untuk konten; router yang di-tuning dengan model pakar berbasis prompt
  • Pertahankan pengetahuan dalam pencarian agar hybrid tetap relevan dalam jangka panjang
  • Utamakan adaptor ringan bergaya LoRA untuk kecepatan iterasi
  • Pangkas instruksi yang dispesifikasikan ganda dan buat versi adaptor + prompt sebagai pasangan
  • Tuning ulang yang sering berarti konten volatil telah merembes ke dalam bobot—pindahkan kembali ke prompt

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Hibrida: Prompt + Penyetelan Ringan” gratis?

Ya — teks lengkap “Hibrida: Prompt + Penyetelan Ringan” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Hibrida: Prompt + Penyetelan Ringan”?

Menggabungkan kedua pendekatan. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?

Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Hibrida: Prompt + Penyetelan Ringan” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?

Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Kapan Pemberian Prompt Sudah Cukup
  2. Kapan Harus Melakukan Fine-Tuning
  3. Hibrida: Prompt + Penyetelan Ringan
  4. Mengevaluasi Keputusan
← Kembali ke AI Prompt Engineering