0Pricing
MLOps Academy · Pelajaran

Buat Versi Prompt dan Evaluasi Output

Lacak perubahan prompt dan nilai respons.

Buat Versi Prompt dan Evaluasi Output adalah pelajaran MLOps Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar MLOps Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus MLOps Academy mencakup 4 pelajaran total.

Prompt Adalah Kode

Prompt yang dirumuskan ulang dapat mengubah perilaku dalam semalam. Karena itu, perlakukan setiap prompt sebagai artefak yang memiliki versi, lengkap dengan riwayat, peninjauan, dan kemampuan untuk mengembalikannya ke versi sebelumnya. 📝

Simpan Prompt, Bukan String

String yang ditulis langsung dan tersebar di dalam kode mustahil dilacak. Simpan prompt dalam registri atau file agar setiap perubahan terlihat dan dapat dibandingkan.

prompts/summarize_ticket.v2.txt
prompts/summarize_ticket.v3.txt

Beri Tag pada Setiap Versi

Berikan setiap prompt id versi yang jelas dan dapat ditetapkan di dalam kode. Dengan begitu, Anda selalu mengetahui susunan kata persis yang menghasilkan output tertentu.

PROMPT_VERSION = "summarize-v3"
template = load_prompt(PROMPT_VERSION)

Buat Dataset Evaluasi

Kumpulkan input nyata beserta jawaban yang Anda inginkan. Set evaluasi ini menjadi tolok ukur untuk menilai apakah perubahan prompt benar-benar membantu.

cases = [
  {"input": "ticket text...", "expected": "Refund requested"},
]

Nilai Berdasarkan Referensi

Untuk tugas dengan jawaban yang sudah diketahui, bandingkan output dengan teks yang diharapkan. Metrik sederhana seperti kecocokan persis atau F1 memberikan sinyal lulus-gagal dengan cepat.

Gunakan LLM sebagai Penilai

Untuk teks terbuka, minta model lain menilai jawaban berdasarkan rubrik. Pola LLM sebagai penilai ini memperluas penilaian melampaui aturan yang ditulis secara manual.

judge_prompt = "Rate 1-5 how well the summary captures the ticket:\n{output}"

Pantau Penilainya

Penilai dapat bersikap bias atau tidak konsisten. Anda menjaganya tetap objektif dengan memeriksa beberapa skor secara langsung berdasarkan sejumlah penilaian manusia pada kasus yang sama.

Jalankan Evaluasi pada Setiap Perubahan

Sebelum merilis prompt baru, jalankan prompt tersebut pada seluruh set evaluasi. Promosikan prompt hanya jika skornya tetap atau meningkat, bukan berdasarkan perkiraan.

old = run_eval("summarize-v2")
new = run_eval("summarize-v3")
assert new.score >= old.score

Lacak Regresi

Prompt yang memperbaiki satu kasus dapat merusak kasus lain. Membandingkan hasil per kasus akan mendeteksi regresi ini sebelum pengguna melihatnya.

Kerangka Kerja Membantu

Alat seperti promptfoo atau OpenAI Evals menjalankan dataset, memanggil model, dan melaporkan skor untuk Anda. Kerangka kerja mengubah pengujian ad hoc menjadi rangkaian pengujian yang dapat diulang.

Tetapkan Versi Pemenang

Setelah suatu versi menang dalam evaluasi Anda, tetapkan versi tersebut di produksi dan arsipkan sisanya. Kini Anda memiliki jejak yang jelas dan dapat diaudit dari prompt hingga hasil.

Pemeriksaan Singkat

Anda perlu menilai ringkasan terbuka yang tidak memiliki satu jawaban benar. Apa yang paling sesuai?

Rangkuman

Anda telah mempelajari cara memberi versi pada prompt, membuat set evaluasi, menilai dengan metrik atau penilai LLM, dan menjadikan hasil sebagai syarat rilis. Tidak perlu menebak lagi! 🎉

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Buat Versi Prompt dan Evaluasi Output” gratis?

Ya — teks lengkap “Buat Versi Prompt dan Evaluasi Output” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus MLOps Academy, upgrade ke CoddyKit PRO. Kursus MLOps Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Buat Versi Prompt dan Evaluasi Output”?

Lacak perubahan prompt dan nilai respons. Kamu berlatih MLOps Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai MLOps Academy?

Tidak diperlukan pengalaman sebelumnya. MLOps Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Buat Versi Prompt dan Evaluasi Output” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran MLOps Academy ini?

Ya. Setiap pelajaran MLOps Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Perbedaan LLMOps dari MLOps Klasik
  2. Buat Versi Prompt dan Evaluasi Output
  3. Telusuri dan Pantau Panggilan LLM
  4. Guardrail dan Evaluasi RAG
← Kembali ke MLOps Academy