Membaca dan Mengevaluasi Keluaran Kecerdasan Buatan
Kriteria untuk menilai relevansi, keakuratan, dan kelengkapan respons kecerdasan buatan.
Membaca dan Mengevaluasi Keluaran Kecerdasan Buatan adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Mengapa Evaluasi Penting
Mendapatkan tanggapan AI hanyalah separuh pekerjaan. Separuh lainnya adalah menilai apakah tanggapan tersebut benar-benar baik.
Tanpa kerangka evaluasi yang jelas, Anda mungkin menerima tanggapan yang terlihat rapi tetapi menjawab pertanyaan yang salah, atau menolak tanggapan yang benar-benar berguna karena formatnya tidak sesuai dengan harapan Anda.
Mengembangkan kemampuan yang andal untuk menilai kualitas keluaran AI adalah salah satu keterampilan paling praktis dalam rekayasa perintah.
Empat Kriteria Evaluasi
Saat membaca tanggapan AI, nilailah berdasarkan empat dimensi:
- Relevansi — Apakah tanggapan menjawab pertanyaan sebenarnya yang Anda ajukan?
- Keakuratan — Apakah informasinya benar secara faktual?
- Kelengkapan — Apakah tanggapan mencakup semua bagian permintaan?
- Format — Apakah strukturnya sesuai dengan kebutuhan Anda?
Sebuah tanggapan dapat memperoleh nilai tinggi dalam tiga dimensi tetapi gagal dalam dimensi keempat. Setiap kriteria penting secara mandiri.
Kriteria 1: Relevansi
Relevansi menanyakan: apakah model menjawab pertanyaan yang benar-benar Anda ajukan, atau menjawab pertanyaan lain yang berkaitan tetapi berbeda?
Contoh: Anda bertanya "Apa risiko penggunaan LLM dalam layanan kesehatan?", tetapi model merespons dengan gambaran umum tentang cara kerja LLM. Respons tersebut mungkin akurat, tetapi tidak relevan — model melenceng dari inti pertanyaan.
Untuk memeriksa relevansi, baca kembali prompt asli Anda dan tanyakan: apakah respons tersebut secara langsung menjawab pertanyaan saya?
Kriteria 2: Akurasi
Akurasi menanyakan: apakah fakta, angka, dan klaim dalam respons tersebut benar?
Model AI dapat berhalusinasi — model mungkin menyatakan sesuatu dengan penuh keyakinan padahal sebenarnya salah. Masalah akurasi yang umum meliputi:
- Statistik atau tanggal yang salah
- Kutipan yang atribusinya keliru
- Informasi kedaluwarsa yang disajikan sebagai informasi terkini
- Referensi atau sitasi yang dibuat-buat
Untuk topik faktual, selalu verifikasi klaim penting menggunakan sumber tepercaya sebelum menggunakan output tersebut.
Kriteria 3: Kelengkapan
Kelengkapan menanyakan: apakah respons tersebut mencakup semua bagian dari permintaan Anda?
Jika prompt Anda memiliki beberapa bagian — "Jelaskan X, berikan tiga contoh, dan sarankan langkah berikutnya" — periksa apakah model menjawab ketiganya, bukan hanya bagian pertama.
Model terkadang mengabaikan bagian terakhir dari permintaan yang terdiri atas beberapa bagian, terutama jika prompt-nya panjang. Membaca respons sambil membandingkannya dengan prompt Anda bagian demi bagian merupakan cara yang paling andal untuk memeriksa kelengkapan.
Kriteria 4: Format
Format menanyakan: apakah respons tersebut disusun dengan cara yang Anda perlukan?
Respons yang sangat akurat dan lengkap pun dapat sulit digunakan jika formatnya salah. Ketidaksesuaian format yang umum:
- Prosa saat Anda membutuhkan poin-poin
- Esai panjang saat Anda membutuhkan ringkasan
- Judul yang tidak ada, padahal akan membantu navigasi
- Kode tanpa penjelasan, atau penjelasan tanpa kode
Masalah format sering kali paling mudah diperbaiki dengan prompt lanjutan.
Daftar Periksa Evaluasi Sederhana
Setelah menerima respons AI apa pun, lakukan pemeriksaan mental berikut:
- Relevansi: Apakah respons tersebut menjawab pertanyaan saya yang sebenarnya?
- Akurasi: Apakah saya dapat mempercayai faktanya? Apa yang perlu saya verifikasi?
- Kelengkapan: Apakah respons tersebut mencakup semua bagian permintaan saya?
- Format: Apakah respons tersebut disusun dengan cara yang dapat saya gunakan?
Jika ada kriteria yang gagal dipenuhi, hal itu menunjukkan dengan tepat jenis prompt lanjutan yang perlu Anda tulis. Setiap kriteria mengarah pada jenis koreksi tertentu.
Mengevaluasi dalam Kode: Memberi Skor pada Respons
Anda dapat membuat pembungkus evaluasi sederhana dalam Python yang memberi skor pada respons untuk setiap kriteria menggunakan panggilan LLM kedua:
import openai
client = openai.OpenAI(api_key='sk-...')
def evaluate_response(original_prompt, response_text):
eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.
Original prompt: {original_prompt}
AI response: {response_text}
Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?
Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''
result = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': eval_prompt}]
)
return result.choices[0].message.contentKegagalan Relevansi: Pola Umum
Kegagalan relevansi cenderung mengikuti pola yang dapat diprediksi. Mengenalinya akan mempercepat evaluasi Anda:
- Pergeseran topik — Model memulai dengan benar, lalu beralih ke topik yang berkaitan
- Pertukaran pertanyaan — Model menjawab versi pertanyaan Anda yang lebih sederhana atau lebih mudah
- Generalisasi berlebihan — Anda bertanya tentang kasus tertentu, tetapi model menjawab kasus umum
- Mengabaikan batasan — Anda menentukan konteks, misalnya "untuk pemula", tetapi model mengabaikannya
Setiap pola menyarankan perbaikan tertentu dalam prompt lanjutan Anda.
Tanda Bahaya Akurasi yang Perlu Diperhatikan
Meski Anda tidak dapat langsung memverifikasi suatu klaim, sinyal tertentu menunjukkan akurasi yang lebih rendah:
- Angka yang sangat spesifik tanpa sumber
- Klaim yang tampak terlalu menguntungkan atau sangat tepat sasaran
- Rujukan ke penelitian, makalah, atau buku berdasarkan judul dan penulis
- Tanggal dan nomor versi, karena sering berubah
- Hal-hal spesifik yang bersifat hukum, medis, atau keuangan
Hal-hal tersebut bukan bukti kesalahan, tetapi layak diperiksa ulang sebelum Anda menggunakan output dalam konteks yang berisiko tinggi.
Menggunakan Evaluasi untuk Menulis Prompt Lanjutan yang Lebih Baik
Nilai sebenarnya dari evaluasi adalah bahwa setiap kriteria yang gagal terpenuhi secara langsung menentukan jenis prompt lanjutan:
- Kegagalan relevansi → "Anda menjawab X, tetapi yang saya tanyakan adalah Y. Harap fokus pada Y."
- Masalah akurasi → "Harap periksa kembali klaim tentang Z dan sertakan dasar yang Anda gunakan."
- Kegagalan kelengkapan → "Anda belum menjawab bagian ketiga dari pertanyaan saya. Harap tambahkan bagian tersebut."
- Kegagalan format → "Tulis ulang ini sebagai poin-poin dengan ringkasan satu baris di bagian atas."
Evaluasi dan penulisan prompt lanjutan bekerja sebagai putaran umpan balik.
Uji Pengetahuan: Kriteria Evaluasi
Anda bertanya kepada model: "Sebutkan 5 kerangka kerja web Python teratas dengan deskripsi satu kalimat untuk masing-masing." Model merespons dengan esai yang ditulis dengan baik tentang sejarah Python dan perkembangannya dalam pengembangan web, serta menyebut Flask dan Django secara singkat, tetapi tidak mencantumkan 5 kerangka kerja.
Kriteria mana yang paling kritis gagal dipenuhi oleh respons ini?
Ringkasan: Membaca dan Mengevaluasi Output AI
Penulisan prompt yang baik merupakan proses dua langkah: menyusun prompt dan mengevaluasi respons.
Empat kriteria — Relevansi, Akurasi, Kelengkapan, Format — memberi Anda cara sistematis untuk menilai output AI apa pun. Setiap kriteria yang gagal terpenuhi memberi tahu Anda dengan tepat jenis prompt lanjutan yang perlu ditulis.
Dalam pelajaran berikutnya, Anda akan berlatih menulis prompt lanjutan tersebut untuk memperbaiki jenis kegagalan tertentu.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Membaca dan Mengevaluasi Keluaran Kecerdasan Buatan” gratis?
Ya — teks lengkap “Membaca dan Mengevaluasi Keluaran Kecerdasan Buatan” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Membaca dan Mengevaluasi Keluaran Kecerdasan Buatan”?
Kriteria untuk menilai relevansi, keakuratan, dan kelengkapan respons kecerdasan buatan. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?
Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.
Berapa lama pelajaran “Membaca dan Mengevaluasi Keluaran Kecerdasan Buatan” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?
Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Membaca dan Mengevaluasi Keluaran Kecerdasan Buatan
- Menulis Perintah Tindak Lanjut yang Efektif
- Mengembangkan Respons Sebelumnya
- Kapan Menyempurnakan atau Memulai dari Awal