0Pricing
AI Engineering Academy · Pelajaran

RAG vs Penyempurnaan: Kapan Menggunakan Masing-Masing

Bandingkan RAG dan penyempurnaan berdasarkan kesegaran pengetahuan, biaya, latensi, dan kompleksitas penerapan untuk menentukan pendekatan yang tepat dalam berbagai skenario dunia nyata.

RAG vs Penyempurnaan: Kapan Menggunakan Masing-Masing adalah pelajaran AI Engineering Academy gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Engineering Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Engineering Academy mencakup 4 pelajaran total.

Dua Strategi, Tujuan yang Berbeda

Saat Anda membutuhkan LLM yang bekerja dengan baik pada bidang khusus Anda, terdapat dua strategi utama: Retrieval-Augmented Generation (RAG) secara dinamis menyisipkan pengetahuan yang relevan saat inferensi, sedangkan penyetelan halus memperbarui bobot model untuk menanamkan pengetahuan, gaya, atau preferensi format. Memilih dengan tepat dapat menentukan perbedaan antara sistem yang andal dan berbulan-bulan komputasi GPU yang mahal tetapi terbuang karena pendekatan yang salah.

Apa yang Sebenarnya Diubah oleh Penyetelan Halus

Penyetelan halus memperbarui bobot model dengan melatihnya menggunakan pasangan masukan-keluaran contoh. Pendekatan ini unggul dalam mengubah perilaku: mengajari model untuk selalu merespons dalam format JSON tertentu, menggunakan suara merek, mengikuti pola penalaran khusus bidang, atau menjalankan jenis tugas yang sebelumnya tidak dioptimalkan untuknya. Penyetelan halus tidak memperbarui pengetahuan faktual secara andal — model dapat terlalu menyesuaikan diri dengan contoh pelatihan tanpa menggeneralisasi fakta yang mendasarinya ke kueri baru.

# Fine-tuning training example format (JSONL)
# {"messages": [
#   {"role": "system", "content": "You extract order info as JSON."},
#   {"role": "user",   "content": "Order #1234 for 3 widgets at $9.99 each"},
#   {"role": "assistant", "content": '{"order_id": "1234", "qty": 3, "unit_price": 9.99}'}
# ]}

# Good fine-tuning use case: consistent output FORMAT
# Bad fine-tuning use case: teaching the model your 2025 product catalog facts

Apa yang Sebenarnya Diubah oleh RAG

RAG tidak mengubah bobot model. Sebaliknya, RAG mengubah informasi yang tersedia bagi model saat inferensi dengan menempatkan dokumen yang relevan di dalam jendela konteks. RAG unggul dalam pengetahuan: menjawab pertanyaan tentang dokumen pribadi, menjaga jawaban tetap mutakhir dengan data yang sering diperbarui, dan mendasarkan respons pada sumber yang dapat diverifikasi. Hal yang tidak mudah diubah oleh RAG adalah gaya bawaan model, preferensi format, atau pendekatan penalarannya.

Kemutakhiran Pengetahuan: RAG Unggul

Untuk kasus penggunaan apa pun yang informasinya berubah seiring waktu, RAG jelas lebih unggul. Pengindeksan ulang penyimpanan vektor saat dokumen diperbarui hanya membutuhkan waktu beberapa menit dan tidak memerlukan sumber daya GPU. Menyetel halus model dengan data baru memerlukan pelatihan ulang (mahal dan lambat), dan bahkan setelah itu model mungkin tidak mengingat fakta baru secara andal. Katalog produk, peraturan hukum, panduan medis, dan kebijakan perusahaan semuanya lebih cocok ditangani oleh RAG daripada penyetelan halus.

Konsistensi Gaya dan Format: Penyetelan Halus Unggul

Jika Anda memerlukan model yang selalu merespons dengan gaya, nada, atau format terstruktur yang sangat spesifik dan tidak dapat dipastikan secara andal hanya dengan rekayasa perintah, penyetelan halus adalah alat yang tepat. Contohnya: bot layanan pelanggan yang harus selalu menggunakan kosakata khusus merek Anda, pembuat kode yang harus menghasilkan kode sesuai panduan gaya internal perusahaan, atau model klasifikasi yang harus mengeluarkan taksonomi kaku secara andal dalam ribuan kasus khusus.

Perbandingan Biaya

Penyetelan halus memiliki biaya awal yang tinggi (komputasi untuk pelatihan, waktu persiapan set data, dan evaluasi), tetapi dapat mengurangi biaya per kueri jika penyetelan halus memungkinkan Anda menggunakan model yang lebih kecil. RAG memiliki biaya awal yang rendah (pengindeksan basis data vektor murah), tetapi menambah beban per kueri: satu panggilan API untuk representasi vektor serta perintah yang sedikit lebih panjang karena konteks yang disisipkan. Untuk sebagian besar aplikasi dengan kurang dari 10 juta kueri per hari, beban tambahan per kueri dari RAG dapat diabaikan dibandingkan biaya pengembangan penyetelan halus.

# RAG per-query cost estimate
EMBED_COST_PER_1K_TOKENS = 0.00002  # text-embedding-3-small
LLM_INPUT_COST_PER_1K = 0.0025     # gpt-4o input

query_embed_cost = (10 / 1000) * EMBED_COST_PER_1K_TOKENS    # ~10 token query
context_cost = (1500 / 1000) * LLM_INPUT_COST_PER_1K         # 5 chunks * 300 tokens

print(f'RAG overhead per query: ${query_embed_cost + context_cost:.5f}')
# About $0.004 extra per query — negligible at moderate scale

Perbandingan Latensi

Model yang disetel halus dapat lebih cepat saat inferensi karena memerlukan perintah yang lebih singkat — pengetahuannya tersimpan dalam bobot, bukan dalam konteks. RAG menambahkan dua perjalanan bolak-balik: satu panggilan API untuk representasi vektor dan satu kueri pencarian vektor. Total beban tambahan biasanya 50–200 md. Untuk aplikasi yang sensitif terhadap latensi, seperti asisten suara waktu nyata, beban ini penting. Untuk sebagian besar aplikasi percakapan dan tanya jawab, latensi tambahan tersebut tidak terasa oleh pengguna.

Transparansi dan Kemampuan Audit

RAG menyediakan jejak audit yang jelas: untuk setiap jawaban, Anda mengetahui dokumen mana yang diambil dan dapat menampilkannya kepada pengguna. Model yang disetel halus menjawab berdasarkan bobot yang tidak transparan — tidak ada catatan contoh pelatihan mana yang menghasilkan keluaran tertentu. Dalam industri yang diatur seperti keuangan, layanan kesehatan, dan hukum, yang mengharuskan jawaban dapat dijelaskan dan diverifikasi, transparansi RAG merupakan keunggulan penting dibandingkan penyetelan halus.

Kapan Keduanya Digabungkan

RAG dan penyetelan halus tidak saling eksklusif. Pola produksi yang umum adalah: menyetel halus model untuk format keluaran dan kosakata bidang yang konsisten, lalu menambahkan RAG untuk menyediakan pengetahuan faktual terkini. Model yang disetel halus menangani gaya dan struktur secara andal, sedangkan RAG menangani pengetahuan. Kombinasi ini mengungguli masing-masing pendekatan jika digunakan sendiri untuk aplikasi perusahaan yang berisiko tinggi.

Bagan Alur Pengambilan Keputusan

Ikuti jalur keputusan ini: Apakah masalahnya berkaitan dengan konsistensi gaya atau format? → Pertimbangkan penyetelan halus. Apakah informasinya pribadi atau sering diperbarui? → Gunakan RAG. Apakah Anda memerlukan kutipan sumber? → Gunakan RAG. Apakah set datanya terlalu kecil untuk penyetelan halus (kurang dari 500 contoh)? → Gunakan RAG dengan perintah few-shot. Apakah Anda memerlukan model untuk menangani tugas yang saat ini ditolaknya? → Lakukan penyetelan halus dengan RLHF atau DPO. Jika ragu, mulailah dengan RAG — pendekatan ini lebih cepat dibuat, lebih mudah diperbarui, dan lebih transparan.

Contoh Skenario Dunia Nyata

Gunakan skenario berikut untuk membangun intuisi: chatbot HR internal (kebijakan berubah setiap kuartal dan harus mencantumkan sumber) → RAG. Penyelesaian kode untuk kerangka kerja eksklusif (gaya kode dan pola kerangka kerja yang konsisten) → Penyetelan halus. Tanya jawab dokumen hukum (dokumen pribadi dan memerlukan kutipan yang tepat) → RAG. Bot dukungan pelanggan (nada tertentu dan FAQ produk berubah setiap minggu) → Penyetelan halus untuk nada + RAG untuk pengetahuan. Perangkum literatur medis (penelitian terkini dan atribusi sangat penting) → RAG.

Pemeriksaan Singkat

Uji pemahaman Anda tentang konsep Rekayasa AI dari pelajaran ini.

Ringkasan Pelajaran

Dalam pelajaran ini Anda mempelajari: penyetelan halus mengubah perilaku dan gaya model, tetapi tidak mengubah pengetahuan faktual secara andal; RAG menyediakan pengetahuan secara dinamis saat inferensi dengan transparansi penuh dan kutipan sumber; serta kerangka pengambilan keputusan — gunakan RAG untuk pengetahuan pribadi yang sering diperbarui dan memerlukan atribusi, gunakan penyetelan halus untuk gaya dan format yang konsisten, dan gabungkan keduanya untuk aplikasi perusahaan yang berisiko tinggi. Selanjutnya, kita akan mulai membangun pipeline RAG lengkap dari awal.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “RAG vs Penyempurnaan: Kapan Menggunakan Masing-Masing” gratis?

Ya — teks lengkap “RAG vs Penyempurnaan: Kapan Menggunakan Masing-Masing” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Engineering Academy, upgrade ke CoddyKit PRO. Kursus AI Engineering Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “RAG vs Penyempurnaan: Kapan Menggunakan Masing-Masing”?

Bandingkan RAG dan penyempurnaan berdasarkan kesegaran pengetahuan, biaya, latensi, dan kompleksitas penerapan untuk menentukan pendekatan yang tepat dalam berbagai skenario dunia nyata. Kamu berlatih AI Engineering Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Engineering Academy?

Tidak diperlukan pengalaman sebelumnya. AI Engineering Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.

Berapa lama pelajaran “RAG vs Penyempurnaan: Kapan Menggunakan Masing-Masing” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Engineering Academy ini?

Ya. Setiap pelajaran AI Engineering Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Masalah yang Diselesaikan RAG
  2. Arsitektur RAG: Pengindeksan dan Pengambilan
  3. Menyusun Perintah yang Diperkaya
  4. RAG vs Penyempurnaan: Kapan Menggunakan Masing-Masing
← Kembali ke AI Engineering Academy