0Pricing
AI Engineering Academy · Pelajaran

Masalah yang Diselesaikan RAG

Amati kasus kegagalan nyata ketika LLM mengarang informasi yang sudah usang atau keliru, lalu pahami cara menjadikan jawaban berlandaskan dokumen yang diambil untuk mengatasi masalah tersebut.

Masalah yang Diselesaikan RAG adalah pelajaran AI Engineering Academy gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Engineering Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Engineering Academy mencakup 4 pelajaran total.

LLM Memiliki Batas Pengetahuan

Setiap model bahasa besar dilatih berdasarkan cuplikan internet hingga tanggal tertentu yang disebut batas pengetahuan. GPT-4o memiliki batas pengetahuan pada awal 2024. Jika Anda menanyakannya tentang peristiwa yang terjadi setelah tanggal tersebut, model akan mengakui ketidaktahuannya atau, yang lebih buruk, mengarang informasi yang terdengar masuk akal tetapi salah dengan penuh keyakinan. Bagi aplikasi yang memerlukan pengetahuan terkini atau hak milik, ini merupakan masalah mendasar.

Masalah Halusinasi

Halusinasi terjadi ketika LLM menghasilkan teks yang terdengar meyakinkan, tetapi secara faktual salah. Model dilatih untuk menghasilkan teks yang lancar dan koheren — bukan secara khusus dilatih untuk menolak ketika tidak mengetahui sesuatu. Akibatnya, model mengisi kekosongan pengetahuan dengan tebakan yang masuk akal. Berbagai penelitian menunjukkan bahwa bahkan model terbaik pun berhalusinasi dalam tugas yang membutuhkan banyak pengetahuan sebanyak 10-40% dari waktu yang ada tanpa landasan eksternal.

Contoh Nyata Halusinasi

Bayangkan Anda menanyakan kepada LLM: Apa saja ketentuan kontrak vendor perusahaan kita untuk kuartal ketiga 2025? Model tersebut belum pernah melihat dokumen internal Anda. Alih-alih mengatakan bahwa ia tidak tahu, model mungkin menghasilkan ringkasan kontrak yang terdengar masuk akal dengan menggunakan bahasa hukum umum. Jika seorang karyawan bertindak berdasarkan informasi yang dibuat-buat itu, konsekuensinya dapat serius. Inilah mode kegagalan yang secara khusus dirancang untuk dicegah oleh RAG.

# Without RAG — LLM guesses from parametric memory
response = client.chat.completions.create(
    model='gpt-4o',
    messages=[
        {'role': 'user',
         'content': 'What are our Q3 2025 vendor contract terms?'}
    ]
)
# Model has no access to your documents — may hallucinate
print(response.choices[0].message.content)

Landasan Mengatasi Halusinasi

Gagasan di balik RAG sederhana: jika Anda memberikan informasi yang relevan di dalam perintah, model tidak perlu mengandalkan pengetahuan yang dihafalnya. Model beralih dari menghasilkan dari ingatan menjadi membaca dari konteks. Begitu pula cara manusia bekerja — ketika memerlukan detail yang tepat, Anda mencarinya alih-alih mengandalkan ingatan. RAG menerapkan alur kerja yang sama untuk LLM.

# With RAG — answer grounded in retrieved documents
context = retrieve_relevant_chunks(query='Q3 2025 vendor contract terms')

response = client.chat.completions.create(
    model='gpt-4o',
    messages=[
        {'role': 'system', 'content': 'Answer using only the provided context.'},
        {'role': 'user', 'content': f'Context: {context}\n\nQuestion: What are our Q3 2025 vendor contract terms?'}
    ]
)

Penyetelan Halus Statis Tidak Membantu di Sini

Salah kaprah yang umum adalah bahwa penyetelan halus model menggunakan dokumen Anda dapat memperbaiki halusinasi. Penyetelan halus memperbarui bobot model untuk meningkatkan gaya, format, dan kepatuhan terhadap tugas, tetapi tidak secara andal memasukkan pengetahuan faktual. Berbagai penelitian menunjukkan bahwa model yang telah disetel halus masih berhalusinasi bahkan pada data pelatihannya sendiri. Agar dapat diingat secara andal, pengetahuan harus diberikan pada waktu inferensi melalui jendela konteks.

RAG Memungkinkan Pengetahuan Waktu Nyata

Karena RAG mengambil informasi dari penyimpanan dokumen yang terus diperbarui, RAG secara alami dapat menangani pengetahuan yang berubah seiring waktu. Ketika dokumen kebijakan Anda diperbarui, Anda cukup membuat ulang indeksnya, dan setiap kueri berikutnya langsung menggunakan versi baru—tanpa perlu melatih ulang model. Hal ini membuat RAG jauh lebih praktis daripada penyetelan halus berkala untuk aplikasi seperti basis pengetahuan internal, sistem dukungan pelanggan, dan alat riset keuangan.

RAG Bekerja pada Data Privat Milik Sendiri

Sebagian besar data perusahaan tidak dapat dikirim ke OpenAI untuk pelatihan karena persyaratan privasi dan kepatuhan. RAG mengatasi hal ini: dokumen sensitif Anda tetap berada di basis data vektor milik Anda sendiri, dan hanya potongan yang relevan yang dikirim ke LLM untuk setiap kueri. Anda bahkan dapat menjalankan LLM lokal seperti Llama 3 agar semua data tetap berada di lingkungan lokal. RAG adalah pola utama untuk membangun AI di atas konten perusahaan yang bersifat rahasia.

RAG Memungkinkan Atribusi Sumber

Ketika LLM menghasilkan jawaban dari ingatannya, tidak ada sumber yang dapat dikutip. Ketika LLM menghasilkan jawaban dari dokumen yang diambil, LLM dapat mengutip sumber yang tepat. Anda dapat menginstruksikan model untuk menyertakan nama dokumen dan nomor halaman dalam jawabannya, lalu pengguna dapat mengekliknya untuk memverifikasi sumber asli. Atribusi sumber secara drastis meningkatkan kepercayaan terhadap jawaban yang dihasilkan AI, yang sangat penting dalam aplikasi hukum, medis, dan keuangan.

system_prompt = '''You are a helpful assistant.
Answer questions using ONLY the provided context.
At the end of your answer, list the sources you used
in this format: [Source: document_name, page X]
If the context does not contain the answer, say:
"I don't have that information in the provided documents."'''

Pola Ambil Lalu Hasilkan

RAG mengikuti pola dua langkah pada waktu inferensi: Ambil—ubah pertanyaan pengguna menjadi representasi vektor, cari potongan dokumen yang paling relevan di penyimpanan vektor, lalu kumpulkan hasil teratas sebanyak K. Hasilkan—susun perintah yang menyertakan potongan yang diambil sebagai konteks, lalu minta LLM menjawab pertanyaan hanya berdasarkan konteks tersebut. LLM membaca, menyintesis, dan memberikan respons.

def answer_with_rag(user_question, vector_store, llm_client):
    # Step 1: Retrieve
    query_embedding = embed(user_question)
    chunks = vector_store.search(query_embedding, top_k=5)
    context = '\n\n'.join([c['text'] for c in chunks])

    # Step 2: Generate
    response = llm_client.chat.completions.create(
        model='gpt-4o',
        messages=[
            {'role': 'system', 'content': f'Answer using only:\n{context}'},
            {'role': 'user', 'content': user_question}
        ]
    )
    return response.choices[0].message.content

Hal yang Tidak Diselesaikan RAG

RAG memang kuat, tetapi bukan solusi untuk segala hal. RAG tetap gagal ketika jawaban memerlukan sintesis dari ratusan dokumen (pengambilan hanya mengembalikan beberapa potongan), pertanyaannya secara inheren multi-langkah dan model perlu menalar melalui langkah-langkah perantara, atau potongan yang diambil menyesatkan atau saling bertentangan. Memahami keterbatasan ini membantu Anda merancang sistem hibrida yang menggabungkan RAG dengan agen penalaran.

RAG Dibandingkan Alternatifnya

Anda memiliki tiga pilihan utama untuk memberikan pengetahuan domain kepada LLM: memasukkan seluruh isi ke dalam perintah (menaruh semuanya di dalam perintah—hanya cocok untuk korpus yang sangat kecil), penyetelan halus (melatih gaya dan format dengan baik, tetapi tidak andal untuk mengingat fakta), dan RAG (mengambil fakta yang relevan secara dinamis pada waktu inferensi serta dapat menangani jutaan dokumen). Untuk sebagian besar kasus penggunaan produksi yang memerlukan pengetahuan terkini, privat, atau berskala besar, RAG adalah pilihan yang tepat.

Pemeriksaan Singkat

Uji pemahaman Anda tentang konsep Rekayasa AI dari pelajaran ini.

Rangkuman Pelajaran

Dalam pelajaran ini Anda mempelajari: alasan LLM berhalusinasi karena batas waktu pengetahuan dan ketidakmampuannya mengatakan “Saya tidak tahu”, alasan penyetelan halus tidak menyelesaikan halusinasi dalam mengingat fakta, serta cara RAG mendasarkan jawaban pada dokumen yang diambil sehingga memungkinkan atribusi sumber, pengetahuan waktu nyata, dan penggunaan data privat yang aman. Selanjutnya kita akan mempelajari arsitektur RAG lengkap, termasuk fase pengindeksan dan pengambilannya.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Masalah yang Diselesaikan RAG” gratis?

Ya — teks lengkap “Masalah yang Diselesaikan RAG” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Engineering Academy, upgrade ke CoddyKit PRO. Kursus AI Engineering Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Masalah yang Diselesaikan RAG”?

Amati kasus kegagalan nyata ketika LLM mengarang informasi yang sudah usang atau keliru, lalu pahami cara menjadikan jawaban berlandaskan dokumen yang diambil untuk mengatasi masalah tersebut. Kamu berlatih AI Engineering Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Engineering Academy?

Tidak diperlukan pengalaman sebelumnya. AI Engineering Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.

Berapa lama pelajaran “Masalah yang Diselesaikan RAG” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Engineering Academy ini?

Ya. Setiap pelajaran AI Engineering Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Masalah yang Diselesaikan RAG
  2. Arsitektur RAG: Pengindeksan dan Pengambilan
  3. Menyusun Perintah yang Diperkaya
  4. RAG vs Penyempurnaan: Kapan Menggunakan Masing-Masing
← Kembali ke AI Engineering Academy