Jendela Konteks: Ukuran dan Implikasinya
Pelajari apa itu jendela konteks, bagaimana jendela tersebut membatasi panjang percakapan dan pemrosesan dokumen, serta bandingkan ukuran konteks pada GPT-4o, Claude, dan Gemini.
Jendela Konteks: Ukuran dan Implikasinya adalah pelajaran AI Engineering Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Engineering Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Engineering Academy mencakup 4 pelajaran total.
Apa Itu Jendela Konteks?
Jendela konteks adalah jumlah token maksimum yang dapat diproses oleh LLM dalam satu panggilan API. Jendela ini mencakup semuanya: prompt sistem, semua giliran percakapan sebelumnya, dokumen apa pun yang Anda masukkan untuk RAG, serta ruang yang disediakan untuk respons model. Jika jumlah totalnya melebihi jendela konteks, API akan mengembalikan galat.
Anggaplah jendela konteks sebagai memori kerja model. Tidak seperti manusia yang dapat mengingat percakapan sebelumnya di berbagai sesi, LLM tidak memiliki memori persisten—LLM hanya dapat mengetahui hal-hal yang ada dalam jendela konteks saat ini. Ketika percakapan berkembang melampaui kapasitas jendela, konten paling lama harus dihapus, sehingga model dapat kehilangan jejak konteks penting dari bagian sebelumnya.
Ukuran Jendela Konteks pada 2025
Jendela konteks telah berkembang secara drastis. Pada 2020, GPT-3 menawarkan 4.096 token. Pada 2025, model-model terkemuka menawarkan:
- GPT-4o dan GPT-4o-mini: 128.000 token (~100.000 kata)
- Claude 3.5 Sonnet / Opus: 200.000 token
- Gemini 1.5 Pro: 1.000.000 token (satu juta)
- Gemini 1.5 Flash: 1.000.000 token
Jendela konteks 128K dapat menampung sekitar 300 halaman teks, satu novel lengkap, atau seluruh basis kode berukuran sedang. Meskipun demikian, konteks tak terbatas bukanlah masalah yang sudah terpecahkan: biaya perhatian meningkat secara kuadratik seiring panjang urutan, sehingga konteks yang sangat panjang menjadi mahal dan terkadang kurang akurat daripada konteks yang lebih pendek dan terfokus.
Masalah Hilang di Tengah
Penelitian menemukan bahwa LLM tidak memberikan perhatian yang sama pada semua bagian jendela konteks. LLM cenderung paling memperhatikan konten di bagian paling awal (efek keutamaan) dan bagian paling akhir (efek keterkinian) konteks, sementara konten di bagian tengah diproses dengan keandalan yang lebih rendah.
Hal ini disebut masalah hilang di tengah. Masalah ini memiliki implikasi praktis bagi sistem RAG: jika Anda menggabungkan 10 dokumen yang diambil dan dokumen yang paling relevan berada di bagian tengah, model mungkin tidak menggunakannya secara efektif. Praktik terbaiknya adalah menempatkan konteks terpenting di awal atau akhir dokumen yang dimasukkan, bukan di tengah.
Konteks vs Percakapan: Contoh Praktis
Dalam aplikasi percakapan, seluruh riwayat percakapan disertakan dalam setiap panggilan API. Seiring percakapan berkembang, jumlah token juga bertambah. Percakapan dengan 50 pesan yang masing-masing rata-rata terdiri dari 100 token sudah menggunakan 5.000 token hanya untuk riwayat. Tambahkan prompt sistem 2.000 token dan konteks RAG 10.000 token, maka jumlahnya menjadi 17.000 token bahkan sebelum pengguna mengajukan pertanyaan berikutnya.
import tiktoken
def estimate_conversation_tokens(messages, model='gpt-4o'):
enc = tiktoken.encoding_for_model(model)
total = 3 # priming
for msg in messages:
total += 4 # per-message overhead
total += len(enc.encode(msg.get('content', '')))
return total
# Simulate a growing conversation
conversation = [
{'role': 'system', 'content': 'You are a helpful coding assistant. ' * 20}, # ~100 tokens
]
for i in range(1, 21):
conversation.append({'role': 'user', 'content': f'Question {i}: How do I implement feature X?'})
conversation.append({'role': 'assistant', 'content': 'Here is how to implement that feature...' * 5})
if i % 5 == 0:
tokens = estimate_conversation_tokens(conversation)
print(f'After {i} exchanges: {tokens} tokens')Konteks Efektif vs Konteks Maksimum
Memiliki jendela konteks yang besar bukan berarti Anda harus mengisinya sepenuhnya. Penelitian secara konsisten menunjukkan bahwa akurasi model menurun ketika konteks semakin penuh, terutama untuk tugas yang memerlukan pengambilan fakta tertentu secara presisi dari konteks yang panjang. Konteks terfokus dan relevan berisi 5.000 token sering menghasilkan jawaban yang lebih baik daripada konteks tidak terfokus berisi 50.000 token.
Inilah alasan utama menggunakan RAG daripada sekadar memasukkan semua dokumen ke dalam konteks: sistem RAG hanya mengambil 2–5 bagian yang paling relevan, sehingga konteks tetap terfokus dan perhatian model terkonsentrasi pada hal-hal yang penting. Bayangkan ini seperti mencari di indeks buku dibandingkan membaca seluruh buku untuk menjawab satu pertanyaan.
Implikasi untuk Pemrosesan Dokumen
Jendela konteks yang panjang memungkinkan alur kerja pemrosesan dokumen yang kuat dan sebelumnya mustahil dilakukan. Kini Anda dapat mengirim seluruh PDF 50 halaman ke GPT-4o dan mengajukan pertanyaan tentangnya, meminta model merangkum serta membandingkan silang beberapa kontrak secara bersamaan, atau menganalisis seluruh basis kode untuk menemukan pola dan antipola.
Namun, dengan biaya sekitar $0,15 per satu juta token input, pemrosesan dokumen 100.000 token untuk setiap permintaan berbiaya sekitar $0,015 per permintaan. Jika Anda mengirim 10.000 permintaan per hari untuk dokumen yang jarang berubah, Anda membayar $150 per hari untuk pemrosesan berulang. Inilah alasan strategi penyimpanan tembolok dan prapemrosesan sangat penting dalam sistem analisis dokumen produksi.
Hubungan Jendela Konteks dan Max Tokens
Parameter max_tokens dalam API membatasi panjang output, bukan total konteks. Total jendela konteks sama dengan token input ditambah token output. Jika jendela konteks Anda berisi 128.000 token dan input Anda menggunakan 120.000 token, Anda hanya memiliki 8.000 token tersisa untuk respons, terlepas dari nilai yang Anda tetapkan untuk max_tokens.
Selalu sisakan anggaran output yang memadai. Untuk asisten percakapan, biasanya cukup menyediakan 2.000–4.000 token untuk output. Untuk pembuatan kode atau konten panjang, Anda mungkin memerlukan 8.000–16.000 token. Masukkan perhitungan anggaran token ke dalam logika penyusunan konteks Anda.
import tiktoken
def check_context_budget(
messages,
model='gpt-4o',
max_context=128000,
min_output_tokens=2000
):
enc = tiktoken.encoding_for_model(model)
input_tokens = sum(
len(enc.encode(m.get('content', ''))) + 4
for m in messages
) + 3
available_output = max_context - input_tokens
if available_output < min_output_tokens:
raise ValueError(
f'Not enough output budget: only {available_output} tokens '
f'remaining, need at least {min_output_tokens}.'
)
return input_tokens, available_outputMemilih Model berdasarkan Kebutuhan Konteks
Ukuran jendela konteks harus menjadi salah satu kriteria utama saat memilih model. Sesuaikan jendela konteks model dengan kasus penggunaan Anda:
- Asisten percakapan dengan sesi singkat: 8K–16K biasanya sudah cukup; gunakan gpt-4o-mini agar lebih hemat biaya
- Tanya jawab dokumen berukuran sedang: 32K–128K; gpt-4o menyeimbangkan kualitas dan biaya dengan baik
- Analisis hukum/kontrak dengan ratusan halaman: 128K–200K; pertimbangkan Claude karena kinerjanya pada konteks panjang
- Analisis seluruh basis kode atau buku: 500K–1M; Gemini 1.5 Pro saat ini menjadi pemimpin
Membayar jendela konteks 1 juta token ketika Anda hanya memerlukan 8K merupakan pemborosan yang mahal. Sesuaikan ukuran model dengan kebutuhan konteks Anda yang sebenarnya.
Penyimpanan Tembolok Konteks untuk Mengurangi Biaya
Ketika Anda berulang kali mengirim pertanyaan tentang dokumen besar atau prompt sistem yang sama dalam banyak permintaan, Anda membayar untuk melakukan tokenisasi dan memproses konten yang sama setiap kali. Penyimpanan tembolok prompt OpenAI secara otomatis memberikan potongan harga 50% untuk awalan prompt yang berulang pada harga token input ketika awalan yang sama melebihi 1.024 token.
Untuk memaksimalkan penggunaan tembolok, susun pesan Anda agar konten yang stabil berada di awal: prompt sistem, lalu dokumen atau konteks besar, kemudian pertanyaan pengguna yang berubah-ubah. Dengan demikian, awalan stabil yang panjang disimpan di tembolok dan hanya kueri kecil yang berubah-ubah yang diproses dengan harga penuh pada setiap permintaan.
Kapan Memperluas dan Kapan Meringkas
Dengan jendela konteks yang besar, Anda memiliki dua strategi untuk menangani percakapan yang berkembang atau dokumen besar: memperluas (mempertahankan semuanya dalam konteks) atau meringkas (memadatkan konten lama untuk menghemat token). Pilihan yang tepat bergantung pada kasus penggunaan Anda.
Pilih perluasan ketika: Anda perlu merujuk fakta tertentu dari bagian awal percakapan, Anda menganalisis dokumen yang memerlukan kutipan dari bagian tertentu, atau peringkasan akan menghilangkan nuansa penting. Pilih peringkasan ketika: tema umum percakapan sebelumnya lebih penting daripada susunan kata tertentu, Anda mendekati batas konteks, atau konteks yang sama akan digunakan kembali berkali-kali (sehingga peringkasan menjadi biaya satu kali).
Memantau Panjang Konteks dalam Produksi
Dalam produksi, pantau panjang konteks untuk setiap permintaan sebagai metrik utama. Lonjakan mendadak pada rata-rata panjang konteks dapat menunjukkan galat dalam kode penyusunan konteks, pengguna menempelkan input yang sangat panjang, atau adanya putaran umpan balik ketika respons panjang model dimasukkan kembali ke dalam konteks. Tetapkan peringatan ketika panjang konteks melebihi 80% dari maksimum model.
Pantau juga peristiwa pemotongan—ketika Anda harus memotong konteks agar sesuai dengan jendela. Pemotongan yang sering berarti Anda memerlukan strategi pengelolaan konteks yang lebih baik, model dengan konteks yang lebih besar, atau pendekatan berbasis RAG untuk mengambil hanya konten yang relevan alih-alih mengirim semuanya.
Pemeriksaan Singkat
Uji pemahaman Anda tentang konsep Rekayasa AI dari pelajaran ini.
Ringkasan Pelajaran
Dalam pelajaran ini Anda telah mempelajari bahwa: jendela konteks adalah total anggaran token untuk input dan output dalam satu panggilan API, masalah hilang di tengah berarti konten di awal dan akhir konteks diproses dengan lebih andal, serta konteks kecil yang terfokus sering mengungguli konteks besar yang tidak terfokus, sehingga RAG lebih baik daripada memasukkan semua dokumen. Selanjutnya, kita akan mempelajari cara menghitung dan memprediksi biaya API sebelum mengirim permintaan.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Jendela Konteks: Ukuran dan Implikasinya” gratis?
Ya — teks lengkap “Jendela Konteks: Ukuran dan Implikasinya” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Engineering Academy, upgrade ke CoddyKit PRO. Kursus AI Engineering Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Jendela Konteks: Ukuran dan Implikasinya”?
Pelajari apa itu jendela konteks, bagaimana jendela tersebut membatasi panjang percakapan dan pemrosesan dokumen, serta bandingkan ukuran konteks pada GPT-4o, Claude, dan Gemini. Kamu berlatih AI Engineering Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Engineering Academy?
Tidak diperlukan pengalaman sebelumnya. AI Engineering Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Jendela Konteks: Ukuran dan Implikasinya” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Engineering Academy ini?
Ya. Setiap pelajaran AI Engineering Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Apa Itu Token?
- Jendela Konteks: Ukuran dan Implikasinya
- Menghitung dan Memprediksi Biaya API
- Strategi agar Tetap dalam Batas Konteks