Mengapa Konteks Panjang Tidak Berskala
Biaya meningkat secara linear, kualitas menurun, dan fenomena 'lost-in-the-middle' membuat model melupakan isi yang terkubur dalam prompt panjang.
Mengapa Konteks Panjang Tidak Berskala adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Lebih Besar Tidak Selalu Lebih Baik
Model modern memiliki jendela konteks yang sangat besar — 200 ribu, 1 juta, bahkan 2 juta token. Anda mungkin tergoda untuk "memasukkan semuanya" alih-alih membangun memori yang sebenarnya.
Pendekatan tersebut gagal dalam produksi karena tiga alasan.
Alasan 1: Biaya
Setiap token dalam setiap panggilan membutuhkan biaya. Perintah sistem berisi 100 ribu token dengan 1000 giliran = 100 juta token masukan, dengan total biaya puluhan dolar per sesi.
Penembolokan perintah membantu, tetapi tidak menghilangkan biaya tersebut.
Alasan 2: Latensi
Memproses 100 ribu token masukan menambah 1–3 detik hingga token pertama muncul. Untuk pengalaman pengguna percakapan, Anda menginginkan TTFT di bawah 500 md.
Alasan 3: Kualitas Menurun
Model kurang memperhatikan konten di bagian tengah perintah yang panjang — efek "hilang di tengah" yang didokumentasikan oleh Liu dkk. pada 2023.
Informasi di awal atau akhir diingat secara akurat; informasi di tengah sering terlewat.
Pengujian Konkret
Sisipkan fakta unik di berbagai posisi dalam dokumen panjang, lalu minta model mengambilnya kembali. Akurasinya:
- Awal dokumen: 95%
- Akhir dokumen: 90%
- Tengah: 50–70%
Konteks Panjang untuk Evaluasi, Bukan Produksi
Konteks panjang berguna untuk tugas satu kali (menganalisis seluruh basis kode ini), tetapi tidak cocok untuk agen produksi yang berjalan terus-menerus.
Untuk produksi, gunakan pencarian agar hanya 5% yang relevan yang dimasukkan pada setiap giliran.
Saat Konteks Panjang Membantu
- Analisis awal basis kode
- Tanya jawab seluruh dokumen dalam satu panggilan
- Perbandingan dua dokumen panjang
Tugas satu kali tanpa pemutaran ulang.
Saat Konteks Panjang Merugikan
- Bot percakapan dengan ratusan giliran
- Agen multitenan yang digunakan bersama oleh banyak pengguna
- Situasi apa pun yang memperhitungkan biaya atau latensi
Arsitektur yang Tepat
Untuk agen yang berjalan dalam waktu lama:
- Giliran terbaru dalam perintah (10–20 giliran terakhir)
- Giliran lama diringkas menjadi rangkuman yang terus diperbarui
- Fakta diubah menjadi vektor dan disimpan dalam memori jangka panjang
- Ambil K memori paling relevan pada setiap giliran
Pendekatan Hibrida
Gabungkan beberapa teknik:
messages = [
{'role': 'system', 'content': PERSONA},
{'role': 'system', 'content': f'Conversation summary so far: {summary}'},
{'role': 'system', 'content': f'Relevant past facts: {retrieved_facts}'},
*last_n_turns,
]Pemicu Pemadatan
Tentukan WHEN harus melakukan pemadatan:
- Setiap N giliran (sederhana)
- Saat jumlah token > ambang batas (lebih baik)
- Saat model mulai lupa (terbaik, tetapi sulit dideteksi)
Hilang di Tengah
Apa yang dimaksud dengan efek "hilang di tengah"?
Rangkuman
Jangan mengatasi masalah memori dengan memaksimalkan konteks. Gunakan rangkuman + pencarian untuk menampilkan hal yang penting pada setiap giliran.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Mengapa Konteks Panjang Tidak Berskala” gratis?
Ya — teks lengkap “Mengapa Konteks Panjang Tidak Berskala” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Mengapa Konteks Panjang Tidak Berskala”?
Biaya meningkat secara linear, kualitas menurun, dan fenomena 'lost-in-the-middle' membuat model melupakan isi yang terkubur dalam prompt panjang. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Mengapa Konteks Panjang Tidak Berskala” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Memori Jangka Pendek di Jendela Konteks
- Mengapa Konteks Panjang Tidak Berskala
- Perangkuman sebagai Kompresi
- Penyimpanan Memori Sederhana (Kunci-Nilai)