Jendela Konteks Sejuta Token
Peluang dan jebakan.
Jendela Konteks Sejuta Token adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Manfaat Satu Juta Token
Jendela berkapasitas satu juta token memungkinkan Anda menempatkan seluruh basis kode, kumpulan dokumen, atau transkrip berdurasi berjam-jam langsung ke dalam konteks — tanpa memerlukan sistem pengambilan. Janjinya adalah segala sesuatu dalam konteks: model bernalar berdasarkan bahan mentah, bukan ringkasan yang kehilangan sebagian informasi.
- Penalaran dan refaktor seluruh repositori.
- Sintesis lintas dokumen tanpa pemotongan menjadi bagian-bagian.
- Percakapan jangka panjang yang mempertahankan detail awal.
Namun, kapasitas tidak sama dengan penggunaan yang efektif.
Kapasitas dibandingkan Konteks Efektif
Jendela yang diiklankan adalah batas atas, bukan jaminan pengingatan yang seragam. Konteks efektif — rentang yang dapat diambil dan dipikirkan model secara andal — biasanya lebih kecil dan tidak merata di berbagai posisi.
Perlakukan jendela sebagai anggaran dengan nilai yang tidak seragam: token di dekat tepi lebih mudah diingat daripada token yang terkubur di bagian tengah.
Kenyataan Latensi dan Biaya
Biaya perhatian bertambah seiring panjang konteks, begitu pula waktu hingga token pertama. Perintah sepanjang satu juta token dapat berarti latensi prapengisian selama beberapa detik dan biaya per panggilan yang besar, meskipun jawabannya singkat.
- Prapengisian mendominasi latensi untuk perintah yang sangat besar.
- Biaya meningkat sesuai jumlah token masukan, terlepas dari ukuran keluaran.
- Memasukkan konteks yang tidak Anda perlukan berarti membayar untuk membingungkan model.
# Rough mental model: input tokens drive both $ and prefill ms.
# 900k tokens of haystack to answer one question is rarely optimal.Gangguan dan Pengenceran
Lebih banyak konteks dapat menurunkan akurasi. Bahan yang tidak relevan mengencerkan perhatian dan memperkenalkan pengalih perhatian yang mungkin menjadi fokus model. Perintah terarah sepanjang 20 ribu token sering kali lebih baik daripada perintah bising sepanjang 500 ribu token untuk pertanyaan tertentu.
Aturannya: sertakan hal yang membantu tugas, singkirkan hal yang sekadar mungkin relevan.
Kapan Konteks Panjang Mengungguli Pengambilan
Konteks panjang unggul ketika tugas memerlukan penalaran global dan lintas bagian yang akan terpecah jika menggunakan pengambilan: 'temukan setiap tempat pelanggaran invarian ini di seluruh repositori', 'selaraskan kontradiksi di antara kesepuluh kontrak'. Pengambilan berbasis potongan dapat melewatkan hubungan yang melintasi beberapa potongan.
Gunakan konteks penuh untuk sintesis; gunakan pengambilan untuk pencarian informasi kecil dalam kumpulan yang sangat besar.
Kapan Pengambilan Mengungguli Konteks Panjang
Pengambilan unggul ketika bagian yang relevan sangat kecil dan stabil. Mengambil 5 halaman yang relevan dari 50.000 halaman lebih murah, lebih cepat, dan sering kali lebih akurat daripada memasukkan seluruh 50.000 halaman lalu berharap model menemukannya.
- Permintaan berulang atas kumpulan statis -> buat indeks sekali, ambil dengan murah.
- Sintesis global satu kali -> gunakan konteks panjang.
Banyak sistem menggabungkan keduanya: lakukan pengambilan untuk mempersempit, lalu gunakan konteks panjang untuk menyintesis.
def route(task):
if task.is_global_synthesis: return 'long_context'
if task.relevant_fraction < 0.05: return 'retrieval'
return 'hybrid'Posisi adalah Sumber Daya
Karena pengingatan berbeda menurut posisi, di mana Anda menempatkan konten merupakan keputusan desain. Letakkan instruksi tugas dan bahan paling penting di batas-batas yang paling baik diingat model, serta hindari mengubur fakta yang wajib digunakan di bagian tengah yang dalam.
Kelola posisi dengan sengaja, bukan berdasarkan kebetulan urutan penggabungan.
Memverifikasi Pengingatan Konteks Panjang
Jangan pernah berasumsi bahwa model menggunakan fakta yang terkubur. Ujilah. Sisipkan fakta penanda yang diketahui pada kedalaman yang diketahui dan minta model mengembalikannya; ukur pengingatan pada berbagai kedalaman untuk memahami karakteristik model Anda pada bentuk perintah Anda sebelum mengandalkannya dalam produksi.
canary = 'The internal code name is BLUE_HERON.'
# Place at depth d, then ask: 'What is the internal code name?'
# Sweep d across the window to map recall vs position.Pemadatan, bukan Penumpukan
Dalam sesi agen yang panjang, jangan biarkan konteks bertambah tanpa batas. Lakukan pemadatan secara berkala: rangkum giliran percakapan yang sudah usang menjadi objek keadaan yang padat dan buang riwayat mentahnya. Ini mempertahankan sinyal sekaligus menghemat anggaran dan mengurangi pengenceran.
Penumpukan adalah bawaan sekaligus jebakan; pemadatan adalah kedisiplinan.
state = summarize(old_turns) # dense facts, decisions, open items
context = [system, state] + recent_turnsArsitektur Hibrida
Desain terkuat memadukan berbagai strategi: ambil kumpulan kandidat yang terarah, tempatkan dengan posisi yang disengaja, simpan awalan yang stabil dalam cache, dan padatkan percakapan. Konteks panjang hanyalah salah satu alat dalam perangkat pengelolaan anggaran, bukan pengganti rekayasa.
- Lakukan pengambilan untuk memperkecil.
- Atur posisi untuk menonjolkan.
- Simpan dalam cache untuk menghemat.
- Padatkan untuk mempertahankan.
Heuristik Pengambilan Keputusan
Sebelum menggunakan seluruh jendela, tanyakan:
- Apakah tugas memerlukan penalaran global atau pencarian informasi kecil? Pencarian kecil -> lakukan pengambilan.
- Apakah bagian yang relevan kecil dan stabil? Ya -> lakukan pengambilan/simpan dalam cache.
- Apakah latensi/biaya prapengisian besar dapat diterima? Tidak -> perkecil.
- Apakah saya sudah memverifikasi pengingatan pada kedalaman yang saya andalkan? Jika belum, lakukan pengujian terlebih dahulu.
Kapasitas adalah izin, bukan rencana.
Pemeriksaan Singkat
Anda harus menjawab satu pertanyaan faktual yang sangat spesifik, yang hanya terdapat pada kira-kira 3 halaman dari arsip statis berisi 40.000 halaman, dan Anda akan menjalankan kueri ini ribuan kali sehari.
Ringkasan: Jendela Sejuta Token
Jendela yang sangat besar adalah anggaran yang tidak seragam, bukan kemampuan mengingat tanpa batas. Konteks efektif lebih kecil daripada kapasitas, latensi dan biaya meningkat seiring masukan, serta materi yang tidak relevan mengurangi akurasi. Gunakan konteks panjang untuk sintesis menyeluruh, pengambilan untuk informasi spesifik, dan pendekatan hibrida untuk sisanya—dengan menempatkan konten penting di zona dengan daya ingat kuat, menyimpan awalan yang stabil dalam tembolok, memadatkan sesi yang panjang, dan selalu menguji daya ingat sebelum mempercayai fakta yang tersembunyi di dalamnya.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Jendela Konteks Sejuta Token” gratis?
Ya — teks lengkap “Jendela Konteks Sejuta Token” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Jendela Konteks Sejuta Token”?
Peluang dan jebakan. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?
Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.
Berapa lama pelajaran “Jendela Konteks Sejuta Token” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?
Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Jendela Konteks Sejuta Token
- Hilang di Tengah
- Menstrukturkan Prompt Besar
- Menyimpan Awalan Panjang dalam Tembolok