Menyimpan Awalan Panjang dalam Tembolok
Mengendalikan biaya dengan penyimpanan prompt dalam tembolok.
Menyimpan Awalan Panjang dalam Tembolok adalah pelajaran AI Prompt Engineering gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Prompt Engineering, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Mengapa Penembolokan Awalan Ada
Setiap perintah panjang harus membayar biaya pengisian awal untuk menyandikan tokennya sebelum menghasilkan keluaran. Ketika awalan panjang yang sama berulang dalam banyak panggilan—perintah sistem, spesifikasi alat, atau dokumen rujukan besar—penembolokan perintah memungkinkan penyedia menggunakan kembali keadaan perhatian yang telah dihitung, alih-alih menghitungnya kembali.
- Penggunaan tembolok yang berhasil memangkas latensi dan biaya masukan secara drastis.
- Penghematan meningkat seiring ukuran awalan dan frekuensi penggunaannya kembali.
Penembolokan Berpatokan pada Awalan
Tembolok menggunakan kecocokan awalan token yang persis dari awal perintah sebagai kuncinya. Rentang yang disimpan dalam tembolok berjalan dari awal hingga titik perbedaan pertama. Ubah apa pun di bagian awal, maka semua bagian setelahnya tidak lagi cocok dengan tembolok.
Implikasinya: tata letak yang memaksimalkan kecocokan menempatkan konten paling stabil di awal dan konten paling berubah-ubah di akhir.
# Cache reuse covers: [identical prefix .... first difference)
# One early edit invalidates the whole downstream cache.Urutkan Berdasarkan Stabilitas
Susun konten dari yang paling stabil hingga yang paling tidak stabil: aturan sistem dan definisi alat yang tidak berubah, lalu materi rujukan besar yang stabil, kemudian konteks yang stabil sepanjang sesi, dan terakhir masukan serta pertanyaan yang berubah-ubah untuk setiap permintaan.
- Stabil -> depan (dapat disimpan dalam tembolok).
- Berubah-ubah -> belakang (satu-satunya bagian yang dihitung ulang).
Prinsip pengurutan tunggal ini mendorong sebagian besar keuntungan penembolokan.
prompt = [
SYSTEM_RULES, # never changes
TOOL_SPECS, # rarely changes
REFERENCE_CORPUS, # stable for the session
USER_TURN # changes every call -> keep last
]Titik Pemisah Tembolok
Beberapa penyedia memungkinkan Anda menandai titik pemisah tembolok secara eksplisit. Letakkan titik tersebut di akhir setiap segmen yang stabil agar sistem dapat menyimpan hingga titik itu. Tandai blok stabil terbesar (korpus rujukan atau perintah sistem yang panjang) agar dapat disimpan dalam tembolok.
Tanpa penanda eksplisit, tetap susun struktur berdasarkan urutan stabilitas agar pencocokan awalan implisit tetap membantu.
blocks = [
{'text': SYSTEM_RULES, 'cache': True},
{'text': REFERENCE_CORPUS, 'cache': True}, # big win
{'text': user_turn} # uncached
]Waspadai Pergeseran Awalan Tersembunyi
Perubahan kecil yang tidak disengaja dapat diam-diam merusak penembolokan: cap waktu dalam perintah sistem, id per permintaan yang disisipkan di bagian awal, definisi alat yang diurutkan ulang, atau urutan kunci JSON yang tidak deterministik. Masing-masing menggeser awalan dan memaksa penghitungan ulang secara penuh.
Periksa awalan Anda untuk menemukan apa pun yang berubah di antara panggilan, lalu pindahkan ke setelah wilayah yang disimpan dalam tembolok.
# BAD: dynamic value early -> kills cache
# system = 'Session ' + str(uuid4()) + ' rules: ...'
# GOOD: keep system static; put the id in the tail user turn.TTL dan Masa Berlaku Cache
Cache kedaluwarsa setelah masa berlaku yang ditentukan penyedia, dan sering diperbarui setiap kali terjadi hit. Miss dingin akan berulang jika pemanggilan terlalu jarang. Untuk beban kerja yang terjadi secara berkelompok dan berfrekuensi tinggi, caching menguntungkan; untuk pemanggilan yang jarang dan tersebar, cache mungkin kedaluwarsa di antara penggunaan.
Sesuaikan pola lalu lintas Anda dengan TTL, dan pertimbangkan ping keep-alive untuk prefiks yang bernilai penting.
Model Biaya Caching
Caching biasanya mengenakan biaya tambahan kecil untuk menulis entri cache dan potongan biaya besar untuk membacanya. Secara ekonomi, penggunaan ulang lebih menguntungkan: satu penulisan yang dibagi ke banyak pembacaan menghasilkan penghematan bersih yang besar; satu kali penggunaan yang hanya melakukan penulisan bisa sedikit lebih mahal.
- Penggunaan ulang tinggi -> gunakan cache secara agresif.
- Prefiks sekali pakai -> caching mungkin tidak menguntungkan.
def worth_caching(prefix_tokens, expected_reuses, write_mult, read_mult):
no_cache = expected_reuses
cached = write_mult + read_mult * (expected_reuses - 1)
return cached < no_cache # in normalized prefix-cost unitsMerancang Blok Sistem yang Stabil
Buat perintah sistem dan spesifikasi alat Anda deterministik serta terikat pada versi tertentu. Urutkan definisi alat secara kanonis, hindari menyematkan data dinamis, dan ubah hanya dalam rilis yang disengaja. Blok sistem yang stabil menjadi entri cache berumur panjang dengan hit tinggi, yang digunakan bersama oleh semua permintaan.
Perlakukan prefiks yang di-cache sebagai artefak dengan versi, bukan sebagai string yang diubah sembarangan.
TOOLS = sorted(tool_defs, key=lambda t: t['name']) # canonical order
SYSTEM_VERSION = 'v3' # change deliberately, not per requestCaching pada Agen Multi-Giliran
Dalam loop agen, percakapan yang terus bertambah menjadi cache alami: setiap giliran memperpanjang prefiks yang akan digunakan ulang oleh giliran berikutnya. Tambahkan giliran baru di bagian akhir dan jangan pernah menulis ulang giliran sebelumnya, agar cache terdahulu tetap valid.
Saat Anda harus memadatkan percakapan, lakukan dengan cara yang menghasilkan prefiks stabil baru untuk giliran-giliran berikutnya, alih-alih berulang kali mengubah prefiks lama.
Mengukur Efektivitas Cache
Pasang instrumentasi. Sebagian besar penyedia melaporkan token input yang di-cache dan yang tidak di-cache untuk setiap pemanggilan. Lacak rasio hit, dan jika rendah, periksa prefiks untuk mencari perubahan yang tidak diinginkan. Penurunan rasio hit biasanya menunjukkan adanya nilai dinamis yang baru dimasukkan di bagian awal perintah.
- Catat token_tercache / total_token_input.
- Buat peringatan saat rasio hit turun setelah penerapan.
hit_rate = usage['cache_read_input_tokens'] / max(1, usage['input_tokens'])
assert hit_rate > 0.6, 'prefix drift suspected'Tata Letak Perintah yang Sadar-Caching
Untuk mengendalikan biaya pada prefiks panjang: urutkan konten berdasarkan kestabilannya, tandai blok stabil terbesar sebagai titik pemisah cache, hilangkan perubahan tersembunyi, tetapkan dan versikan blok sistem/alat, gunakan penambahan saja dalam loop agen, dan pantau rasio hit. Tujuannya adalah satu prefiks besar yang dapat digunakan ulang serta ekor kecil yang mudah berubah dan dihitung ulang pada setiap pemanggilan.
Pemeriksaan Singkat
Anda menggunakan ulang korpus referensi 100 ribu token dalam ribuan kueri harian, tetapi rasio hit cache Anda hampir nol.
Ringkasan: Caching Prefiks Panjang
Caching perintah menggunakan ulang proses prapengisian dari prefiks yang persis sama dan stabil, sehingga sangat mengurangi latensi dan biaya input ketika frekuensi penggunaan ulang tinggi. Urutkan konten dengan yang paling stabil di awal, tandai blok stabil yang besar sebagai titik pemisah, dan dorong semua perubahan ke bagian akhir. Hilangkan perubahan tersembunyi, tetapkan dan versikan blok sistem/alat, gunakan penambahan saja dalam loop agen, dan pantau rasio hit agar penurunan menunjukkan nilai baru yang berubah di bagian awal.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Menyimpan Awalan Panjang dalam Tembolok” gratis?
Ya — teks lengkap “Menyimpan Awalan Panjang dalam Tembolok” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Prompt Engineering, upgrade ke CoddyKit PRO. Kursus AI Prompt Engineering mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Menyimpan Awalan Panjang dalam Tembolok”?
Mengendalikan biaya dengan penyimpanan prompt dalam tembolok. Kamu berlatih AI Prompt Engineering dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Prompt Engineering?
Tidak diperlukan pengalaman sebelumnya. AI Prompt Engineering di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Menyimpan Awalan Panjang dalam Tembolok” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Prompt Engineering ini?
Ya. Setiap pelajaran AI Prompt Engineering menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Jendela Konteks Sejuta Token
- Hilang di Tengah
- Menstrukturkan Prompt Besar
- Menyimpan Awalan Panjang dalam Tembolok