Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan
Pelajari cara melindungi backend SaaS kecerdasan buatan Anda dari beban berlebih dan biaya tak terkendali dengan pembatasan laju, antrean permintaan, dan pengendalian tekanan balik yang baik.
Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan adalah pelajaran AI SaaS Builder gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI SaaS Builder, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI SaaS Builder mencakup 4 pelajaran total.
Mengapa Permintaan AI Perlu Dibatasi
Titik akhir AI lambat dan mahal. Tanpa batasan, beberapa pengguna (atau sebuah bug) dapat menghabiskan anggaran Anda atau membuat layanan mogok.
- Mengendalikan biaya
- Melindungi stabilitas
- Menjamin keadilan
Dasar-Dasar Pembatasan Laju
Batas laju membatasi jumlah permintaan yang boleh dikirim klien dalam jangka waktu tertentu, misalnya 60 permintaan per menit.
Algoritme Token Bucket
Token bucket mengisi ulang token seiring waktu. Setiap permintaan menggunakan satu token; bucket yang kosong berarti permintaan ditolak atau harus menunggu.
class TokenBucket:
def __init__(self, capacity, refill_per_sec):
self.capacity = capacity
self.tokens = capacity
self.refill = refill_per_sec
def allow(self):
if self.tokens >= 1:
self.tokens -= 1
return True
return FalseBatas per Pengguna vs Global
Terapkan batas per pengguna demi keadilan dan batas global untuk melindungi seluruh sistem serta kuota penyedia Anda.
Mengembalikan 429
Saat klien melampaui batas, berikan respons HTTP 429 Terlalu Banyak Permintaan dan header Retry-After.
res.status(429)
.set('Retry-After', '30')
.json({ error: 'rate_limited' })Mengapa Pekerjaan Panjang Perlu Diantrekan
Pembuatan AI dapat memerlukan waktu beberapa detik. Mempertahankan koneksi HTTP akan membuang sumber daya. Antrean memungkinkan Anda menerima pekerjaan dan memprosesnya secara asinkron.
Pola Antrean Pekerjaan
Terima permintaan, masukkan pekerjaan ke antrean, lalu segera kembalikan id pekerjaan. Pekerja mengambil pekerjaan dan menjalankan panggilan AI.
POST /generate -> { jobId: 'abc123', status: 'queued' }
# worker processes job
GET /jobs/abc123 -> { status: 'done', result: ... }Tekanan Balik
Saat antrean menjadi terlalu panjang, terapkan tekanan balik: tolak pekerjaan baru berprioritas rendah atau beri tahu pengguna tentang keterlambatan, alih-alih menumpuknya secara diam-diam.
Batas Konkurensi untuk Pekerja
Batasi jumlah panggilan AI yang berjalan secara bersamaan untuk mematuhi batas penyedia Anda dan menjaga latensi tetap dapat diprediksi.
# worker config
MAX_CONCURRENT_AI_CALLS = 5Percobaan Ulang dengan Jeda Bertahap
Penyedia AI terkadang gagal atau membatasi laju Anda. Coba ulang kesalahan sementara dengan jeda eksponensial, tetapi batasi jumlah percobaan untuk mencegah perulangan.
delay = base * (2 ** attempt) # 1s, 2s, 4s, 8s ...Keterpantauan
Lacak kedalaman antrean, tingkat penolakan, dan latensi rata-rata. Metrik memberi tahu Anda kapan harus menambah pekerja atau memperketat batas.
Pemeriksaan Singkat
Periksa pengetahuan Anda tentang penskalaan.
Rangkuman
Anda telah belajar melindungi backend AI dengan pembatasan laju (token bucket, per pengguna, dan global), mengembalikan respons 429, mengalihkan pekerjaan lambat ke antrean pekerjaan, menerapkan tekanan balik dan batas konkurensi, melakukan percobaan ulang dengan jeda bertahap, serta memantau kesehatan antrean.
Belajar AI SaaS Builder dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 12
- Pelajaran
- 47
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan” gratis?
Ya — teks lengkap “Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI SaaS Builder, upgrade ke CoddyKit PRO. Kursus AI SaaS Builder mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan”?
Pelajari cara melindungi backend SaaS kecerdasan buatan Anda dari beban berlebih dan biaya tak terkendali dengan pembatasan laju, antrean permintaan, dan pengendalian tekanan balik yang baik. Kamu berlatih AI SaaS Builder dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI SaaS Builder?
Tidak diperlukan pengalaman sebelumnya. AI SaaS Builder di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI SaaS Builder ini?
Ya. Setiap pelajaran AI SaaS Builder menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Merancang API RESTful
- Pengelolaan Basis Data untuk SaaS
- Autentikasi & Otorisasi Pengguna
- Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan