AI SaaS Builder · Pelajaran

Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan

Pelajari cara melindungi backend SaaS kecerdasan buatan Anda dari beban berlebih dan biaya tak terkendali dengan pembatasan laju, antrean permintaan, dan pengendalian tekanan balik yang baik.

Pelajaran 4 dari 413 langkah

Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan adalah pelajaran AI SaaS Builder gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI SaaS Builder, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI SaaS Builder mencakup 4 pelajaran total.

Mengapa Permintaan AI Perlu Dibatasi

Titik akhir AI lambat dan mahal. Tanpa batasan, beberapa pengguna (atau sebuah bug) dapat menghabiskan anggaran Anda atau membuat layanan mogok.

  • Mengendalikan biaya
  • Melindungi stabilitas
  • Menjamin keadilan

Dasar-Dasar Pembatasan Laju

Batas laju membatasi jumlah permintaan yang boleh dikirim klien dalam jangka waktu tertentu, misalnya 60 permintaan per menit.

Algoritme Token Bucket

Token bucket mengisi ulang token seiring waktu. Setiap permintaan menggunakan satu token; bucket yang kosong berarti permintaan ditolak atau harus menunggu.

class TokenBucket:
    def __init__(self, capacity, refill_per_sec):
        self.capacity = capacity
        self.tokens = capacity
        self.refill = refill_per_sec
    def allow(self):
        if self.tokens >= 1:
            self.tokens -= 1
            return True
        return False

Batas per Pengguna vs Global

Terapkan batas per pengguna demi keadilan dan batas global untuk melindungi seluruh sistem serta kuota penyedia Anda.

Mengembalikan 429

Saat klien melampaui batas, berikan respons HTTP 429 Terlalu Banyak Permintaan dan header Retry-After.

res.status(429)
   .set('Retry-After', '30')
   .json({ error: 'rate_limited' })

Mengapa Pekerjaan Panjang Perlu Diantrekan

Pembuatan AI dapat memerlukan waktu beberapa detik. Mempertahankan koneksi HTTP akan membuang sumber daya. Antrean memungkinkan Anda menerima pekerjaan dan memprosesnya secara asinkron.

Pola Antrean Pekerjaan

Terima permintaan, masukkan pekerjaan ke antrean, lalu segera kembalikan id pekerjaan. Pekerja mengambil pekerjaan dan menjalankan panggilan AI.

POST /generate -> { jobId: 'abc123', status: 'queued' }
# worker processes job
GET /jobs/abc123 -> { status: 'done', result: ... }

Tekanan Balik

Saat antrean menjadi terlalu panjang, terapkan tekanan balik: tolak pekerjaan baru berprioritas rendah atau beri tahu pengguna tentang keterlambatan, alih-alih menumpuknya secara diam-diam.

Batas Konkurensi untuk Pekerja

Batasi jumlah panggilan AI yang berjalan secara bersamaan untuk mematuhi batas penyedia Anda dan menjaga latensi tetap dapat diprediksi.

# worker config
MAX_CONCURRENT_AI_CALLS = 5

Percobaan Ulang dengan Jeda Bertahap

Penyedia AI terkadang gagal atau membatasi laju Anda. Coba ulang kesalahan sementara dengan jeda eksponensial, tetapi batasi jumlah percobaan untuk mencegah perulangan.

delay = base * (2 ** attempt)  # 1s, 2s, 4s, 8s ...

Keterpantauan

Lacak kedalaman antrean, tingkat penolakan, dan latensi rata-rata. Metrik memberi tahu Anda kapan harus menambah pekerja atau memperketat batas.

Pemeriksaan Singkat

Periksa pengetahuan Anda tentang penskalaan.

Rangkuman

Anda telah belajar melindungi backend AI dengan pembatasan laju (token bucket, per pengguna, dan global), mengembalikan respons 429, mengalihkan pekerjaan lambat ke antrean pekerjaan, menerapkan tekanan balik dan batas konkurensi, melakukan percobaan ulang dengan jeda bertahap, serta memantau kesehatan antrean.

Gratis untuk memulai

Belajar AI SaaS Builder dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
12
Pelajaran
47

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan” gratis?

Ya — teks lengkap “Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI SaaS Builder, upgrade ke CoddyKit PRO. Kursus AI SaaS Builder mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan”?

Pelajari cara melindungi backend SaaS kecerdasan buatan Anda dari beban berlebih dan biaya tak terkendali dengan pembatasan laju, antrean permintaan, dan pengendalian tekanan balik yang baik. Kamu berlatih AI SaaS Builder dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI SaaS Builder?

Tidak diperlukan pengalaman sebelumnya. AI SaaS Builder di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.

Berapa lama pelajaran “Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI SaaS Builder ini?

Ya. Setiap pelajaran AI SaaS Builder menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Merancang API RESTful
  2. Pengelolaan Basis Data untuk SaaS
  3. Autentikasi & Otorisasi Pengguna
  4. Pembatasan Laju dan Antrean Permintaan Kecerdasan Buatan
← Kembali ke AI SaaS Builder