Konfigurasikan Penskalaan Otomatis dan Konkurensi
Sesuaikan skala instans dengan lalu lintas yang masuk.
Konfigurasikan Penskalaan Otomatis dan Konkurensi adalah pelajaran MLOps Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar MLOps Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus MLOps Academy mencakup 4 pelajaran total.
Sesuaikan Kapasitas dengan Permintaan
Penskalaan otomatis menambahkan instans kontainer saat lalu lintas meningkat dan menghapusnya saat lalu lintas menurun. Anda dapat melayani lonjakan tanpa membayar mesin yang menganggur. 📈
Konkruensi per Instans
Konkruensi adalah jumlah permintaan yang ditangani satu instans secara bersamaan. Inilah pengatur yang menentukan kapan platform menambahkan instans.
Perhitungan Penskalaan
Platform membagi beban yang masuk dengan konkruensi Anda untuk menentukan jumlah instans. Konkruensi yang lebih rendah berarti lebih banyak instans untuk lalu lintas yang sama.
Tetapkan Konkruensi Maksimum
Di Cloud Run, Anda membatasi jumlah permintaan per instans dengan --concurrency. Sesuaikan nilainya dengan jumlah panggilan yang dapat dilayani model Anda tanpa melambat.
gcloud run deploy model-api --concurrency 8Model Berat Memerlukan Angka Rendah
Jika setiap prediksi sangat membebani CPU, konkruensi yang tinggi membuat setiap permintaan kekurangan sumber daya. Tetapkan nilainya rendah agar platform membagi beban ke lebih banyak instans.
Batasi Jumlah Maksimum
Banjir lalu lintas dapat membuat instans bertambah tanpa batas dan menghasilkan tagihan besar. Batas instans maksimum melindungi anggaran dan basis data di hilir.
gcloud run deploy model-api --max-instances 20Penskalaan ke Nol Menghemat Biaya
Dengan jumlah instans minimum nol, platform menghapus semua kontainer saat tidak aktif. Anda tidak membayar apa pun di antara permintaan, tetapi harus menanggung mulai dingin.
Sesuaikan CPU dan Memori
Setiap instans memperoleh CPU dan memori yang Anda minta. Model besar memerlukan memori yang cukup untuk dimuat, atau kontainer akan mengalami kerusakan saat memulai.
gcloud run deploy model-api --memory 2Gi --cpu 2Pantau Antrean Permintaan
Saat semua instans mencapai batas konkruensinya, permintaan baru menunggu dalam antrean. Waktu antrean yang meningkat menandakan bahwa Anda perlu mempercepat penskalaan keluar.
Uji Beban untuk Menemukan Titik Optimal
Pilih pengaturan berdasarkan pengukuran, bukan perkiraan. Lakukan uji beban pada lalu lintas yang meningkat dan pantau latensi untuk menemukan konkruensi yang memenuhi SLA Anda.
Dua Pengatur, Satu Tujuan
Konkruensi dan batas instans bekerja sama untuk menyeimbangkan latensi dan biaya. Sesuaikan keduanya agar pengguna dilayani dengan cepat tanpa pengeluaran berlebihan.
Pemeriksaan Singkat
Mari periksa hal yang sebenarnya dikendalikan oleh konkruensi.
Rangkuman
Anda telah menyesuaikan konkruensi, membatasi jumlah instans maksimum, menyesuaikan ukuran sumber daya, dan melakukan uji beban. Kini layanan Anda menyesuaikan skala dengan kebutuhan dan anggaran. ⚖️
Belajar Python dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Konfigurasikan Penskalaan Otomatis dan Konkurensi” gratis?
Ya — teks lengkap “Konfigurasikan Penskalaan Otomatis dan Konkurensi” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus MLOps Academy, upgrade ke CoddyKit PRO. Kursus MLOps Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Konfigurasikan Penskalaan Otomatis dan Konkurensi”?
Sesuaikan skala instans dengan lalu lintas yang masuk. Kamu berlatih MLOps Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai MLOps Academy?
Tidak diperlukan pengalaman sebelumnya. MLOps Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.
Berapa lama pelajaran “Konfigurasikan Penskalaan Otomatis dan Konkurensi” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran MLOps Academy ini?
Ya. Setiap pelajaran MLOps Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Kirim Image ke Registry
- Terapkan ke Runtime Kontainer Tanpa Server
- Konfigurasikan Penskalaan Otomatis dan Konkurensi
- Kelola Rahasia dan Konfigurasi di Cloud