Skalakan hingga Nol dan Aktifkan Kembali
Hemat biaya dengan penskalaan otomatis berdasarkan permintaan.
Skalakan hingga Nol dan Aktifkan Kembali adalah pelajaran MLOps Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar MLOps Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus MLOps Academy mencakup 4 pelajaran total.
Model Menganggur Tetap Menghabiskan Biaya
Pod model yang tidak menerima lalu lintas tetap menghabiskan CPU, memori, dan biaya cloud. KServe dapat mengecilkan layanan yang menganggur hingga habis. Scale to zero menghentikan pemborosan tersebut. 💸
Didukung oleh Knative
Mode tanpa server KServe berjalan di atas Knative, yang memantau volume permintaan dan menyesuaikan replika. Saat lalu lintas berhenti, Knative dapat menghapus semua pod untuk layanan tersebut.
Penskalaan Otomatis Berbasis Permintaan
Jumlah replika mengikuti kebutuhan, bukan jadwal tetap. Saat permintaan meningkat, KServe menambahkan pod, dan saat permintaan berkurang, KServe menguranginya. Inilah penskalaan otomatis request-driven.
Menetapkan minReplicas ke Nol
Untuk mengizinkan penurunan skala sepenuhnya, tetapkan minReplicas ke 0 dalam spesifikasi predictor. Dengan mengizinkan nol, layanan yang menganggur tidak memiliki pod yang berjalan sama sekali.
spec:
predictor:
minReplicas: 0
model:
modelFormat:
name: sklearnTarget Konkurensi
Penskala otomatis menargetkan jumlah permintaan yang sedang diproses pada setiap pod. Target concurrency ini menentukan seberapa agresif KServe menambahkan replika saat menerima beban.
metadata:
annotations:
autoscaling.knative.dev/target: "10"Menaikkan Skala Kembali
Saat permintaan tiba di layanan yang skalanya telah menjadi nol, Knative menyalakan pod sesuai kebutuhan. Lalu lintas berlanjut segera setelah pod siap, sehingga scale up berlangsung otomatis.
Biaya Cold Start
Permintaan pertama setelah skala menjadi nol harus menunggu pod dimulai dan model dimuat. Penundaan ini disebut cold start, dan merupakan kompromi utama dari penskalaan ke nol. ⏱️
Kapan Skala Nol Tepat Digunakan
Penskalaan ke nol sangat bermanfaat untuk beban kerja yang muncul secara tiba-tiba atau jarang, ketika waktu menganggur mendominasi. Untuk lalu lintas stabil yang kritis terhadap latensi, penalti cold start mungkin tidak sepadan.
Pertahankan Satu Instance yang Selalu Siap
Jika cold start mengganggu, tetapkan minReplicas ke 1 agar satu pod selalu aktif. Anda menukar sedikit biaya dengan instance warm yang dijamin siap melayani.
spec:
predictor:
minReplicas: 1Batasi Batas Atas
Anda juga dapat membatasi pertumbuhan dengan maxReplicas agar lonjakan lalu lintas tidak pernah melampaui anggaran klaster. Ini menetapkan batas atas bagi penskala otomatis.
spec:
predictor:
minReplicas: 0
maxReplicas: 5Pantau Penskalaannya
Anda dapat mengonfirmasi perilaku ini dengan mengamati pod yang muncul dan menghilang seiring lalu lintas. Jumlah pod turun menjadi nol saat tidak ada aktivitas dan meningkat kembali saat panggilan masuk.
kubectl get pods -l serving.kserve.io/inferenceservice=sklearn-iris -wPemeriksaan Singkat
Apa kekurangan utama jika layanan diizinkan melakukan penskalaan hingga nol?
Ringkasan
Anda telah melihat bagaimana minReplicas: 0 memungkinkan KServe mengecilkan model yang menganggur hingga nol dan menaikkannya kembali sesuai permintaan. Batasi dengan maxReplicas, dan pertahankan satu instance yang selalu siap jika cold start mengganggu. Kemajuan yang hebat! 🎉
Belajar Python dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Skalakan hingga Nol dan Aktifkan Kembali” gratis?
Ya — teks lengkap “Skalakan hingga Nol dan Aktifkan Kembali” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus MLOps Academy, upgrade ke CoddyKit PRO. Kursus MLOps Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Skalakan hingga Nol dan Aktifkan Kembali”?
Hemat biaya dengan penskalaan otomatis berdasarkan permintaan. Kamu berlatih MLOps Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai MLOps Academy?
Tidak diperlukan pengalaman sebelumnya. MLOps Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Skalakan hingga Nol dan Aktifkan Kembali” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran MLOps Academy ini?
Ya. Setiap pelajaran MLOps Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Resource InferenceService
- Skalakan hingga Nol dan Aktifkan Kembali
- Tulis Predictor Kustom
- KServe vs Seldon Core