Sesuaikan Ukuran Instans dan Replika
Sesuaikan perangkat keras dengan profil beban nyata.
Sesuaikan Ukuran Instans dan Replika adalah pelajaran MLOps Academy gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar MLOps Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus MLOps Academy mencakup 4 pelajaran total.
Bayar Sesuai Pemakaian
Sebagian besar biaya penyajian ML berasal dari instans yang hanya terpakai sebagian. Penyesuaian ukuran berarti mencocokkan perangkat keras dan jumlah replika dengan beban nyata Anda, bukan dengan kekhawatiran terhadap kondisi terburuk.
Ukur Sebelum Mengurangi
Anda tidak dapat menyesuaikan ukuran sesuatu yang belum diukur. Mulailah dengan mengamati utilisasi CPU dan memori yang sebenarnya selama hari dengan lalu lintas normal.
Jebakan Penyediaan Berlebih
Memilih instans raksasa untuk berjaga-jaga memang terasa aman, tetapi menghabiskan uang setiap jam. Utilisasi rendah yang terus-menerus adalah tanda paling jelas dari penyediaan berlebih.
Baca Utilisasi Anda
Jika rata-rata CPU berada di sekitar 15 persen, instans Anda terlalu besar. Targetkan utilisasi sasaran yang sehat dengan ruang cadangan untuk lonjakan singkat.
kubectl top pods -n servingVertikal vs Horizontal
Penskalaan vertikal memberikan mesin yang lebih besar kepada satu replika. Penskalaan horizontal menambahkan lebih banyak replika kecil, yang biasanya menangani lalu lintas yang melonjak dengan lebih baik.
Tetapkan Permintaan dan Batas
Di Kubernetes, permintaan sumber daya Anda memberi tahu penjadwal jumlah yang benar-benar dibutuhkan setiap replika. Tetapkan berdasarkan penggunaan yang diamati, bukan perkiraan kasar.
resources:
requests:
cpu: "500m"
memory: "1Gi"Pilih Jumlah Replika yang Tepat
Terlalu sedikit replika berarti permintaan mengantre dan respons menjadi lambat. Terlalu banyak berarti pod menganggur yang tetap harus Anda bayar. Sesuaikan replika dengan beban serentak puncak Anda.
Biarkan Penskalaan Otomatis Mengikuti Permintaan
Horizontal Pod Autoscaler menambahkan replika saat beban meningkat dan menghapusnya saat beban menurun, sehingga Anda tidak perlu membayar kapasitas di luar jam sibuk.
kubectl autoscale deploy model --min 2 --max 10 --cpu-percent 60Pertahankan Batas Aman
Jumlah replika minimum menjaga beberapa pod tetap siap sehingga lalu lintas tidak pernah tiba pada layanan kosong yang harus memulai dari awal. Inilah kompromi antara biaya dan ketersediaan.
Mesin GPU Mahal
Instans GPU berbiaya berkali-kali lipat dibandingkan CPU. Minta GPU hanya ketika model Anda benar-benar membutuhkannya, dan padatkan pekerjaan agar GPU tidak pernah menganggur.
Penyesuaian Ukuran Berkelanjutan
Pola lalu lintas berubah selama berminggu-minggu dan berbulan-bulan. Tinjau kembali jenis instans dan jumlah replika secara terjadwal agar armada Anda tetap sesuai.
Pemeriksaan Singkat
Mari kita lihat apa yang disampaikan oleh utilisasi rendah kepada Anda.
Rangkuman
Anda mengukur utilisasi, memilih antara penskalaan vertikal dan horizontal, menetapkan permintaan, serta menambahkan penskalaan otomatis. Kini armada Anda sesuai dengan permintaan nyata. 💸
Belajar Python dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 30
- Pelajaran
- 120
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Sesuaikan Ukuran Instans dan Replika” gratis?
Ya — teks lengkap “Sesuaikan Ukuran Instans dan Replika” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus MLOps Academy, upgrade ke CoddyKit PRO. Kursus MLOps Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Sesuaikan Ukuran Instans dan Replika”?
Sesuaikan perangkat keras dengan profil beban nyata. Kamu berlatih MLOps Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai MLOps Academy?
Tidak diperlukan pengalaman sebelumnya. MLOps Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.
Berapa lama pelajaran “Sesuaikan Ukuran Instans dan Replika” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran MLOps Academy ini?
Ya. Setiap pelajaran MLOps Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Sesuaikan Ukuran Instans dan Replika
- Kuantisasi dan Distilasi untuk Inferensi yang Lebih Murah
- Gunakan Instans Spot untuk Pelatihan
- Lacak Biaya per Prediksi