0Pricing
MLOps Academy · Pelajaran

Jalankan Beberapa Instans Model per GPU

Gunakan eksekusi konkuren untuk meningkatkan utilisasi.

Jalankan Beberapa Instans Model per GPU adalah pelajaran MLOps Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar MLOps Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus MLOps Academy mencakup 4 pelajaran total.

Satu Salinan Dapat Menghambat

Dengan satu salinan model, permintaan kedua harus menunggu saat permintaan pertama berjalan. Bahkan GPU yang cepat dapat menjadi menganggur di antara pemanggilan, sehingga throughput tidak termanfaatkan sepenuhnya.

Jalankan Beberapa Salinan

Triton dapat memuat beberapa instans dari model yang sama agar beberapa permintaan dieksekusi secara bersamaan dan pekerjaannya saling tumpang tindih di GPU.

Blok instance_group

Anda mendeklarasikan salinan dengan instance_group di config.pbtxt. Kolom count menyatakan jumlah instans yang harus dibuat Triton untuk model tersebut.

instance_group {
  count: 2
  kind: KIND_GPU
}

Pilih GPU atau CPU

Kolom kind memilih perangkat. KIND_GPU menjalankan instans di GPU, sedangkan KIND_CPU menjalankannya di prosesor host.

Tempatkan di GPU

Anda dapat mengikat instans ke kartu tertentu dengan daftar gpus. Dengan begitu, satu model dapat menyebarkan salinannya ke beberapa GPU dalam server yang sama.

instance_group {
  count: 2
  kind: KIND_GPU
  gpus: [ 0, 1 ]
}

Mengapa Ini Membantu

Saat satu instans melakukan perhitungan, instans lain dapat memuat input atau menyalin hasil. Tumpang tindih ini menutupi jeda menganggur dan meningkatkan utilisasi secara keseluruhan.

Berpasangan dengan Batching

Instans dan batching dinamis bekerja bersama. Batching memenuhi setiap pemanggilan, sedangkan beberapa instans menjaga lebih dari satu pemanggilan tetap berjalan secara bersamaan.

Perhatikan Memori

Setiap instans menyimpan salinan bobotnya sendiri di memori GPU. Terlalu banyak salinan akan membuat VRAM habis, jadi naikkan jumlahnya secara bertahap.

Lebih Banyak Tidak Selalu Lebih Cepat

Setelah melewati titik tertentu, instans tambahan hanya berebut komputasi yang sama. Throughput akan mendatar atau menurun, jadi jumlah terbaik ditentukan melalui pengukuran, bukan tebakan.

Pertimbangkan Konkurensi

Jumlah instans yang tepat bergantung pada banyaknya permintaan yang tiba sekaligus. Sesuaikan instans dengan konkurensi nyata Anda agar tidak terjadi hambatan maupun pemborosan.

Titik Awal yang Wajar

Dua instans per GPU merupakan titik awal yang umum. Uji dengan beban realistis, lalu sesuaikan jumlahnya naik atau turun berdasarkan hasil pengamatan.

Pemeriksaan Singkat

Apa yang dilakukan pengaturan count ke 2 dalam instance_group?

Ringkasan

Anda telah mempelajari cara menjalankan beberapa salinan model melalui instance_group, memasangkan instans dengan batching untuk paralelisme, serta mengawasi VRAM dan menyesuaikan jumlahnya berdasarkan pengukuran. 🙌

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Jalankan Beberapa Instans Model per GPU” gratis?

Ya — teks lengkap “Jalankan Beberapa Instans Model per GPU” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus MLOps Academy, upgrade ke CoddyKit PRO. Kursus MLOps Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Jalankan Beberapa Instans Model per GPU”?

Gunakan eksekusi konkuren untuk meningkatkan utilisasi. Kamu berlatih MLOps Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai MLOps Academy?

Tidak diperlukan pengalaman sebelumnya. MLOps Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Jalankan Beberapa Instans Model per GPU” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran MLOps Academy ini?

Ya. Setiap pelajaran MLOps Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Mengapa GPU Membutuhkan Batching
  2. Konfigurasikan Batching Dinamis di Triton
  3. Jalankan Beberapa Instans Model per GPU
  4. Buat Profil dan Sesuaikan Latensi Inferensi
← Kembali ke MLOps Academy