0Pricing
MLOps Academy · Pelajaran

Aktifkan Micro-Batching Adaptif

Kelompokkan permintaan secara otomatis untuk throughput yang lebih tinggi.

Aktifkan Micro-Batching Adaptif adalah pelajaran MLOps Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar MLOps Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus MLOps Academy mencakup 4 pelajaran total.

Masalah Throughput

Memanggil model satu kali untuk setiap permintaan akan menyia-nyiakan perangkat keras. Model berjalan jauh lebih cepat pada batch input dibandingkan memproses input yang sama satu per satu. ⚡

Cara Kerja Micro-Batching

Adaptive batching mengumpulkan permintaan yang masuk selama jeda singkat, menjalankannya bersama-sama, lalu secara otomatis membagi hasilnya kembali kepada setiap pemanggil.

Mengapa Adaptif

Ukuran jedanya tidak tetap. BentoML memantau latensi secara langsung dan menyesuaikan ukuran batch agar tetap cepat saat beban ringan maupun berat.

Berada di Runner

Batching dikonfigurasi untuk setiap model, bukan untuk setiap permintaan. Anda mengaktifkannya pada runnable dengan menandai metode yang mendukung input dalam batch.

Aktifkan

Untuk runnable khusus, Anda menetapkan batchable ke true pada metode tersebut. Setelah itu, BentoML mengelompokkan pemanggilan ke metode itu di balik layar.

@bentoml.Runnable.method(batchable=True)
def predict(self, inputs):
    ...

Pilih Sumbu Batch

BentoML perlu mengetahui cara menumpuk input. Argumen batch_dim memberi tahu sumbu yang digunakan untuk menggabungkan input, biasanya sumbu 0.

@bentoml.Runnable.method(batchable=True, batch_dim=0)

Batasi Ukuran Batch

Anda membatasi seberapa besar batch dapat berkembang. max_batch_size membatasi jumlah permintaan yang digabungkan agar satu batch raksasa tidak pernah membuat permintaan lain tertahan.

Batasi Waktu Tunggu

Anda juga membatasi lama waktu menunggu. max_latency_ms menetapkan waktu terlama sebuah permintaan boleh berada dalam antrean sebelum batch dijalankan.

Atur melalui Konfigurasi

Anda dapat menetapkan batas ini tanpa mengubah kode. Sebuah file bentoml_configuration memungkinkan Anda menyesuaikan batching untuk setiap runner di setiap lingkungan.

runners:
  predict:
    batching:
      max_batch_size: 32

Komprominya

Batch yang lebih besar meningkatkan throughput, tetapi menambah sedikit latensi pada setiap permintaan. Penyetelan berarti menemukan titik yang paling sesuai untuk lalu lintas Anda.

Amati Cara Kerjanya

Anda sama sekali tidak perlu mengubah klien. Pemanggil tetap mengirim permintaan tunggal, sementara BentoML secara transparan menggabungkannya di balik layar.

Pemeriksaan Singkat

Anda menaikkan max_batch_size ke nilai yang besar. Apa dampak yang paling mungkin terjadi pada satu permintaan?

Ringkasan

Anda telah mempelajari bahwa adaptive batching mengelompokkan permintaan pada runner yang mendukung batch, dengan penyesuaian melalui max_batch_size dan max_latency_ms, sehingga sedikit mengorbankan latensi untuk memperoleh throughput yang jauh lebih besar. 🙌

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Aktifkan Micro-Batching Adaptif” gratis?

Ya — teks lengkap “Aktifkan Micro-Batching Adaptif” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus MLOps Academy, upgrade ke CoddyKit PRO. Kursus MLOps Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Aktifkan Micro-Batching Adaptif”?

Kelompokkan permintaan secara otomatis untuk throughput yang lebih tinggi. Kamu berlatih MLOps Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai MLOps Academy?

Tidak diperlukan pengalaman sebelumnya. MLOps Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Aktifkan Micro-Batching Adaptif” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran MLOps Academy ini?

Ya. Setiap pelajaran MLOps Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Simpan Model ke Bento Store
  2. Tentukan Layanan dan API-nya
  3. Aktifkan Micro-Batching Adaptif
  4. Bangun Bento dan Kontainerkan
← Kembali ke MLOps Academy