MLOps Academy · Pelajaran

Inferensi Online Waktu Nyata

Sajikan prediksi berlatensi rendah untuk setiap permintaan.

Pelajaran 2 dari 413 langkah

Inferensi Online Waktu Nyata adalah pelajaran MLOps Academy gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar MLOps Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus MLOps Academy mencakup 4 pelajaran total.

Apa Itu Inferensi Online

Inferensi online menjawab satu permintaan setiap kali permintaan itu tiba, sehingga pengguna atau layanan segera mendapatkan prediksi terbaru. ⚡

Ada Pengguna yang Menunggu

Berbeda dari batch, di sini seseorang menunggu di sisi lain. Prediksi harus kembali dalam hitungan milidetik, bukan menit, agar terasa responsif.

Berjalan di Balik API

Model online berada di balik titik akhir HTTP. Klien mengirim fitur dalam permintaan dan menerima prediksi dalam respons.

# POST /predict {"features": [5.1, 3.5, 1.4]}

Satu Permintaan, Satu Prediksi

Setiap pemanggilan membawa input untuk satu kasus. Layanan menjalankan predict pada input tersebut dan mengembalikan skor, lalu menangani pemanggil berikutnya.

def predict(req):
    x = parse(req.features)
    return model.predict([x])[0]

Input Selalu Terbaru

Karena fitur tiba bersama permintaan, skor mencerminkan keadaan terbaru, sehingga sangat cocok ketika input berubah dari detik ke detik.

Latensi Adalah Metriknya

Angka yang Anda pantau adalah latensi: waktu dari permintaan hingga respons. Orang sering melacak persentil ke-95 dan ke-99 yang lambat, bukan hanya rata-ratanya.

Muat Model Sekali Saja

Memuat model pada setiap permintaan akan lambat. Sebagai gantinya, muat model sekali saat pengaktifan dan gunakan kembali untuk semua pemanggilan yang masuk.

Konkurensi Itu Penting

Banyak pengguna mengakses layanan pada waktu yang sama. Layanan harus menangani permintaan secara bersamaan, sering kali dengan beberapa pekerja, agar latensi tetap rendah saat beban tinggi.

Contoh di Dunia Nyata

Pemeriksaan penipuan saat pembayaran, pemeringkatan pencarian, dan widget rekomendasi semuanya membutuhkan jawaban seketika, sehingga berjalan sebagai inferensi online.

Biaya untuk Selalu Aktif

Layanan online harus tetap berjalan dan siap sepanjang waktu. Jejak penggunaan yang selalu aktif ini lebih mahal daripada pekerjaan yang berjalan lalu berhenti.

Kapan Memilih Online

Pilih online ketika input belum diketahui sebelumnya dan pengguna membutuhkan jawaban terbaru sekarang, dengan menerima biaya serta pemeliharaan operasional yang lebih besar.

Pemeriksaan Singkat

Metrik apa yang paling penting untuk inferensi online?

Rangkuman

Inferensi online menyediakan satu prediksi terbaru untuk setiap permintaan melalui API, mengutamakan latensi rendah, dan lebih mahal karena harus selalu aktif.

Gratis untuk memulai

Belajar Python dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
30
Pelajaran
120

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Inferensi Online Waktu Nyata” gratis?

Ya — teks lengkap “Inferensi Online Waktu Nyata” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus MLOps Academy, upgrade ke CoddyKit PRO. Kursus MLOps Academy mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Inferensi Online Waktu Nyata”?

Sajikan prediksi berlatensi rendah untuk setiap permintaan. Kamu berlatih MLOps Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai MLOps Academy?

Tidak diperlukan pengalaman sebelumnya. MLOps Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Inferensi Online Waktu Nyata” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran MLOps Academy ini?

Ya. Setiap pelajaran MLOps Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Pemberian Skor Batch Terjadwal
  2. Inferensi Online Waktu Nyata
  3. Pertukaran antara Latensi, Throughput, dan Biaya
  4. Hitung Awal dan Simpan Prediksi dalam Cache
← Kembali ke MLOps Academy