Buat Profil dan Sesuaikan Latensi Inferensi
Gunakan perf_analyzer untuk menemukan titik optimal.
Buat Profil dan Sesuaikan Latensi Inferensi adalah pelajaran MLOps Academy gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar MLOps Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus MLOps Academy mencakup 4 pelajaran total.
Sesuaikan Berdasarkan Pengukuran
Anda tidak dapat menyesuaikan sesuatu yang tidak Anda ukur. Sebelum mengubah pengaturan, catat angka latensi dan throughput nyata di bawah beban yang dapat Anda percaya. 📏
Kenali perf_analyzer
Triton dilengkapi perf_analyzer, alat yang membebani model Anda dengan permintaan dan melaporkan latensi serta throughput agar Anda dapat membandingkan konfigurasi.
Jalankan Pengujian Dasar
Anda mengarahkan perf_analyzer ke sebuah model, lalu alat ini mengirim permintaan sintetis dan mencetak jumlah inferensi per detik beserta rincian latensinya.
perf_analyzer -m my_modelUji Rentang Konkurensi
Opsi yang paling berguna menguji rentang konkurensi, yaitu jumlah permintaan yang sedang berjalan. Opsi ini menunjukkan perubahan throughput dan latensi saat beban meningkat.
perf_analyzer -m my_model --concurrency-range 1:8Baca Kurvanya
Saat konkurensi meningkat, throughput naik lalu mendatar, sedangkan latensi terus bertambah. Titik tekuk pada kurva tersebut adalah titik operasi praktis Anda.
Gunakan Persentil
Nilai rata-rata menyembunyikan masalah. Perhatikan latensi p95, yaitu nilai yang dilampaui oleh 95 persen permintaan, karena latensi ekor inilah yang benar-benar dirasakan pengguna.
Sesuaikan Penundaan Antrean
Jika latensi terlalu tinggi, turunkan max_queue_delay_microseconds. Jika throughput terlalu rendah saat beban berat, naikkan nilainya untuk membentuk batch yang lebih penuh.
Sesuaikan Instans
Jika GPU kurang digunakan, tambahkan sebuah instans. Jika memori terbatas atau throughput terhambat, kurangi satu instans. Ubah satu pengaturan setiap kali, lalu ukur kembali.
Ubah Satu Hal
Penyesuaian adalah sebuah siklus, bukan lompatan. Sesuaikan satu pengaturan tunggal, jalankan kembali perf_analyzer, bandingkan hasilnya, dan pertahankan perubahan hanya jika angkanya benar-benar membaik.
Tetapkan Anggaran Latensi
Tentukan anggaran Anda terlebih dahulu, misalnya p95 di bawah 50 md. Kemudian tingkatkan ukuran batch dan jumlah instans sejauh mungkin selama tetap berada dalam batas tersebut.
Perhatikan Seluruh Jalur
Angka dari server bukanlah keseluruhan cerita. Lompatan jaringan dan kode klien menambah waktu, jadi ukur juga latensi ujung ke ujung dari lokasi pengguna.
Pemeriksaan Singkat
Mengapa latensi p95 lebih diutamakan daripada latensi rata-rata saat melakukan penyesuaian?
Ringkasan
Anda menggunakan perf_analyzer untuk menguji rentang konkurensi, membaca kurva throughput-latensi pada p95, serta menyesuaikan penundaan antrean dan instans dalam batas anggaran, satu perubahan setiap kali. 🙌
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Buat Profil dan Sesuaikan Latensi Inferensi” gratis?
Ya — teks lengkap “Buat Profil dan Sesuaikan Latensi Inferensi” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus MLOps Academy, upgrade ke CoddyKit PRO. Kursus MLOps Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Buat Profil dan Sesuaikan Latensi Inferensi”?
Gunakan perf_analyzer untuk menemukan titik optimal. Kamu berlatih MLOps Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai MLOps Academy?
Tidak diperlukan pengalaman sebelumnya. MLOps Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Buat Profil dan Sesuaikan Latensi Inferensi” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran MLOps Academy ini?
Ya. Setiap pelajaran MLOps Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Mengapa GPU Membutuhkan Batching
- Konfigurasikan Batching Dinamis di Triton
- Jalankan Beberapa Instans Model per GPU
- Buat Profil dan Sesuaikan Latensi Inferensi