0Pricing
Learn AI with Python · Pelajaran

Penyajian Berkinerja Tinggi dengan Triton Inference Server

Repositori model, konfigurasi model config.pbtxt, instans model bersamaan, batching dinamis.

Penyajian Berkinerja Tinggi dengan Triton Inference Server adalah pelajaran Learn AI with Python gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Learn AI with Python, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Learn AI with Python mencakup 4 pelajaran total.

Apa Itu Triton

NVIDIA Triton Inference Server adalah sistem penyajian untuk produksi yang menghosting banyak model sekaligus di CPU dan GPU. Sistem ini mendukung beberapa backend (TensorRT, ONNX, PyTorch, TensorFlow, Python) melalui satu API HTTP/gRPC, dengan pengelompokan batch dan konkurensi bawaan.

Repositori Model

Triton memuat model dari sebuah repositori model: direktori tempat setiap model memiliki foldernya sendiri, subfolder versi numerik, dan sebuah config.pbtxt.

model_repository/
  resnet50/
    config.pbtxt
    1/
      model.onnx
  bert/
    config.pbtxt
    1/
      model.pt

config.pbtxt: backend

File config.pbtxt menjelaskan cara Triton menjalankan model. Backend (atau platform) memberi tahu Triton runtime yang harus digunakan.

name: "resnet50"
backend: "onnxruntime"
max_batch_size: 32

Tensor Masukan dan Keluaran

Anda mendeklarasikan setiap masukan dan keluaran: namanya, tipe data, dan dimensi tensor (bentuk). Bentuk tersebut harus sesuai dengan yang diharapkan model. Dimensi batch di awal tersirat oleh max_batch_size.

input [
  {
    name: "input"
    data_type: TYPE_FP32
    dims: [ 3, 224, 224 ]
  }
]
output [
  {
    name: "output"
    data_type: TYPE_FP32
    dims: [ 1000 ]
  }
]

Tipe Data

Triton menggunakan tipe data tensor yang eksplisit agar klien dan model menyepakati tata letak byte:

  • TYPE_FP32 float 32-bit (umum untuk gambar)
  • TYPE_FP16 presisi setengah (lebih cepat pada GPU)
  • TYPE_INT64 id token untuk NLP
  • TYPE_INT8 model terkuantisasi

Batch Dinamis: Gagasannya

Batch dinamis memungkinkan Triton menggabungkan beberapa permintaan masuk menjadi satu batch yang lebih besar sebelum menjalankan model. GPU jauh lebih efisien pada batch besar, sehingga cara ini meningkatkan laju pemrosesan secara drastis tanpa mengubah kode klien.

Mengonfigurasi Batch Dinamis

Anda mengaktifkannya di konfigurasi dan mengatur berapa lama Triton menunggu untuk mengumpulkan permintaan. max_queue_delay_microseconds yang kecil mengorbankan sedikit latensi demi laju pemrosesan yang jauh lebih tinggi.

dynamic_batching {
  preferred_batch_size: [ 8, 16 ]
  max_queue_delay_microseconds: 1000
}

Instans Model Serentak

Secara bawaan, Triton menjalankan satu salinan (instans) model. Dengan instance_group, Anda dapat menjalankan beberapa instans secara paralel pada satu atau beberapa GPU, memproses permintaan independen secara bersamaan, dan meningkatkan utilisasi.

instance_group [
  {
    count: 2
    kind: KIND_GPU
    gpus: [ 0 ]
  }
]

Batch vs Konkurensi

Keduanya menyelesaikan masalah yang berbeda:

  • Batch dinamis menggabungkan permintaan menjadi satu pemanggilan model (laju pemrosesan per pemanggilan)
  • Instans serentak menjalankan beberapa pemanggilan model sekaligus (paralelisme)

Keduanya saling melengkapi; konfigurasi produksi sering menggunakan keduanya.

perf_analyzer

perf_analyzer adalah alat Triton yang membebani peladen dengan permintaan sintetis dan melaporkan laju pemrosesan (inferensi/detik) serta persentil latensi. Gunakan alat ini untuk menemukan pengaturan batch dan konkurensi yang memaksimalkan laju pemrosesan dalam batas latensi Anda.

perf_analyzer -m resnet50 \
  --concurrency-range 1:8 \
  --percentile 95

Membaca Keluaran perf_analyzer

Alat ini menguji berbagai tingkat konkurensi dan mencetak laju pemrosesan serta latensi untuk masing-masing tingkat. Carilah titik tekuk kurva: titik ketika penambahan konkurensi tidak lagi meningkatkan laju pemrosesan atau mendorong latensi P95 melewati batas Anda.

# Concurrency: 4, throughput: 1820 infer/sec, p95 latency: 9.1 ms
# Concurrency: 8, throughput: 1905 infer/sec, p95 latency: 17.4 ms

Pemeriksaan Singkat

Uji pengetahuan Anda tentang Triton.

Rangkuman

Anda telah mempelajari penyajian berperforma tinggi dengan Triton:

  • Repositori model: folder per model dengan subdirektori versi dan config.pbtxt
  • config.pbtxt mendeklarasikan backend, bentuk tensor masukan/keluaran, dan tipe data
  • Batch dinamis meningkatkan laju pemrosesan; instans serentak menambahkan paralelisme
  • perf_analyzer membandingkan laju pemrosesan dengan latensi untuk menyetel pengaturan

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Penyajian Berkinerja Tinggi dengan Triton Inference Server” gratis?

Ya — teks lengkap “Penyajian Berkinerja Tinggi dengan Triton Inference Server” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Learn AI with Python, upgrade ke CoddyKit PRO. Kursus Learn AI with Python mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Penyajian Berkinerja Tinggi dengan Triton Inference Server”?

Repositori model, konfigurasi model config.pbtxt, instans model bersamaan, batching dinamis. Kamu berlatih Learn AI with Python dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Learn AI with Python?

Tidak diperlukan pengalaman sebelumnya. Learn AI with Python di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.

Berapa lama pelajaran “Penyajian Berkinerja Tinggi dengan Triton Inference Server” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Learn AI with Python ini?

Ya. Setiap pelajaran Learn AI with Python menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Mengemas Model Pembelajaran Mesin dalam Kontainer dengan Docker
  2. Penerapan Cloud: AWS SageMaker
  3. Penyajian Berkinerja Tinggi dengan Triton Inference Server
  4. Penskalaan dan Penskalaan Otomatis Endpoint Model
← Kembali ke Learn AI with Python