Pelajari AI dengan Python · Pelajaran

Penskalaan dan Penskalaan Automatik Titik Akhir Model

Kubernetes HPA untuk pod model, penskalaan berasaskan trafik, pelaksanaan A/B, keluaran kenari.

Pelajaran 4 daripada 413 langkah

Penskalaan dan Penskalaan Automatik Titik Akhir Model ialah pelajaran Pelajari AI dengan Python percuma di CoddyKit. Ini ialah pelajaran 4 daripada 4. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Pelajari AI dengan Python, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Pelajari AI dengan Python merangkumi sejumlah 4 pelajaran.

Mengapa Penskalaan Automatik

Trafik inferens jarang kekal sama. Menyediakan kapasiti untuk beban puncak membazirkan wang pada waktu malam; menyediakan kapasiti untuk beban purata pula menyebabkan kegagalan ketika waktu puncak. Penskalaan automatik melaraskan bilangan replika secara automatik berdasarkan permintaan supaya anda membayar mengikut penggunaan dan perkhidmatan kekal responsif.

Pod dan Replika

Pada Kubernetes, pelayan model berjalan sebagai pelaksanaan yang terdiri daripada pod yang serupa (replika). Penskalaan bermaksud mengubah bilangan replika. Satu perkhidmatan mengimbangkan permintaan merentas semua replika yang tersedia.

apiVersion: apps/v1
kind: Deployment
metadata:
  name: model-server
spec:
  replicas: 2
  template:
    spec:
      containers:
        - name: server
          image: my-model:latest

Penskala Automatik Pod Mendatar

Penskala Automatik Pod Mendatar (HPA) memantau satu metrik dan menambah atau mengurangkan pod untuk mengekalkannya hampir kepada sasaran. Metrik klasiknya ialah penggunaan CPU.

HPA berdasarkan Penggunaan CPU

targetCPUUtilizationPercentage memberitahu HPA supaya mengekalkan purata CPU hampir kepada sasaran. Jika purata penggunaan CPU pod ialah 80% dan sasarannya 50%, HPA akan meningkatkan skala sehingga penggunaan kembali menghampiri 50%.

apiVersion: autoscaling/v1
kind: HorizontalPodAutoscaler
metadata:
  name: model-hpa
spec:
  scaleTargetRef:
    apiVersion: apps/v1
    kind: Deployment
    name: model-server
  minReplicas: 2
  maxReplicas: 10
  targetCPUUtilizationPercentage: 50

Had Penskalaan Berasaskan CPU

CPU ialah penunjuk yang kurang baik untuk sesetengah beban kerja. Model GPU mungkin tersekat pada GPU sedangkan penggunaan CPU kekal rendah, atau pekerja tak segerak mungkin mempunyai baris gilir yang semakin panjang ketika CPU melahu. Untuk keadaan ini, skalakan berdasarkan isyarat khusus beban kerja.

KEDA untuk Penskalaan Dipacu Peristiwa

KEDA (Penskalaan Automatik Dipacu Peristiwa Kubernetes) melakukan penskalaan berdasarkan metrik luaran seperti panjang baris gilir, kelewatan Kafka atau pertanyaan Prometheus. KEDA juga boleh menskalakan kepada sifar apabila tiada kerja, sesuatu yang tidak dapat dilakukan oleh HPA sendiri.

ScaledObject KEDA Berasaskan Baris Gilir

ScaledObject KEDA ini menambah pekerja apabila baris gilir mesej bertambah. Setiap unit tunggakan queueLength mencetuskan satu replika tambahan supaya pengguna dapat mengikuti lonjakan permintaan.

apiVersion: keda.sh/v1alpha1
kind: ScaledObject
metadata:
  name: inference-worker
spec:
  scaleTargetRef:
    name: inference-worker
  minReplicaCount: 0
  maxReplicaCount: 20
  triggers:
    - type: rabbitmq
      metadata:
        queueName: inference
        queueLength: "10"

Pengimbangan Beban dengan Ingress

Trafik luaran mencapai pod anda melalui Ingress. Pengawal Ingress nginx menamatkan TLS dan mengagihkan permintaan merentas Perkhidmatan yang menyokong replika anda, jadi peningkatan skala segera mengagihkan beban.

apiVersion: networking.k8s.io/v1
kind: Ingress
metadata:
  name: model-ingress
spec:
  ingressClassName: nginx
  rules:
    - host: api.example.com
      http:
        paths:
          - path: /predict
            pathType: Prefix
            backend:
              service:
                name: model-server
                port:
                  number: 8000

Pelancaran Selamat: Kenari

Melaksanakan versi model baharu kepada semua trafik sekaligus adalah berisiko. Pelancaran kenari menghantar sebahagian kecil trafik kepada versi baharu, memantau metriknya, kemudian mengalihkan lebih banyak trafik secara beransur-ansur.

Kenari dengan Wajaran Trafik

Anotasi kenari Ingress nginx menghalakan peratusan permintaan kepada pelaksanaan kedua. Mulakan pada 10%, sahkan kadar ralat dan kependaman, kemudian tingkatkan wajaran kepada 100%.

metadata:
  annotations:
    nginx.ingress.kubernetes.io/canary: "true"
    nginx.ingress.kubernetes.io/canary-weight: "10"

Menggabungkan Penskalaan

Persediaan yang kukuh menggabungkan semua perkara ini:

  • HPA atau KEDA menetapkan bilangan replika berdasarkan permintaan
  • Ingress mengimbangkan beban merentas replika
  • Wajaran kenari melancarkan versi baharu dengan selamat

Secara bersama, semuanya menyediakan penyajian model yang elastik, berdaya tahan dan berisiko rendah.

Uji Pantas

Uji pengetahuan anda tentang penskalaan.

Ringkasan

Anda telah mempelajari cara menskalakan titik akhir model:

  • HPA dengan targetCPUUtilizationPercentage melakukan penskalaan berdasarkan CPU
  • KEDA melakukan penskalaan berdasarkan panjang baris gilir dan menyokong penskalaan kepada sifar
  • Ingress nginx mengimbangkan beban merentas replika
  • Wajaran kenari mengalihkan trafik secara beransur-ansur untuk pelancaran yang selamat
Percuma untuk bermula

Pelajari Python dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
53
Pelajaran
225

Soalan Lazim

Adakah pelajaran “Penskalaan dan Penskalaan Automatik Titik Akhir Model” percuma?

Ya — sebanyak 3 pelajaran dalam laluan pembelajaran Pelajari AI dengan Python, termasuk “Penskalaan dan Penskalaan Automatik Titik Akhir Model”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus Pelajari AI dengan Python merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Penskalaan dan Penskalaan Automatik Titik Akhir Model”?

Kubernetes HPA untuk pod model, penskalaan berasaskan trafik, pelaksanaan A/B, keluaran kenari. Anda berlatih Pelajari AI dengan Python menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Pelajari AI dengan Python?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Pelajari AI dengan Python di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 4 daripada 4.

Berapa lamakah pelajaran “Penskalaan dan Penskalaan Automatik Titik Akhir Model” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Pelajari AI dengan Python ini?

Ya. Setiap pelajaran Pelajari AI dengan Python menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Membungkus Model Pembelajaran Mesin dalam Kontena dengan Docker
  2. Pelaksanaan Awan: AWS SageMaker
  3. Penyajian Berprestasi Tinggi dengan Triton Inference Server
  4. Penskalaan dan Penskalaan Automatik Titik Akhir Model
← Kembali ke Pelajari AI dengan Python