Orkestrasi dengan Kubernetes untuk Kebolehskalaan
Terokai cara Kubernetes mengurus, menskalakan dan mengautomatikkan penggunaan perkhidmatan LLM yang dibekaskan.
Orkestrasi dengan Kubernetes untuk Kebolehskalaan ialah pelajaran Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching) percuma di CoddyKit. Ini ialah pelajaran 2 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching), dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching) merangkumi sejumlah 4 pelajaran.
K8s untuk Orkestrasi LLM
Selamat datang ke dunia orkestrasi aplikasi LLM! Selepas menjadikan aplikasi anda sebagai bekas, cabaran seterusnya ialah mengurus bekas tersebut pada skala besar.
Kubernetes (K8s) ialah sistem sumber terbuka untuk mengautomatikkan penggunaan, penskalaan dan pengurusan aplikasi yang dijadikan bekas. Anggaplah ia sebagai sistem pengendalian untuk pusat data anda, yang direka bentuk untuk menjalankan banyak bekas dengan cekap.
Melangkaui Bekas Tunggal
Walaupun Docker membantu membungkus aplikasi LLM anda, menjalankannya dalam persekitaran pengeluaran memerlukan lebih banyak perkara:
- Mengurus banyak replika: Untuk mengendalikan beban pengguna.
- Pemulihan kendiri: Apakah yang berlaku jika bekas mengalami kerosakan?
- Pengimbangan beban: Mengagihkan permintaan merentas replika.
- Penemuan perkhidmatan: Bagaimanakah bahagian berlainan dalam sistem LLM anda mencari satu sama lain?
Kubernetes menangani cabaran kompleks ini, sekali gus menjadikan aplikasi LLM anda kukuh dan boleh diskalakan.
Blok Binaan K8s: Pod
Unit terkecil yang boleh digunakan dalam Kubernetes ialah Pod. Satu Pod boleh mengandungi satu atau lebih bekas yang berkongsi rangkaian, storan dan kitar hayat.
- Bekas inferens LLM anda biasanya akan berjalan di dalam Pod.
- Jika aplikasi LLM anda mempunyai bekas sampingan (contohnya, ejen pengelogan), bekas itu boleh berjalan dalam Pod yang sama.
Pod bersifat sementara; Pod boleh dicipta, dimusnahkan dan dijadualkan semula oleh Kubernetes.
Mengurus Pod dengan Deployment
Mengurus Pod secara langsung agak menyusahkan. Di sinilah Deployment diperlukan. Deployment menerangkan keadaan yang dikehendaki untuk aplikasi anda, seperti:
- Bilangan Pod yang sama (replika) yang sepatutnya sedang berjalan.
- Imej bekas yang hendak digunakan untuk aplikasi LLM anda.
- Cara mengemas kini aplikasi tanpa masa henti.
Deployment memastikan bilangan Pod aplikasi LLM yang anda tentukan sentiasa berjalan.
Mengakses Aplikasi LLM Anda: Service
Pod bersifat sementara dan alamat IP-nya boleh berubah. Bagaimanakah pengguna atau perkhidmatan lain boleh mengakses aplikasi LLM anda secara konsisten?
Service menyediakan titik akhir rangkaian yang stabil (alamat IP tetap dan nama DNS) untuk sekumpulan Pod. Ia bertindak sebagai pengimbang beban dengan mengagihkan permintaan masuk merentas Pod yang sihat dan diurus oleh Deployment.
Menskalakan Aplikasi LLM Anda
Salah satu ciri Kubernetes yang paling berkuasa ialah penskalaan automatik. Bagi aplikasi LLM, ciri ini amat penting untuk mengendalikan permintaan yang berubah-ubah.
- Horizontal Pod Autoscaler (HPA) boleh meningkatkan atau mengurangkan bilangan replika Pod dalam Deployment secara automatik.
- Ia membuat penskalaan berdasarkan metrik seperti penggunaan CPU, penggunaan memori atau metrik tersuai (contohnya, permintaan sesaat kepada titik akhir LLM anda).
Dengan demikian, aplikasi LLM anda sentiasa mempunyai kapasiti yang mencukupi tanpa campur tangan manual.
Pemulihan Kendiri dan Kebolehpercayaan
Kubernetes direka bentuk untuk ketahanan. Jika Pod yang menjalankan perkhidmatan LLM anda mengalami kerosakan, Kubernetes akan:
- Mengesan kegagalan secara automatik.
- Menamatkan Pod yang tidak sihat.
- Mencipta Pod baharu yang sihat untuk menggantikannya.
Keupayaan pemulihan kendiri ini meningkatkan kebolehpercayaan dan masa beroperasi aplikasi LLM anda dalam persekitaran pengeluaran dengan ketara.
Mengemas Kini Aplikasi dengan Pelancaran Berperingkat
Penggunaan versi baharu model LLM atau kod aplikasi anda perlu dilakukan dengan lancar. Kemas kini bergilir Kubernetes membolehkan anda mengemas kini aplikasi tanpa masa henti.
Daripada menutup semua Pod lama serentak, Kubernetes menggantikan Pod lama dengan Pod baharu secara beransur-ansur, bagi memastikan bilangan minimum Pod yang sihat sentiasa tersedia untuk melayan permintaan.
Gambaran Keseluruhan Deployment K8s
Berikut ialah gambaran konsep tentang cara aplikasi LLM ringkas boleh ditakrifkan dalam Kubernetes menggunakan YAML. Ini mencipta satu Deployment dan satu Service.
apiVersion: apps/v1
kind: Deployment
metadata:
name: my-llm-app-deployment
spec:
replicas: 2
selector:
matchLabels:
app: my-llm-app
template:
metadata:
labels:
app: my-llm-app
spec:
containers:
- name: llm-container
image: your-org/my-llm-app:v1.0
ports:
- containerPort: 8000
---
apiVersion: v1
kind: Service
metadata:
name: my-llm-app-service
spec:
selector:
app: my-llm-app
ports:
- protocol: TCP
port: 80
targetPort: 8000
type: LoadBalancerSemakan Konsep K8s
Komponen Kubernetes manakah yang bertanggungjawab terutamanya untuk memastikan bilangan Pod yang sama bagi aplikasi LLM anda sentiasa berjalan dan dikemas kini?
Imbas Kembali dan Langkah Seterusnya
Anda telah meneroka keupayaan Kubernetes untuk mengorkestrakan aplikasi LLM anda yang dijadikan bekas!
- K8s membolehkan penskalaan automatik, pemulihan kendiri dan kemas kini yang lancar.
- Komponen utama seperti Pod, Deployment dan Service bekerjasama untuk mengurus aplikasi anda.
Seterusnya, kita akan mendalami penyediaan saluran paip Integrasi Berterusan dan Penghantaran Berterusan (CI/CD) untuk mengautomatikkan kitaran pengujian dan keluaran bagi aplikasi LLM anda.
Pelajari Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching) dengan tutor kecerdasan buatan — percuma
Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.
- Kursus
- 12
- Pelajaran
- 48
Soalan Lazim
Adakah pelajaran “Orkestrasi dengan Kubernetes untuk Kebolehskalaan” percuma?
Ya — teks penuh “Orkestrasi dengan Kubernetes untuk Kebolehskalaan” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching), tingkat taraf kepada CoddyKit PRO. Kursus Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching) merangkumi sejumlah 4 pelajaran.
Apakah yang akan saya pelajari dalam “Orkestrasi dengan Kubernetes untuk Kebolehskalaan”?
Terokai cara Kubernetes mengurus, menskalakan dan mengautomatikkan penggunaan perkhidmatan LLM yang dibekaskan. Anda berlatih Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching) menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.
Adakah saya memerlukan pengalaman untuk memulakan Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching)?
Tiada pengalaman terdahulu diperlukan. Pembelajaran Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching) di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 2 daripada 4.
Berapa lamakah pelajaran “Orkestrasi dengan Kubernetes untuk Kebolehskalaan” diambil?
Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.
Bolehkah saya menulis dan menjalankan kod dalam pelajaran Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching) ini?
Ya. Setiap pelajaran Aplikasi LLM dalam Pengeluaran (RAG + Pangkalan Data Vektor + Caching) menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.
Semua pelajaran dalam kursus ini
- Membungkus Aplikasi LLM dengan Docker
- Orkestrasi dengan Kubernetes untuk Kebolehskalaan
- CI/CD untuk Penggunaan Aplikasi LLM
- Mengurus Konfigurasi dan Rahsia dalam Penerapan