Telusuri dan Pantau Panggilan LLM
Catat token, latensi, dan biaya per permintaan.
Telusuri dan Pantau Panggilan LLM adalah pelajaran MLOps Academy gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar MLOps Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus MLOps Academy mencakup 4 pelajaran total.
Anda Tidak Dapat Memperbaiki Hal yang Tidak Dapat Dilihat
Aplikasi LLM terasa seperti kotak hitam sampai Anda mencatat apa yang dilakukannya. Penelusuran merekam setiap pemanggilan sehingga Anda dapat men-debug, menghitung biaya, dan meningkatkannya nanti. 🔍
Catat Permintaan
Untuk setiap pemanggilan, catat prompt akhir, nama model, dan parameter penting. Catatan permintaan ini memungkinkan Anda mereproduksi jawaban apa pun secara persis.
log.info({"model": "gpt-4o", "prompt": prompt, "temperature": 0.2})Catat Respons
Simpan teks yang dihasilkan bersama permintaan. Input dan output tersebut membentuk satu jejak yang dapat Anda putar ulang, nilai, atau bagikan kepada rekan satu tim.
Catat Penggunaan Token
Setiap respons melaporkan token yang masuk dan keluar. Mencatat token per pemanggilan adalah cara untuk membebankan biaya dan menemukan prompt yang diam-diam menjadi terlalu besar.
usage = response.usage
log.info({"in": usage.input_tokens, "out": usage.output_tokens})Ubah Token Menjadi Biaya
Kalikan jumlah token dengan harga per token untuk mendapatkan pengeluaran. Melacak biaya per permintaan mencegah fitur yang tidak terkendali mengejutkan Anda melalui tagihan.
cost = inp / 1e6 * 2.50 + out / 1e6 * 10.00Ukur Latensi
Ukur waktu setiap pemanggilan sejak pengiriman hingga token terakhir. Memantau latensi per permintaan mengungkap prompt yang lambat dan memberi tahu Anda kapan streaming akan membantu pengguna.
start = time.perf_counter()
response = client.responses.create(...)
latency = time.perf_counter() - startSpan Membentuk Jejak
Permintaan nyata mungkin merangkai pengambilan, LLM, dan alat. Setiap langkah adalah span, dan menyusunnya secara bertingkat dalam satu jejak menunjukkan ke mana waktu dan token digunakan.
Alat yang Dibuat untuk LLM
Platform seperti LangSmith, Langfuse, dan Phoenix menangkap jejak dengan satu pembungkus. Alat observabilitas yang dibuat khusus lebih baik daripada mengurai log mentah secara manual.
from langfuse.openai import openai
response = openai.responses.create(model="gpt-4o", input=prompt)Beri Tag Metadata pada Jejak
Tambahkan id pengguna, versi prompt, dan nama fitur ke setiap jejak. Metadata ini memungkinkan Anda memisahkan metrik dan menemukan segmen yang bermasalah.
Ambil Sampel dari Hal yang Tidak Dapat Anda Simpan
Pada volume tinggi, mencatat setiap muatan lengkap membutuhkan biaya besar. Pengambilan sampel pada sebagian jejak mempertahankan wawasan sekaligus mengendalikan penyimpanan dan privasi.
Dasbor dan Peringatan
Gabungkan jejak ke dalam dasbor untuk biaya, latensi, dan tingkat kesalahan, lalu kirimkan peringatan saat terjadi lonjakan. Kini masalah produksi sampai kepada Anda sebelum pengguna mengeluh.
Pemeriksaan Singkat
Tagihan LLM bulanan Anda melonjak tanpa perubahan lalu lintas. Nilai tercatat mana yang paling cepat menjelaskannya?
Rangkuman
Sekarang Anda dapat menelusuri pemanggilan LLM dari awal hingga akhir: permintaan, respons, token, biaya, latensi, dan span, lalu memantaunya di dasbor. Kini semuanya terlihat jelas! 🎉
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Telusuri dan Pantau Panggilan LLM” gratis?
Ya — teks lengkap “Telusuri dan Pantau Panggilan LLM” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus MLOps Academy, upgrade ke CoddyKit PRO. Kursus MLOps Academy mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Telusuri dan Pantau Panggilan LLM”?
Catat token, latensi, dan biaya per permintaan. Kamu berlatih MLOps Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai MLOps Academy?
Tidak diperlukan pengalaman sebelumnya. MLOps Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.
Berapa lama pelajaran “Telusuri dan Pantau Panggilan LLM” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran MLOps Academy ini?
Ya. Setiap pelajaran MLOps Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Perbedaan LLMOps dari MLOps Klasik
- Buat Versi Prompt dan Evaluasi Output
- Telusuri dan Pantau Panggilan LLM
- Guardrail dan Evaluasi RAG