Pemfilteran Keluaran (Llama Guard, NeMo)
Jalankan model penjaga yang lebih kecil pada keluaran untuk menangkap toksisitas, kebocoran PII, dan pelanggaran kebijakan sebelum dirilis.
Pemfilteran Keluaran (Llama Guard, NeMo) adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Mengapa Menyaring Keluaran?
Bahkan dengan masukan yang aman, model dapat menghasilkan:
- Kebocoran data pribadi
- Ujaran kebencian / pelecehan
- Konten menyakiti diri sendiri
- Panggilan alat yang melanggar maksud pengguna
Penyaring keluaran adalah garis pertahanan terakhir Anda sebelum pengguna melihat apa pun.
Llama Guard
Pengklasifikasi keamanan Meta — bobot terbuka dan sangat cepat:
from transformers import AutoTokenizer, AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-Guard-3-8B')
# Outputs 'safe' or 'unsafe' with category.NeMo Guardrails
NVIDIA NeMo Guardrails — kerangka kerja Python yang membungkus LLM dengan pemeriksaan:
# pip install nemoguardrails
from nemoguardrails import RailsConfig, LLMRails
config = RailsConfig.from_path('./config')
rails = LLMRails(config)
response = rails.generate(messages=[{'role': 'user', 'content': '...'}])Guardrails AI
guardrails-ai adalah pustaka Python yang berfokus pada validasi dan penjagaan. Pustaka ini mendukung "pembatas" berbasis XML serta loop perbaikan reAsk.
Pengklasifikasi Konstitusional Anthropic
Anthropic merilis pengklasifikasi (sebagai tambahan untuk pelatihan keamanan dalam Claude). Berguna untuk penyaringan setelah keluaran dari model mana pun.
Penyaring Berbasis LLM Kustom
Pilihan termurah: LLM yang lebih kecil untuk menyaring keluaran:
FILTER_PROMPT = '''
Analyse the output. Return JSON: {safe: true/false, reason: str, categories: list}
Unsafe categories: PII leak, harmful instructions, copyright violation, prompt-injection echo.
Output:
{output}
'''
result = guard_llm.invoke(FILTER_PROMPT.format(output=text))Regex / Penyaring Berbasis Aturan
Untuk pola tertentu, regex cepat dan andal:
import re
EMAIL_RE = re.compile(r'[\w\.-]+@[\w\.-]+')
SSN_RE = re.compile(r'\b\d{3}-\d{2}-\d{4}\b')
def has_pii(text):
return bool(EMAIL_RE.search(text) or SSN_RE.search(text))
# --- demo ---
samples = ['Contact me at jane@example.com', 'My SSN is 123-45-6789', 'No PII in this sentence']
for s in samples:
print(f'{s!r} -> has_pii={has_pii(s)}')
Redaksi PII
Jangan hanya memblokir — terkadang lakukan redact dan biarkan bagian lainnya tetap tersedia:
def redact(text):
text = EMAIL_RE.sub('[email]', text)
text = SSN_RE.sub('[ssn]', text)
return textPenyaring Dua Lapis
Aturan cepat terlebih dahulu, kemudian LLM yang mahal:
def filter_output(text):
if has_obvious_pii(text):
return BLOCKED
result = guard_llm.invoke(...)
return resultKeluaran yang Dialirkan
Untuk keluaran yang dialirkan, lakukan penyaringan SENTENCE-BY-SENTENCE:
buf = ''
for token in stream:
buf += token
if buf.endswith(('. ', '! ', '? ', '\n')):
if not safe(buf):
stream.close()
emit_to_client('[content filtered]')
break
emit_to_client(buf)
buf = ''Positif Palsu vs Negatif Palsu
Sesuaikan untuk mendapatkan keseimbangan yang tepat:
- Situasi berisiko tinggi (medis, keuangan): condongkan ke positif palsu (blokir lebih banyak)
- Kreatif/hiburan: condongkan ke negatif palsu (blokir lebih sedikit)
Log Penyaring Bersifat Sensitif
Log penyaring berisi konten yang diblokir. Simpan dengan aman menggunakan TTL singkat:
log.warning('Blocked output', extra={'reason': r, 'category': c}, sanitize_payload=True)Edukasi Pengguna
Saat memblokir sesuatu, beri tahu pengguna alasannya agar mereka tidak mengirim percobaan ulang secara berulang:
def handle_privacy_request():
return 'I cannot share that information for privacy reasons.'
print(handle_privacy_request())Penyaring Multi-Lapis
Mengapa menggabungkan regex dengan penyaringan berbasis LLM?
Ringkasan
Llama Guard / NeMo / penyaring LLM kustom + aturan regex. Dua lapis. Lakukan redact jika memungkinkan. Selalu beri tahu pengguna saat konten diblokir.
Belajar AI Agents dengan tutor AI — gratis
Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.
- Kursus
- 60
- Pelajaran
- 239
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Pemfilteran Keluaran (Llama Guard, NeMo)” gratis?
Ya — teks lengkap “Pemfilteran Keluaran (Llama Guard, NeMo)” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Pemfilteran Keluaran (Llama Guard, NeMo)”?
Jalankan model penjaga yang lebih kecil pada keluaran untuk menangkap toksisitas, kebocoran PII, dan pelanggaran kebijakan sebelum dirilis. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Pemfilteran Keluaran (Llama Guard, NeMo)” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Pertahanan terhadap Injeksi Prompt
- Pemfilteran Keluaran (Llama Guard, NeMo)
- Eksekusi Terisolasi untuk Agen Kode
- Kontrol Akses pada Alat