AI Agents · Pelajaran

Pemfilteran Keluaran (Llama Guard, NeMo)

Jalankan model penjaga yang lebih kecil pada keluaran untuk menangkap toksisitas, kebocoran PII, dan pelanggaran kebijakan sebelum dirilis.

Pelajaran 2 dari 415 langkah

Pemfilteran Keluaran (Llama Guard, NeMo) adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.

Mengapa Menyaring Keluaran?

Bahkan dengan masukan yang aman, model dapat menghasilkan:

  • Kebocoran data pribadi
  • Ujaran kebencian / pelecehan
  • Konten menyakiti diri sendiri
  • Panggilan alat yang melanggar maksud pengguna

Penyaring keluaran adalah garis pertahanan terakhir Anda sebelum pengguna melihat apa pun.

Llama Guard

Pengklasifikasi keamanan Meta — bobot terbuka dan sangat cepat:

from transformers import AutoTokenizer, AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-Guard-3-8B')
# Outputs 'safe' or 'unsafe' with category.

NeMo Guardrails

NVIDIA NeMo Guardrails — kerangka kerja Python yang membungkus LLM dengan pemeriksaan:

# pip install nemoguardrails
from nemoguardrails import RailsConfig, LLMRails

config = RailsConfig.from_path('./config')
rails = LLMRails(config)
response = rails.generate(messages=[{'role': 'user', 'content': '...'}])

Guardrails AI

guardrails-ai adalah pustaka Python yang berfokus pada validasi dan penjagaan. Pustaka ini mendukung "pembatas" berbasis XML serta loop perbaikan reAsk.

Pengklasifikasi Konstitusional Anthropic

Anthropic merilis pengklasifikasi (sebagai tambahan untuk pelatihan keamanan dalam Claude). Berguna untuk penyaringan setelah keluaran dari model mana pun.

Penyaring Berbasis LLM Kustom

Pilihan termurah: LLM yang lebih kecil untuk menyaring keluaran:

FILTER_PROMPT = '''
Analyse the output. Return JSON: {safe: true/false, reason: str, categories: list}

Unsafe categories: PII leak, harmful instructions, copyright violation, prompt-injection echo.

Output:
{output}
'''

result = guard_llm.invoke(FILTER_PROMPT.format(output=text))

Regex / Penyaring Berbasis Aturan

Untuk pola tertentu, regex cepat dan andal:

import re
EMAIL_RE = re.compile(r'[\w\.-]+@[\w\.-]+')
SSN_RE = re.compile(r'\b\d{3}-\d{2}-\d{4}\b')

def has_pii(text):
    return bool(EMAIL_RE.search(text) or SSN_RE.search(text))

# --- demo ---
samples = ['Contact me at jane@example.com', 'My SSN is 123-45-6789', 'No PII in this sentence']
for s in samples:
    print(f'{s!r} -> has_pii={has_pii(s)}')

Redaksi PII

Jangan hanya memblokir — terkadang lakukan redact dan biarkan bagian lainnya tetap tersedia:

def redact(text):
    text = EMAIL_RE.sub('[email]', text)
    text = SSN_RE.sub('[ssn]', text)
    return text

Penyaring Dua Lapis

Aturan cepat terlebih dahulu, kemudian LLM yang mahal:

def filter_output(text):
    if has_obvious_pii(text):
        return BLOCKED
    result = guard_llm.invoke(...)
    return result

Keluaran yang Dialirkan

Untuk keluaran yang dialirkan, lakukan penyaringan SENTENCE-BY-SENTENCE:

buf = ''
for token in stream:
    buf += token
    if buf.endswith(('. ', '! ', '? ', '\n')):
        if not safe(buf):
            stream.close()
            emit_to_client('[content filtered]')
            break
        emit_to_client(buf)
        buf = ''

Positif Palsu vs Negatif Palsu

Sesuaikan untuk mendapatkan keseimbangan yang tepat:

  • Situasi berisiko tinggi (medis, keuangan): condongkan ke positif palsu (blokir lebih banyak)
  • Kreatif/hiburan: condongkan ke negatif palsu (blokir lebih sedikit)

Log Penyaring Bersifat Sensitif

Log penyaring berisi konten yang diblokir. Simpan dengan aman menggunakan TTL singkat:

log.warning('Blocked output', extra={'reason': r, 'category': c}, sanitize_payload=True)

Edukasi Pengguna

Saat memblokir sesuatu, beri tahu pengguna alasannya agar mereka tidak mengirim percobaan ulang secara berulang:

def handle_privacy_request():
    return 'I cannot share that information for privacy reasons.'

print(handle_privacy_request())

Penyaring Multi-Lapis

Mengapa menggabungkan regex dengan penyaringan berbasis LLM?

Ringkasan

Llama Guard / NeMo / penyaring LLM kustom + aturan regex. Dua lapis. Lakukan redact jika memungkinkan. Selalu beri tahu pengguna saat konten diblokir.

Gratis untuk memulai

Belajar AI Agents dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
60
Pelajaran
239

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Pemfilteran Keluaran (Llama Guard, NeMo)” gratis?

Ya — teks lengkap “Pemfilteran Keluaran (Llama Guard, NeMo)” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Pemfilteran Keluaran (Llama Guard, NeMo)”?

Jalankan model penjaga yang lebih kecil pada keluaran untuk menangkap toksisitas, kebocoran PII, dan pelanggaran kebijakan sebelum dirilis. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Agents?

Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Pemfilteran Keluaran (Llama Guard, NeMo)” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?

Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Pertahanan terhadap Injeksi Prompt
  2. Pemfilteran Keluaran (Llama Guard, NeMo)
  3. Eksekusi Terisolasi untuk Agen Kode
  4. Kontrol Akses pada Alat
← Kembali ke AI Agents