0Pricing
AI Agents · Lektion

Ausgabefilterung (Llama Guard, NeMo)

Führen Sie ein kleineres Guard-Modell über die Ausgaben aus, um Toxizität, PII-Leaks und Richtlinienverstöße vor der Veröffentlichung zu erkennen.

Ausgabefilterung (Llama Guard, NeMo) ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Warum Ausgaben filtern?

Selbst bei sicheren Eingaben können Modelle Folgendes ausgeben:

  • Abfluss personenbezogener Daten
  • Hassrede / Belästigung
  • Inhalte zur Selbstverletzung
  • Tool-Aufrufe, die der Absicht des Benutzers widersprechen

Ein Ausgabefilter ist Ihre letzte Verteidigungslinie, bevor der Benutzer etwas sieht.

Llama Guard

Metas Sicherheitsklassifikator — offene Gewichte, sehr schnell:

from transformers import AutoTokenizer, AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-Guard-3-8B')
# Outputs 'safe' or 'unsafe' with category.

NeMo Guardrails

NVIDIA NeMo Guardrails — ein Python-Framework, das LLMs mit Prüfungen umschließt:

# pip install nemoguardrails
from nemoguardrails import RailsConfig, LLMRails

config = RailsConfig.from_path('./config')
rails = LLMRails(config)
response = rails.generate(messages=[{'role': 'user', 'content': '...'}])

Guardrails AI

guardrails-ai ist die Python-Bibliothek mit Schwerpunkt auf Validierung und Schutzmechanismen. Sie unterstützt XML-basierte „rails“ und Reparaturschleifen mit reAsk.

Anthropic Constitutional Classifier

Anthropic hat einen Klassifikator veröffentlicht, zusätzlich zum Sicherheitstraining in Claude. Er eignet sich für die nachträgliche Filterung von Ausgaben beliebiger Modelle.

Benutzerdefinierter LLM-basierter Filter

Der kostengünstigste Weg: ein kleineres LLM, das Ausgaben prüft:

FILTER_PROMPT = '''
Analyse the output. Return JSON: {safe: true/false, reason: str, categories: list}

Unsafe categories: PII leak, harmful instructions, copyright violation, prompt-injection echo.

Output:
{output}
'''

result = guard_llm.invoke(FILTER_PROMPT.format(output=text))

Regex-/Regelfilter

Für bestimmte Muster ist Regex schnell und zuverlässig:

import re
EMAIL_RE = re.compile(r'[\w\.-]+@[\w\.-]+')
SSN_RE = re.compile(r'\b\d{3}-\d{2}-\d{4}\b')

def has_pii(text):
    return bool(EMAIL_RE.search(text) or SSN_RE.search(text))

# --- demo ---
samples = ['Contact me at jane@example.com', 'My SSN is 123-45-6789', 'No PII in this sentence']
for s in samples:
    print(f'{s!r} -> has_pii={has_pii(s)}')

PII-Redaktion

Blockieren Sie nicht einfach alles — schwärzen Sie manchmal sensible Daten und lassen Sie den Rest durch:

def redact(text):
    text = EMAIL_RE.sub('[email]', text)
    text = SSN_RE.sub('[ssn]', text)
    return text

Filter auf zwei Ebenen

Zuerst schnelle Regeln, danach ein kostenintensives LLM:

def filter_output(text):
    if has_obvious_pii(text):
        return BLOCKED
    result = guard_llm.invoke(...)
    return result

Gestreamte Ausgaben

Filtern Sie bei gestreamten Ausgaben SATZ FÜR SATZ:

buf = ''
for token in stream:
    buf += token
    if buf.endswith(('. ', '! ', '? ', '\n')):
        if not safe(buf):
            stream.close()
            emit_to_client('[content filtered]')
            break
        emit_to_client(buf)
        buf = ''

Falschpositive vs. Falschnegative

Stimmen Sie das richtige Gleichgewicht ab:

  • Bei hohen Risiken (medizinisch, finanziell): eher Falschpositive in Kauf nehmen (mehr blockieren)
  • Bei Kreativem und Unterhaltung: eher Falschnegative in Kauf nehmen (weniger blockieren)

Filterprotokolle sind sensibel

Filterprotokolle enthalten die blockierten Inhalte. Speichern Sie sie sicher und mit kurzen TTLs:

log.warning('Blocked output', extra={'reason': r, 'category': c}, sanitize_payload=True)

Benutzer informieren

Wenn Sie Inhalte blockieren, erklären Sie dem Benutzer warum, damit er nicht ständig neue Versuche startet:

def handle_privacy_request():
    return 'I cannot share that information for privacy reasons.'

print(handle_privacy_request())

Mehrschichtiger Filter

Warum sollte man Regex mit LLM-basierter Filterung kombinieren?

Zusammenfassung

Llama Guard / NeMo / benutzerdefinierter LLM-Filter + Regex-Regeln. Zwei Ebenen. Wenn möglich, schwärzen. Informieren Sie den Benutzer immer, wenn Inhalte blockiert werden.

Häufig gestellte Fragen

Ist die Lektion „Ausgabefilterung (Llama Guard, NeMo)“ kostenlos?

Ja — der vollständige Text von „Ausgabefilterung (Llama Guard, NeMo)“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Ausgabefilterung (Llama Guard, NeMo)“?

Führen Sie ein kleineres Guard-Modell über die Ausgaben aus, um Toxizität, PII-Leaks und Richtlinienverstöße vor der Veröffentlichung zu erkennen. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.

Wie lange dauert die Lektion „Ausgabefilterung (Llama Guard, NeMo)“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Schutz vor Prompt Injection
  2. Ausgabefilterung (Llama Guard, NeMo)
  3. Sandbox-Ausführung für Coding-Agents
  4. Zugriffskontrolle für Tools
← Zurück zu AI Agents