0Pricing
AI Prompt Engineering · Lektion

Robustheit messen

Widerstandsfähigkeit gegen Angriffe bewerten

Robustheit messen ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Robustheit als messbare Größe

Robustheit ist der Widerstand des Systems gegenüber adversarialen Eingaben, ausgedrückt durch Zahlen, die Sie verfolgen, vergleichen und als Freigabekriterium verwenden können. „Es wirkt sicher“ ist keine Messung; eine Erfolgsrate von Angriffen mit Konfidenzintervall schon.

In dieser Lektion werden Erkenntnisse aus dem Red Teaming in aussagekräftige Metriken überführt.

Erfolgsrate von Angriffen

Die zentrale Metrik ist die Attack Success Rate (ASR): der Anteil der Angriffsfälle, die Ihre Schutzmaßnahmen überwinden. Je niedriger, desto besser. Berichten Sie sie insgesamt sowie aufgeschlüsselt nach Kategorie und Technik, damit Sie wissen, wo Ihr System Schwächen aufweist.

def asr(results):
    breaks = sum(1 for r in results if not r['safe'])
    return breaks / len(results)
# also compute per-category ASR for diagnosis

Nach Schweregrad gewichten

Eine rohe ASR behandelt ein triviales Datenleck und eine PII-Ausgabe gleich. Berechnen Sie einen nach Schweregrad gewichteten Wert, damit kritische Fehler die Metrik dominieren und einige wenige schwerwiegende Schwachstellen nicht durch viele unkritische erfolgreiche Fälle verborgen werden.

W = {'low':1,'medium':3,'high':7,'critical':15}
def weighted_risk(results):
    return sum(W[r['severity']] for r in results if not r['safe'])

Konfidenzintervalle statt Punktschätzungen

Die ASR ist eine Schätzung aus einer begrenzten Stichprobe, daher sollten Sie die Unsicherheit angeben. Bei kleinen Suiten ist das Intervall breit; ein Rückgang von 8 % auf 6 % kann zufällig sein. Verwenden Sie ein binomiales Konfidenzintervall und reagieren Sie nur auf Änderungen, die über dieses Intervall hinausgehen.

from statsmodels.stats.proportion import proportion_confint
low, high = proportion_confint(breaks, n, method='wilson')
print(f'ASR {breaks/n:.3f} CI [{low:.3f}, {high:.3f}]')

Das Gegenstück zu falsch-positiven Ergebnissen

Robustheit ohne Benutzerfreundlichkeit ist wertlos. Kombinieren Sie die ASR mit der Überverweigerungsrate: dem Anteil harmloser Anfragen, die fälschlicherweise blockiert werden, gemessen an einem separaten sauberen Datensatz. Eine Härtung, die die Überverweigerung stark erhöht, tauscht einen Fehler gegen einen anderen ein.

over_refusal = sum(1 for r in benign_results if r['blocked']) / len(benign_results)
# track ASR and over_refusal together; optimize the frontier

Angriffseffizienz

Messen Sie nicht nur, ob ein Angriff erfolgreich ist, sondern auch, wie schwierig er ist. Erfassen Sie die Anzahl der Anfragen bis zum Durchbruch oder die Anzahl der Gesprächsrunden bis zum Durchbruch: Ein Durchbruch mit einer einzigen Anfrage ist weitaus problematischer als einer, der 20 ausgefeilte Gesprächsrunden erfordert. Steigt der erforderliche Aufwand über mehrere Releases hinweg, deutet dies auf eine verbesserte Robustheit hin, selbst wenn die ASR unverändert bleibt.

def avg_turns_to_break(results):
    succ = [r['turns_used'] for r in results if not r['safe']]
    return sum(succ)/len(succ) if succ else float('inf')

Den Judge kalibrieren

Wenn ein LLM als Judge den Erfolg bewertet, sind Ihre Metriken nur so gut wie dieser Judge. Vergleichen Sie die Ergebnisse des Judges regelmäßig mit menschlichen Bezeichnungen und berichten Sie Präzision und Recall des Judges. Ein zu großzügiger Judge unterschätzt die ASR und erzeugt ein falsches Sicherheitsgefühl.

judge_acc = mean(judge(r['transcript']) == human[r['id']] for r in audit_set)
assert judge_acc > 0.9, 'recalibrate judge before trusting ASR'

Stratifizierte Berichterstattung

Eine einzelne aggregierte Kennzahl verbirgt Risiken. Unterteilen Sie die Metriken nach Kategorie, Technik, Einmal- und Multi-Turn-Angriffen sowie direkten und indirekten Angriffen. Eine ASR von insgesamt 3 % kann eine ASR von 40 % bei indirektem Tool-Missbrauch verbergen. Diese Zahl sollte Ihre weitere Planung bestimmen.

Trends über Releases hinweg verfolgen

Robustheit ist relativ und zeitgebunden. Speichern Sie jeden Lauf der Suite, gekennzeichnet mit Modellversion und Konfiguration, und stellen Sie ASR und gewichtetes Risiko über mehrere Releases grafisch dar. Das Ziel sind eine kontinuierliche Verbesserung und null Regressionen, überwacht wie jedes andere Zuverlässigkeits-SLO.

history.append({'version': cfg.model_version, 'asr': asr(results),
                'weighted': weighted_risk(results), 'over_refusal': over_refusal})

Freigabekriterien festlegen

Überführen Sie Metriken in eine Richtlinie. Beispiel für ein Freigabekriterium: Die kritische ASR muss 0 betragen, die gesamte ASR unter einem Schwellenwert liegen, es darf keine Regression jenseits des Konfidenzintervalls geben und die Überverweigerung muss unter ihrem Grenzwert bleiben. So wird Robustheit zu einer verbindlichen Voraussetzung für ein Release und nicht zu einem optionalen Zusatz.

def passes_gate(m, prev):
    return (m['critical_asr'] == 0
            and m['asr'] < 0.05
            and m['asr'] <= prev['asr'] + ci_margin
            and m['over_refusal'] < 0.02)

Vorsicht vor Überanpassung an die Suite

Wenn Sie Schutzmaßnahmen direkt gegen die sichtbare Suite optimieren, können Sie die Tests bestehen und trotzdem für unbekannte Angriffe anfällig bleiben. Halten Sie einen privaten Angriffssatz zurück, wechseln Sie die Fälle regelmäßig aus und lassen Sie das Angreifermodell weiter erkunden. Eine perfekte Punktzahl auf einer statischen Suite ist ein Warnsignal, kein Erfolg.

Schnelltest

Ihre gesamte ASR ist mit 3 % niedrig, aber Stakeholder sind von einem Vorfall mit realem Tool-Missbrauch überrascht. Welche Messpraxis hätte das Risiko wahrscheinlich früher sichtbar gemacht?

Zusammenfassung

Robustheit messen:

  • Die Attack Success Rate ist die zentrale Metrik; gewichten Sie sie nach Schweregrad.
  • Berichten Sie Konfidenzintervalle und kombinieren Sie die ASR mit der Überverweigerung.
  • Erfassen Sie die Angriffseffizienz, also Gesprächsrunden und Anfragen bis zum Durchbruch, und kalibrieren Sie den Judge.
  • Berichten Sie stratifizierte Werte, verfolgen Sie Trends über Releases hinweg und setzen Sie Freigabekriterien durch.
  • Halten Sie private Angriffe zurück, um eine Überanpassung an die Suite zu vermeiden.

Sie haben Red Teaming und adversariale Evaluierung sowie den fortgeschrittenen PromptLab-Track abgeschlossen.

Häufig gestellte Fragen

Ist die Lektion „Robustheit messen“ kostenlos?

Ja — der vollständige Text von „Robustheit messen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Robustheit messen“?

Widerstandsfähigkeit gegen Angriffe bewerten Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Prompt Engineering zu starten?

Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Robustheit messen“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?

Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Grundlagen des LLM-Red-Teamings
  2. Jailbreak-Techniken
  3. Eine Angriffstestsuite erstellen
  4. Robustheit messen
← Zurück zu AI Prompt Engineering