0Pricing
AI Prompt Engineering · Lektion

Modalitätsübergreifendes Grounding

Visuelle Belege im Text referenzieren

Modalitätsübergreifendes Grounding ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Was Grounding bedeutet

Grounding bedeutet, dass jede Textaussage auf konkrete Belege in einer anderen Modalität zurückführbar sein muss. Eine nicht gegrundete multimodale Antwort ist eine flüssig formulierte Vermutung; eine gegrundete Antwort ist eine belastbare Aussage mit einem Verweis zurück auf die Pixel (oder den Audio-Frame), die sie begründen.

  • Grounding verwandelt eine undurchsichtige Ausgabe in eine prüfbare Ausgabe.
  • Es ist der wirksamste einzelne Hebel gegen selbstsichere visuelle Halluzinationen.

Reihenfolge des Schlussfolgerns mit Belegen zuerst

Zwingen Sie das Modell, zuerst Belege zu extrahieren und danach eine Schlussfolgerung zu ziehen. Wird die Schlussfolgerung zuerst generiert, wird der „Beleg“ zu einer nachträglichen Rationalisierung, die zur (möglicherweise falschen) Antwort passt.

Strukturieren Sie die Antwort so, dass zuerst beobachtete Regionen, dann die Interpretation und zuletzt die endgültige Antwort erscheinen.

schema = {
  'observations': '[{region: str, text_read: str}]',
  'inference': 'str — reasoning over observations only',
  'answer': 'str'
}
# Order in the prompt enforces order in generation.

Bounding-Box- und Regionsangaben

Bitten Sie das Modell, für jede visuelle Aussage ungefähre normalisierte Koordinaten auszugeben. Selbst ungenaue Boxen sind wertvoll: Ein nachgelagertes System kann den Ausschnitt erstellen und erneut prüfen, und eine völlig falsche Box macht eine Halluzination sofort sichtbar.

  • Verwenden Sie normalisierte [x0,y0,x1,y1]-Koordinaten im Bereich 0..1, damit die Auflösung keine Rolle spielt.
  • Betrachten Sie Boxen als Lokalisierungshinweise, nicht als pixelgenaue Erkennung.
instruction = (
  'For each extracted field, return '
  '{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
  'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)

Überprüfung durch Zitieren des Bildtexts

Fordern Sie bei jedem im Bild sichtbaren Text ein wörtliches Zitat dessen an, was das Modell liest. Ein wörtliches Zitat ist überprüfbar: Sie können es stichprobenartig per OCR kontrollieren, und das Modell erfindet deutlich seltener einen Wert, den es zusätzlich exakt transkribieren muss.

Diese Einschränkung des „Zurücklesens“ ist kostengünstig und bei Dokumenten, Diagrammen und Beschilderungen unverhältnismäßig wirksam.

Modalitätsübergreifende Konsistenzprüfungen

Wenn dieselbe Tatsache in zwei Modalitäten vorkommt (etwa in einem Folienbild und der gesprochenen Erläuterung), fordern Sie das Modell auf, beide querzuprüfen. Übereinstimmung erhöht die Zuverlässigkeit; eine Abweichung ist selbst ein Signal, das sichtbar gemacht werden sollte.

  • „Passt die Bildunterschrift der Abbildung zu dem, was das Diagramm zeigt?“
  • „Stimmt die Erläuterung mit der Zahl auf dem Bildschirm überein?“
prompt = (
  'You have a slide image and its transcript. '
  'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
  'Flag any disagreement explicitly.'
)

Ablehnung als Grounding-Ergebnis

Ein gegroundetes System muss sagen dürfen: „nicht sichtbar“. Ohne eine explizite Ausweichmöglichkeit füllt das Modell Lücken mit plausiblen Erfindungen. Bieten Sie eine solche Möglichkeit an und belohnen Sie ihre Verwendung.

Weisen Sie es an: „Wenn der Beleg nicht vorhanden oder unleserlich ist, geben Sie NOT_FOUND zurück, statt zu raten.“ Machen Sie NOT_FOUND anschließend zu einer eigenständigen Ausgabe in Ihrer Pipeline, die nicht sanktioniert wird.

Räumliche Beziehungen mit Grounding absichern

Beziehungsangaben („Das Ventil befindet sich links vom Manometer“) sind schwieriger zu grounden als das Vorhandensein eines Objekts. Bitten Sie das Modell, beide Bezugselemente unabhängig voneinander mit Boxen zu grounden und die Beziehung anschließend aus den Koordinaten abzuleiten, statt sie direkt zu behaupten.

Diese Zerlegung verwandelt eine fragile relationale Einschätzung in zwei einfachere Lokalisierungsaufgaben plus eine Berechnung.

# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
    return a['box'][2] < b['box'][0]

Audio- und zeitliches Grounding

Grounding geht über Bilder hinaus. Fordern Sie bei Audio oder Video Zeitstempel als Belege: „Geben Sie die Stelle [mm:ss] an, an der dies gesagt wurde.“ Zeitliche Verweise ermöglichen eine stichprobenartige Überprüfung der Aussage anhand des Quellsegments.

  • Zeitstempel verankern Aussagen zu Transkription und Sprechersegmentierung.
  • Sie machen Zusammenfassungen sichtbar, die vom tatsächlich Gesagten abweichen.

Die Falle der Textüberschreibung

Eine selbstsichere Aussage im Textkanal kann korrekte visuelle Belege unterdrücken – das Modell gibt dem von Ihnen vorgegebenen Prior den Vorrang. Wenn Ihr Kontext besagt, dass die Rechnungssumme 400 $ beträgt, das Bild aber 450 $ zeigt, gibt ein nicht gegroundetes Modell möglicherweise einfach 400 $ wieder.

Abhilfe: Weisen Sie das Modell an, zuerst ausschließlich aus dem Bild abzuleiten, danach den bereitgestellten Text zu vergleichen und Abweichungen zu kennzeichnen, statt sie stillschweigend abzugleichen.

Grounding nachgelagert verifizieren

Grounding ist nur nützlich, wenn Sie darauf reagieren. Erstellen Sie einen Verifizierer, der die strukturierten Belege verarbeitet:

  • Erstellen Sie für jede Box erneut einen Ausschnitt und führen Sie erneut OCR für den zitierten Text aus; Abweichung -> verwerfen.
  • Geben Sie den zitierten Zeitstempel durch einen zweiten ASR-Durchlauf.
  • Behandeln Sie NOT_FOUND und Konfliktmarkierungen als Weiterleitungssignale für eine menschliche Prüfung.

Der Prompt erzeugt Belege; Ihr System setzt sie durch.

def verify(field):
    crop = image.crop(field['box'])
    read = ocr(crop)
    return similar(read, field['value']) > 0.9

Vorlage für einen Grounding-Vertrag

Ein wiederverwendbarer Grounding-Vertrag bündelt alle Techniken:

  • Beobachtungen vor Schlussfolgerungen.
  • Box plus wörtliches Zitat pro Aussage.
  • Ausweichmöglichkeit NOT_FOUND, niemals raten.
  • Ableitung aus dem Bild zuerst, danach Abgleich mit dem bereitgestellten Text und Kennzeichnung von Konflikten.
  • Zeitstempel für jede Audio- oder Videoaussage.

Definieren Sie ihn einmal und verwenden Sie ihn für jede multimodale Aufgabe wieder.

Kurztest

Ihre Kontextmetadaten geben an, dass die Gesamtsumme der Bestellung 400 $ beträgt, Sie aber vermuten, dass der gescannte Beleg davon abweichen könnte.

Rückblick: Grounding über Modalitäten hinweg

Grounding macht multimodale Ausgaben prüfbar: Beobachtungen vor Schlussfolgerungen, Boxen und wörtliche Zitate für jede Aussage, Zeitstempel für Audio und Video, eine Ausweichmöglichkeit mit NOT_FOUND sowie eine Ableitung aus dem Bild zuerst, die Konflikte mit bereitgestelltem Text kennzeichnet. Kombinieren Sie den Grounding-Vertrag mit einem nachgelagerten Verifizierer, der Ausschnitte erneut erstellt, Inhalte erneut liest und Markierungen zur Prüfung weiterleitet. Belege im Prompt, Durchsetzung im System – zusammen neutralisieren sie selbstsichere Halluzinationen.

Häufig gestellte Fragen

Ist die Lektion „Modalitätsübergreifendes Grounding“ kostenlos?

Ja — der vollständige Text von „Modalitätsübergreifendes Grounding“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Modalitätsübergreifendes Grounding“?

Visuelle Belege im Text referenzieren Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Prompt Engineering zu starten?

Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.

Wie lange dauert die Lektion „Modalitätsübergreifendes Grounding“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?

Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Text und Bilder kombinieren
  2. Modalitätsübergreifendes Grounding
  3. Audio, Text und Bild gemeinsam
  4. Multimodale Ausgaben steuern
← Zurück zu AI Prompt Engineering