AI Prompt Engineering · Lektion

Text und Bilder kombinieren

Einheitliche multimodale Prompts

Lektion 1 von 413 Schritte

Text und Bilder kombinieren ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Der einheitliche multimodale Prompt

Ein multimodaler Prompt ist nicht einfach Text mit einem angehängten Bild. Er ist eine einzige verschachtelte Sequenz, in der Bild- und Text-Tokens denselben Kontext belegen und sich gegenseitig Aufmerksamkeit zuweisen. Das Modell „betrachtet nicht zuerst das Bild und liest dann den Text“ – es verarbeitet einen zusammengeführten Token-Stream.

  • Bildbereiche werden in denselben Embedding-Raum wie Text-Tokens projiziert.
  • Die Reihenfolge ist wichtig: Eine Frage, die vor einem Bild steht, aktiviert andere Aufmerksamkeitsmuster als eine Frage, die danach steht.
  • Sie verfassen einen Prompt mit zwei Darstellungsformen, nicht zwei Prompts.

Reihenfolge der Verschachtelung und Verankerung

Wo Sie das Bild im Verhältnis zur Anweisung platzieren, verändert das Verhalten. Wenn Sie die Anweisung nach dem Bild platzieren, kann das Modell die Frage anhand dessen formulieren, was es bereits kodiert hat. Wenn Sie sie vor dem Bild platzieren, wird das Bild zum Beleg für eine zuvor festgelegte Aufgabe.

Beschriften Sie bei Prompts mit mehreren Bildern jedes Bild inline, damit späterer Text eindeutig darauf verweisen kann ([Image 1], [Image 2]).

messages = [
  {'role': 'user', 'content': [
    {'type': 'text', 'text': 'You will see two product photos.'},
    {'type': 'text', 'text': 'Image 1:'},
    {'type': 'image', 'source': img_a},
    {'type': 'text', 'text': 'Image 2:'},
    {'type': 'image', 'source': img_b},
    {'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
  ]}
]

Aufgabenrahmung vor dem Encoding

Vision-Encoder sind verlustbehaftet: Details, die für die implizite Aufgabe nicht relevant sind, können beim Pooling verworfen werden. Wenn Sie die Aufgabe vor dem Bild nennen, lenken Sie das Modell darauf, den relevanten Regionen Aufmerksamkeit zu widmen.

  • Generische Anfragen nach Bildbeschreibungen liefern generische Merkmale.
  • Eine spezifische Frage („Zählen Sie die Widerstände auf der Platine“) konzentriert das Repräsentationsbudget auf die relevanten Teilregionen.

Legen Sie die Spezifik vorab fest, wenn feine Details benötigt werden.

Auflösungs- und Kachelbudgets

Die meisten Vision-Modelle teilen hochauflösende Bilder in Kacheln mit fester Größe auf, die jeweils Tokens kosten. Ein Bild mit 2000x2000 Pixeln kann in viele Kacheln aufgeteilt werden, die jeweils heruntergerechnet werden. Das Tokenbudget ist die stille Einschränkung multimodaler Prompts.

  • Schneiden Sie vor dem Senden die relevante Region aus – verlassen Sie sich nicht darauf, dass das Modell zoomt.
  • Senden Sie bei umfangreichen Dokumenten Ausschnitte der einzelnen Seiten statt eines einzigen Bildes der gesamten Seite.
  • Beachten Sie die maximale Kachelanzahl Ihres Anbieters; darüber hinaus wird kleiner Text unleserlich.
def estimate_image_tokens(w, h, tile=512, per_tile=256):
    import math
    tiles = math.ceil(w / tile) * math.ceil(h / tile)
    return tiles * per_tile + per_tile  # + thumbnail

Text als strukturiertes Schema für Vision

Kombinieren Sie das Bild mit einem expliziten Ausgabeschema im Textkanal. Das Bild liefert den Inhalt, der Text den Vertrag. Das ist deutlich zuverlässiger als eine freie Beschreibung.

Fordern Sie JSON an, dessen Schlüssel den erwarteten Entitäten entsprechen, und weisen Sie das Modell an, für nicht sichtbare Felder null auszugeben – dadurch werden halluzinierte Details unterdrückt.

instruction = (
  'Extract from the receipt image. Return JSON: '
  '{"merchant": str|null, "total": number|null, '
  '"date": str|null, "line_items": [{"name": str, "price": number}]}. '
  'Use null when a field is not legible. Do not invent values.'
)

Disambiguierung durch deiktische Verweise

Deiktische Verweise („dieses“, „das linke“, „das hervorgehobene Feld“) verknüpfen Text mit Bildregionen. Wenn Sie das Bild vorab annotieren können (ein Rechteck einzeichnen, einen Pfeil hinzufügen), ist der Textverweis deutlich robuster als eine rein räumliche Beschreibung.

  • Räumliche Angaben („oben rechts“) sind bei Drehungen oder Zuschnitten fehleranfällig.
  • Ein überlagerter nummerierter Marker zusammen mit „Objekt #3“ ist eindeutig.
  • Die Vorverarbeitung des Bildes zum Hinzufügen von Markern ist ein legitimer Schritt des Prompt-Engineerings.

Few-Shot mit gemischten Modalitäten

Sie können Bild-zu-Text-Beispiele bereitstellen, um Format und Argumentationsstil festzulegen. Jedes Beispiel ist ein verschachteltes Paar aus (Bild, idealer Antwort). Das Modell leitet die Zuordnung aus den Demonstrationen ab.

Halten Sie die Beispielbilder repräsentativ für die tatsächliche Verteilung – ein Beispiel aus einer anderen Domäne vermittelt die falsche Merkmalsauswahl.

shots = [
  ('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
  ('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
  ('image', target_chart), ('text', 'Trend:')  # model completes
]

Aussagen auf Pixel zurückführen

Fordern Sie bei Extraktionen mit hohen Anforderungen, dass das Modell angibt, wo im Bild jede Aussage ihren Ursprung hat. Ungefähre Bounding-Boxen oder zitierter Text aus dem Bild dienen als überprüfbare Belege und reduzieren selbstsichere Erfindungen drastisch.

  • Verwenden Sie normalisierte [x0,y0,x1,y1]-Koordinaten pro Feld.
  • „Zitieren Sie für jeden Wert den genauen gelesenen Beschriftungstext.“

Grounding macht aus einer undurchsichtigen Antwort eine prüfbare.

Fehlerquellen, gegen die Sie sich schützen sollten

Multimodale Modelle versagen auf charakteristische Weise:

  • OCR-Abweichungen bei kleinen oder stilisierten Schriftarten – Ziffern wie 1/7 und 0/O werden verwechselt.
  • Zusammenbruch beim Zählen bei mehr als etwa 6 ähnlichen Objekten.
  • Beschreibungsverzerrung: Das typische Szenario wird beschrieben statt des tatsächlichen.
  • Überschreibung durch den Textkanal: Eine selbstsichere falsche Textaussage kann korrekte visuelle Belege unterdrücken.

Fordern Sie zur Abhilfe, dass das Modell zuerst aus dem Bild ableitet und sich anschließend mit allen Textaussagen auseinandersetzt.

Prompts zum Abgleich

Wenn Textkontext und Bild widersprüchlich sind, müssen Sie den Vorrang ausdrücklich festlegen – das Modell verfügt über keine Standardrichtlinie, der Sie vertrauen können. Schreiben Sie beispielsweise: „Wenn das Bild den bereitgestellten Metadaten widerspricht, vertrauen Sie dem Bild und kennzeichnen Sie die Abweichung.“

Dieser eine Satz verwandelt einen stillen Fehler in einen expliziten, sichtbaren Konflikt, den Ihre nachgelagerte Pipeline zur Prüfung weiterleiten kann.

policy = (
  'You are given metadata AND a photo. '
  'When they disagree, prefer the photo as ground truth. '
  'Emit {"value": ..., "conflict": bool, "note": str}.'
)

Eine Fusionspipeline entwerfen

Multimodales Prompting in der Produktion ist eine Pipeline, kein einzelner Aufruf:

  • Vorverarbeiten: zuschneiden, annotieren, auf das Budget herunterskalieren.
  • Zusammenführen: mit einer aufgabenorientierten Anweisung und einem Ausgabeschema verschachteln.
  • Grounding durchführen: Belege für jede Aussage verlangen.
  • Abgleichen: den Vorrang zwischen den Modalitäten festlegen.
  • Validieren: JSON parsen, Nullwerte und Konfliktmarkierungen prüfen.

Jede Phase verkleinert die Fehlerfläche, die reines Prompting nicht beseitigen kann.

Kurztest

Sie müssen Kleingedrucktes aus einem hochauflösenden Vertragsscan extrahieren und benötigen zuverlässige Zahlen.

Rückblick: Text und Bilder zusammenführen

Ein einheitlicher multimodaler Prompt ist ein einziger verschachtelter Tokenstrom. Die wichtigsten Schritte: aufgabenorientierte Rahmung zur Steuerung des Vision-Encoders, Bewusstsein für Auflösung und Kachelung durch Zuschneiden, explizite Ausgabeschemata mit Feldern, die null zulassen, Grounding auf Pixelebene für jede Aussage und ein festgelegter Vorrang der Modalitäten bei Konflikten. Behandeln Sie das Ganze als Pipeline – vorverarbeiten, zusammenführen, Grounding durchführen, abgleichen, validieren – dann werden die fragilen Aspekte des Vision-Promptings kontrollierbar.

Kostenlos starten

Lerne AI Prompt Engineering mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
53
Lektionen
199

Häufig gestellte Fragen

Ist die Lektion „Text und Bilder kombinieren“ kostenlos?

Ja — der vollständige Text von „Text und Bilder kombinieren“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Text und Bilder kombinieren“?

Einheitliche multimodale Prompts Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Prompt Engineering zu starten?

Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „Text und Bilder kombinieren“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?

Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Text und Bilder kombinieren
  2. Modalitätsübergreifendes Grounding
  3. Audio, Text und Bild gemeinsam
  4. Multimodale Ausgaben steuern
← Zurück zu AI Prompt Engineering