AI Prompt Engineering · Lektion

Multimodale Ausgaben steuern

Antworten mit verschiedenen Medien gestalten

Lektion 4 von 413 Schritte

Multimodale Ausgaben steuern ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Steuerung gemischter Medienausgaben

Ausgabesteuerung bedeutet, gezielt festzulegen, welche Form eine Antwort annimmt, wenn sie Text, strukturierte Daten und Verweise auf generierte oder ausgewählte Medien umfasst. Das Modell gibt standardmäßig Fließtext aus; Produktionssysteme benötigen analysierbare, renderbare und kombinierbare Artefakte.

  • Sie spezifizieren einen Render-Vertrag, statt lediglich eine Frage zu stellen.
  • Formatzuverlässigkeit ist wichtiger als Formatvielfalt – vorhersehbare Strukturen setzen sich durch.

Inhalt und Darstellung trennen

Lassen Sie das Modell strukturierte Inhalte ausgeben und rendern Sie die Medien auf Ihrer Seite. Ein Textmodell aufzufordern, rohe Bilddaten oder markup-lastige Layouts auszugeben, ist fragil; eine typisierte Beschreibung anzufordern, die Ihr Renderer in Medien umwandelt, ist robust.

Das Modell entscheidet, was dargestellt wird; Ihre Pipeline entscheidet, wie es aussieht.

block = {
  'type': 'figure',
  'caption': 'Quarterly revenue',
  'chart': {'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10, 14]},
  'alt_text': 'Bar chart rising from 10 to 14.'
}

Antwortschemata mit typisierten Blöcken

Modellieren Sie umfangreiche Antworten als geordnete Liste typisierter Blöcke: text, code, image_ref, table, chart_spec. Jeder Block enthält nur die Felder, die sein Typ benötigt. Ihr Renderer durchläuft die Liste und gibt für jeden Typ die passende Komponente aus.

So bleiben Chat-Oberflächen, Berichte und Foliengeneratoren auch bei Tausenden von Antworten zuverlässig.

schema = {
  'blocks': [
    {'type': 'text', 'value': '...'},
    {'type': 'code', 'lang': 'python', 'value': '...'},
    {'type': 'image_ref', 'id': 'fig1', 'alt': '...'},
    {'type': 'table', 'columns': [...], 'rows': [...]}
  ]
}

Medien referenzieren statt einbetten

Bevorzugen Sie Referenzen gegenüber Einbettungen. Das Modell gibt eine ID oder eine Generierungsspezifikation aus; Ihr System löst sie in ein tatsächliches Asset auf. Dadurch wird der Sprachschritt vom Medienschritt entkoppelt und Sie können Assets zwischenspeichern, neu generieren oder austauschen, ohne erneut zu prompten.

  • Einbettung: Die Antwort enthält das Asset inline (umfangreich, fragil).
  • Referenz: Die Antwort enthält einen Verweis oder ein Rezept (leicht, kombinierbar).
image_block = {
  'type': 'image_ref',
  'spec': {'prompt': 'minimal line icon of a gear', 'size': '512x512'},
  'alt': 'Settings gear icon'
}
# Pipeline calls the image model with spec, fills in the URL.

Generierungsspezifikationen beschränken

Wenn das Modell eine Spezifikation für einen nachgelagerten Generator erstellt (für Bilder, Diagramme oder TTS), beschränken Sie diese Spezifikation eng. Offene Spezifikationen driften ab; aufgezählte Optionen bleiben markenkonform und im Budget.

Geben Sie dem Modell ein kontrolliertes Vokabular vor: zulässige Diagrammarten, zulässige Bildstile und zulässige Stimmen – und verbieten Sie Abweichungen in freier Form.

chart_spec = {
  'kind': 'one of [bar, line, scatter]',   # enumerated
  'palette': 'brand_default',               # not a hex free-for-all
  'max_series': 4
}

Verpflichtende Barrierefreiheitsfelder

Jeder Medienblock sollte ein Feld für einen Alt-Text oder ein Transkript enthalten, und Sie sollten dieses im Schema verpflichtend machen. Das ist sowohl eine Anforderung an die Barrierefreiheit als auch ein Prüfpunkt: Der Alt-Text zeigt, was das Modell mit den Medien ausdrücken wollte, und Sie können dies mit der Spezifikation abgleichen.

Reihenfolge und Layoutabsicht der Blöcke

Die Reihenfolge der Blöcke ist das Layout. Wenn das Modell ein Diagramm vor dem erklärenden Absatz zurückgibt, liest sich das gerenderte Dokument falsch. Geben Sie die Layoutabsicht an: 'Erklärender Text steht vor der beschriebenen Abbildung; auf eine Abbildung folgt immer eine einzeilige Kernaussage.'

Verankern Sie Regeln für die Lesereihenfolge, damit die Blockliste eine schlüssige Erzählung ergibt.

Längen- und Dichtebudgets pro Block

Steuern Sie die Ausführlichkeit auf Blockebene, nicht global. Eine Bildunterschrift umfasst eine Zeile, eine Abschnittseinleitung einen kurzen Absatz und eine Tabelle höchstens N Zeilen. Budgets pro Block verhindern, dass das Modell eine Komponente ausufern lässt und eine andere vernachlässigt.

  • 'Bildunterschriften: maximal 12 Wörter.'
  • 'Tabellen: maximal 8 Zeilen; fassen Sie den Rest in einer letzten Zeile zusammen.'
limits = {'caption_words': 12, 'table_rows': 8, 'intro_sentences': 3}

Validierungs- und Reparaturschleifen

Ein Schema für gemischte Medien ist nur so gut wie sein Validator. Analysieren Sie die Blockliste, validieren Sie jeden Block anhand des Schemas für seinen Typ und senden Sie bei einem Fehler einen gezielten Reparatur-Prompt, der den genauen Verstoß nennt.

Reparieren ist besser als neu zu generieren: Die gesamte Antwort erneut anzufordern, verschwendet Tokens und kann die bereits korrekten Teile beschädigen.

def validate(blocks):
    for b in blocks:
        if b['type'] == 'image_ref' and 'alt' not in b:
            return f'Block {b} missing required alt text'
    return None  # ok

Streaming gemischter Medien

Beim Streaming müssen Blöcke einzeln analysierbar sein, damit die Benutzeroberfläche jeden Block nach seiner Fertigstellung rendern kann, statt auf die gesamte Antwort zu warten. Geben Sie ein wohlgeformtes JSON-Objekt pro Block aus (zeilengetrennt), statt ein einziges großes Array zu verwenden, das erst mit der abschließenden Klammer gültig wird.

Streaming Block für Block sorgt für reaktionsfähige Benutzeroberflächen und eine frühzeitige Validierung.

{'type': 'text', 'value': 'Revenue grew this quarter.'}
{'type': 'chart_spec', 'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10,14], 'alt': '...'}
{'type': 'text', 'value': 'The bulk came from new accounts.'}

Ein Vertrag für die Ausgabesteuerung

Ein vollständiger Vertrag für gemischte Medien legt fest: das Vokabular der typisierten Blöcke, Referenzen statt Einbettungen, aufgezählte Generierungsspezifikationen, verpflichtende Alt-Texte oder Transkripte, Regeln für die Lesereihenfolge, Budgets pro Block und eine streamingfreundliche Serialisierung. Bündeln Sie ihn als wiederverwendbaren Systemblock, und Ihr Renderer erhält für viele Aufgaben ein stabiles Ziel.

Kurzer Check

Sie erstellen einen Berichtsgenerator, dessen Antworten Absätze, Tabellen und Abbildungen kombinieren und von Ihrem eigenen Frontend gerendert werden.

Rückblick: Gemischte Medienantworten gestalten

Behandeln Sie umfangreiche Ausgaben als Render-Vertrag: ein Vokabular typisierter Blöcke, Medien als Referenzen oder beschränkte Generierungsspezifikationen statt als Einbettungen, verpflichtende Alt-Text- oder Transkriptfelder, explizite Regeln für die Lesereihenfolge und Budgets pro Block sowie eine streamingfreundliche Serialisierung mit Validierung und Reparatur. Trennen Sie die Entscheidungen des Modells von der Darstellung durch Ihre Pipeline, und gemischte Medienantworten werden vorhersehbar, prüfbar und einfach zu kombinieren.

Kostenlos starten

Lerne AI Prompt Engineering mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
53
Lektionen
199

Häufig gestellte Fragen

Ist die Lektion „Multimodale Ausgaben steuern“ kostenlos?

Ja — der vollständige Text von „Multimodale Ausgaben steuern“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Multimodale Ausgaben steuern“?

Antworten mit verschiedenen Medien gestalten Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Prompt Engineering zu starten?

Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Multimodale Ausgaben steuern“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?

Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Text und Bilder kombinieren
  2. Modalitätsübergreifendes Grounding
  3. Audio, Text und Bild gemeinsam
  4. Multimodale Ausgaben steuern
← Zurück zu AI Prompt Engineering