0Pricing
AI Prompt Engineering · Lektion

Audio, Text und Bild gemeinsam

Mehrere Eingaben koordinieren

Audio, Text und Bild gemeinsam ist eine kostenlose AI Prompt Engineering-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Prompt Engineering-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Drei Kanäle, ein Kontext

Audio, Text und Vision zu koordinieren bedeutet, drei Eingabeströme zu einem einzigen kohärenten Kontext zu orchestrieren. Jede Modalität hat eigene Tokenkosten, ein eigenes Treueprofil und eigene Fehlerquellen – dennoch führt das Modell sie in einem gemeinsamen Aufmerksamkeitsraum zusammen.

  • Audio: zeitbezogen, geordnet, bei Komprimierung verlustbehaftet.
  • Vision: räumlich, durch ein Kachelbudget begrenzt, empfindlich gegenüber Detailverlust.
  • Text: präzise und kostengünstig, kann aber die anderen Modalitäten überschreiben.

Die Kunst besteht darin, sie so anzuordnen, dass jede die anderen verstärkt, statt sie zu überlagern.

Rollen der Modalitäten statt Modalitätensuppe

Weisen Sie jeder Eingabe im Prompt eine ausdrückliche Rolle zu. Unklarheit darüber, welcher Kanal maßgeblich ist, führt bei wiederholten Ausführungen zu inkonsistenten Antworten.

  • Vision = Ground Truth für das, was gezeigt wird.
  • Audio-Transkript = das, was darüber gesagt wird.
  • Textanweisung = Aufgabenvertrag und Vorrangregeln.

Legen Sie die Rollen zu Beginn fest, damit das Modell weiß, welche Quelle bei einem Konflikt Vorrang hat.

header = (
  'INPUTS: (1) a video frame [authoritative for visible state], '
  '(2) an audio transcript [authoritative for spoken intent], '
  '(3) this instruction [defines the task]. '
  'On conflict, prefer the frame for state and the transcript for intent.'
)

Audio an Frames ausrichten

Audio und Vision müssen zeitlich ausgerichtet sein, sonst verknüpft das Modell die falschen Wörter mit dem falschen Bild. Stellen Sie eine explizite Ausrichtung bereit: Versehen Sie das Transkript und die Frames mit Zeitstempeln und lassen Sie das Modell sie anhand der Zeit zusammenführen.

Ohne Ausrichtungsmetadaten rät das Modell die Zuordnung – für lose Aufgaben ausreichend, für synchronisierte Analysen fatal.

payload = {
  'frames': [{'t': 0.0, 'image': f0}, {'t': 2.5, 'image': f1}],
  'transcript': [
    {'start': 0.0, 'end': 2.4, 'text': 'Now I tighten the bolt.'},
    {'start': 2.5, 'end': 5.0, 'text': 'It is fully seated.'}
  ]
}

Vorabtranskription vs. Roh-Audio

Sie können Roh-Audio an ein natives Audiomodell übergeben oder es in einem dedizierten ASR-Schritt vorab transkribieren und den Text übergeben. Beide Varianten haben Vor- und Nachteile.

  • Roh-Audio: erhält Prosodie, Tonfall und überlappende Sprache, kostet aber mehr Tokens und lässt sich schwieriger grounden.
  • Vorab transkribiert: kostengünstig und anhand von Zeitstempeln zitierbar, verwirft aber nicht-lexikalische Hinweise (Sarkasmus, Dringlichkeit).

Wählen Sie abhängig von der Aufgabe: Emotion/Absicht -> Roh-Audio; faktische Extraktion -> Transkript.

Reihenfolge der Interleaving-Elemente

Die Reihenfolge, in der die Kanäle erscheinen, prägt die Aufmerksamkeit. Eine robuste Standardeinstellung für Analyseaufgaben:

  1. Aufgabenvertrag und Rollen (Text).
  2. Visuelle Belege (Frames), jeweils beschriftet und mit Zeitstempel versehen.
  3. Audio-Transkript mit Zeitstempeln.
  4. Die konkrete Frage (Text), unter Bezugnahme auf Beschriftungen und Zeitangaben.

Wenn Sie die Frage zuletzt platzieren, kann sie sich auf alles beziehen, was bereits kodiert wurde.

Token-Budget-Triage

Drei Kanäle konkurrieren um ein Kontextfenster. Die Bildverarbeitung verursacht die meisten Kosten, unkomprimiertes Audio folgt an zweiter Stelle. Priorisieren Sie vor dem Senden:

  • Erfassen Sie Frames in der für die Aufgabe erforderlichen Rate – nicht jeden einzelnen Frame.
  • Schneiden Sie die Frames auf den Bereich mit der relevanten Aktion zu.
  • Segmentieren Sie das Audio in relevante Abschnitte und entfernen Sie die Stille.

Setzen Sie das Budget dort ein, wo die Antwort zu finden ist.

def select_frames(frames, fps_target, src_fps):
    step = max(1, round(src_fps / fps_target))
    return frames[::step]

Modalübergreifende Bestätigung

Der größte Vorteil von Multi-Input-Prompting ist die Bestätigung: Wenn sich dieselbe Tatsache unabhängig aus zwei Kanälen ableiten lässt, ist Übereinstimmung ein starkes Indiz und eine Abweichung ein Warnsignal.

Fordern Sie das Modell auf, jede wichtige Tatsache für jeden Kanal einzeln abzuleiten und die Übereinstimmung zu melden, statt alles zu einer zusammengeführten Antwort zu verdichten, die verbirgt, welcher Quelle es vertraut hat.

ask = (
  'For each claim report: from_vision, from_audio, agree(bool). '
  'If only one channel supports it, say which and lower confidence.'
)

Umgang mit fehlenden oder beeinträchtigten Kanälen

Reale Eingaben sind oft beeinträchtigt: ein undeutliches Audiostück, ein unscharfer Frame, ein gekürztes Transkript. Geben Sie dem Modell vor, wie es mit unvollständigen Belegen umgehen soll, statt es den fehlenden Kanal frei erfinden zu lassen.

  • 'Wenn das Audio in einem Abschnitt nicht verständlich ist, markieren Sie ihn mit [INAUDIBLE].'
  • 'Wenn ein Frame zu unscharf zum Lesen ist, geben Sie für dieses Feld NOT_LEGIBLE zurück.'

Graceful Degradation ist besser als stilles Erfinden.

Koreferenz von Sprecher und Objekt

Anspruchsvolle multimodale Aufgaben erfordern die Verknüpfung von wer spricht (Audio-Diarisierung) mit wer sichtbar ist (Bildverarbeitung). Machen Sie diese Koreferenz explizit: Fordern Sie das Modell auf, Sprecherlabels anhand von Zeitangaben und sichtbaren Hinweisen wie Lippenbewegungen oder Gesten den Personen im Frame zuzuordnen.

Fordern Sie für jede Zuordnung eine Begründung sowohl mit einem Zeitstempel als auch mit einem visuellen Hinweis.

binding = {
  'speaker': 'S1', 'person_box': [0.1,0.2,0.4,0.9],
  'evidence': 'lips move during 3.2-4.1s; gestures while speaking'
}

Ausgabe: Zusammengeführt, aber nachvollziehbar

Die endgültige Antwort sollte zur besseren Lesbarkeit zusammengeführt sein, darunter jedoch die Nachvollziehbarkeit für jeden Kanal bewahren. Geben Sie ein strukturiertes Objekt aus: die zusammengefasste Schlussfolgerung sowie die unterstützenden Belege aus jeder Modalität mit Zeitstempel oder Box.

So können Menschen die praktische Zusammenfassung übernehmen und trotzdem jede einzelne Aussage bis zu ihrem Ursprungskanal zurückverfolgen.

out = {
  'summary': 'The technician seated the bolt correctly.',
  'evidence': [
    {'modality': 'vision', 'box': [0.3,0.4,0.6,0.7], 't': 2.5},
    {'modality': 'audio', 'quote': 'It is fully seated.', 't': 3.0}
  ]
}

Eine Orchestrierungs-Checkliste

Überprüfen Sie vor jedem tri-modalen Aufruf:

  • Rollen und Prioritäten sind angegeben.
  • Frames und Transkript sind mit Zeitstempeln versehen und aufeinander ausgerichtet.
  • Die Kanäle sind so priorisiert, dass sie in das Budget passen.
  • Bestätigung und das Markieren von Abweichungen sind angefordert.
  • Tokens für Beeinträchtigungen sind definiert (INAUDIBLE, NOT_LEGIBLE).
  • Die Ausgabe ist zusammengeführt, aber anhand der Belege nachvollziehbar.

Jeder Punkt schließt einen bestimmten Fehlerfall der Multi-Input-Fusion.

Kurzer Check

Sie analysieren ein Tutorialvideo und müssen für jeden Schritt feststellen, ob die gesprochene Aussage des Erzählers mit der auf dem Bildschirm ausgeführten Aktion übereinstimmt.

Rückblick: Mehrere Eingaben koordinieren

Tri-modales Prompting gelingt, wenn Sie den Kanälen explizite Rollen und Prioritäten zuweisen, Audio und Frames anhand von Zeitstempeln ausrichten, jeden Kanal auf das verfügbare Budget abstimmen und eine kanalweise Bestätigung mit Tokens für fehlende Belege anfordern. Entscheiden Sie anhand der Bedeutung der Prosodie zwischen Roh-Audio und vorab erstelltem Transkript. Liefern Sie eine zusammengeführte Zusammenfassung, in der sich trotzdem jede Aussage bis zu einer Box oder einem Zeitstempel zurückverfolgen lässt – bequem zu lesen und prüfbar.

Häufig gestellte Fragen

Ist die Lektion „Audio, Text und Bild gemeinsam“ kostenlos?

Ja — der vollständige Text von „Audio, Text und Bild gemeinsam“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Prompt Engineering-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Prompt Engineering-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Audio, Text und Bild gemeinsam“?

Mehrere Eingaben koordinieren Du übst AI Prompt Engineering mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Prompt Engineering zu starten?

Keine Vorkenntnisse erforderlich. AI Prompt Engineering auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Audio, Text und Bild gemeinsam“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Prompt Engineering-Lektion Code schreiben und ausführen?

Ja. Jede AI Prompt Engineering-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Text und Bilder kombinieren
  2. Modalitätsübergreifendes Grounding
  3. Audio, Text und Bild gemeinsam
  4. Multimodale Ausgaben steuern
← Zurück zu AI Prompt Engineering