0Pricing
AI Agents · Lektion

Multimodale Agents (Vision + Sprache + Aktion)

Agents, die Bildschirme sehen, Sprache hören und in der physischen oder digitalen Welt handeln — die nächste Entwicklungsstufe.

Multimodale Agents (Vision + Sprache + Aktion) ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Über Text hinaus

Moderne Agents werden zunehmend multimodal:

  • Vision — Bildschirme, Bilder und Videos sehen
  • Voice — mit Benutzern sprechen und ihnen zuhören
  • Action — Browser, Roboter und GUIs steuern

Vision-Agents

Das haben wir in Kurs 24 behandelt. Zur Wiederholung:

  • GPT-4o, Claude Sonnet 4.5 und Gemini für das Verständnis von Bildschirminhalten
  • SoM-Annotationen für zuverlässige Interaktionen
  • Computer Use für die durchgängige Steuerung von Desktop-Systemen

Voice-Agents

Mit der OpenAI Realtime API, Anthropic / Claude Voice und ElevenLabs Conversational AI können Sie Agents mit Spracheingabe und Sprachausgabe entwickeln:

# OpenAI Realtime API (WebSocket)
import websockets, json

async def main():
    async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
        await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
        async for msg in ws:
            event = json.loads(msg)
            if event['type'] == 'response.audio.delta':
                play_audio(event['delta'])

Latenzziele für Voice

Gesprochene Konversationen benötigen eine Antwortzeit unter 500 ms, sonst wirken sie unnatürlich. Strategien:

  • Streaming von ASR und TTS
  • Auf Thinking-Modelle verzichten
  • Gängige Formulierungen zwischenspeichern
  • Leichtgewichtige Modelle verwenden

Voice + Tool-Nutzung

Voice-Agents können ebenfalls Tools verwenden — Realtime APIs unterstützen Function Calling. Stellen Sie sich vor: „Fügen Sie Milch zu meiner Einkaufsliste hinzu“ -> der Agent ruft add_to_list auf.

Action: Browser- oder Computer-Nutzung

Das wurde bereits in Kurs 24 behandelt. Anthropics Computer Use, OpenAIs Operator und OpenInterpreter ermöglichen es Agents, eine reale Maschine zu steuern.

Action: Robotik

Verkörperte Agents sind die nächste Grenze. Google RT-2, Figure 02 und NVIDIA GR00T integrieren VLMs mit Robotersteuerung. Noch überwiegend Forschung; bisher gibt es nur wenige produktive Einsätze.

Videoverständnis

Gemini und GPT-4o akzeptieren Videos. Anwendungsfälle:

  • Zusammenfassungen von Überwachungsvideos
  • Extraktion von Rezepten aus Kochvideos
  • Sportanalysen
  • Zusammenfassung von Meetings aus Aufzeichnungen

Bildgenerierung als Tool

Diffusionsmodelle (DALL-E 3, Imagen, Stable Diffusion) werden zu Tools, die der Agent aufrufen kann:

tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]

Multimodales Reasoning

Agents, die mehrere Modalitäten kombinieren: „Sehen Sie sich dieses Diagramm an, transkribieren Sie diese Notizen und verfassen Sie eine E-Mail-Zusammenfassung.“ Jede Modalität übernimmt eine bestimmte Rolle.

OpenAI Realtime Toolkit

OpenAI stellt ein Open-Source-Realtime Agent SDK mit Beispielen bereit. Ein guter Ausgangspunkt, wenn Sprachagenten das Ziel sind.

Pipecat and LiveKit Agents

Open-Source-Frameworks für Sprach- und Videoagenten über WebRTC. Sie werden von vielen Start-ups verwendet, die Assistenten im Stil von Alexa entwickeln.

Datenschutz in der Multimodalität

Audio und Video enthalten besonders viele personenbezogene Daten (PII). Verschlüsseln Sie Daten im Ruhezustand, redigieren Sie Transkripte und bieten Sie Nutzern Schaltflächen zum Löschen an. Für Sprachbiometrie kann eine Einwilligung nach Artikel 9 der DSGVO erforderlich sein.

Modelle nach Latenzstufe

Für Sprach- und Videoagenten sollten Sie die schnellsten Modelle bevorzugen (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) und Reasoning-Modelle im kritischen Pfad vermeiden.

Ära der Smart Glasses

Meta Ray-Ban, Apple Vision Pro und andere Wearables bringen multimodale Agenten mit ständigem Bereitschaftsbetrieb auf den Markt. Die nächste Verbraucherkategorie für Ambient AI.

Sprachlatenz

Was ist das typische Latenzziel für dialogorientierte Sprachagenten?

Zusammenfassung

Vision (Bildschirme, Bilder, Videos), Sprache (dialogorientiert), Aktionen (Browser, Computer, Roboter). Kombinieren Sie Modalitäten für leistungsfähigere Agenten. Achten Sie auf Latenz, Datenschutz und Kosten.

Häufig gestellte Fragen

Ist die Lektion „Multimodale Agents (Vision + Sprache + Aktion)“ kostenlos?

Ja — der vollständige Text von „Multimodale Agents (Vision + Sprache + Aktion)“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Multimodale Agents (Vision + Sprache + Aktion)“?

Agents, die Bildschirme sehen, Sprache hören und in der physischen oder digitalen Welt handeln — die nächste Entwicklungsstufe. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Multimodale Agents (Vision + Sprache + Aktion)“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Agentic Reasoning (o1, o3, Reasoning-Modelle)
  2. Hybride symbolische und neuronale Agents
  3. Multimodale Agents (Vision + Sprache + Aktion)
  4. Offene Probleme: Robustheit, Alignment, Langzeitgedächtnis
← Zurück zu AI Agents