AI-promptengineering · Les

Multimodale prompt engineering

Verken hoe u AI-modellen aanstuurt die informatie uit meerdere modaliteiten, zoals tekst, afbeeldingen en audio, verwerken en genereren.

Les 2 van 311 stappen

Multimodale prompt engineering is een gratis AI-promptengineering-les op CoddyKit. Dit is les 2 van 3. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject AI-promptengineering. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus AI-promptengineering bevat in totaal 3 lessen.

Introductie tot multimodale AI

Welkom bij multimodaal prompten!

Je hebt geleerd hoe je AI met tekst kunt aansturen. Maar wat als AI ook afbeeldingen kon 'zien', audio kon 'horen' of zelfs video kon 'voelen'? Dat is de kracht van multimodale AI.

In deze les leer je prompts te maken voor AI-modellen die verschillende soorten gegevens, of 'modaliteiten', begrijpen en genereren.

Modaliteiten begrijpen

Een modaliteit verwijst naar een specifiek type gegevens of informatie, zoals:

  • Tekst: De woorden die we lezen en schrijven.
  • Afbeeldingen: Foto's, tekeningen en diagrammen.
  • Audio: Spraak, muziek en geluiden.
  • Video: Bewegende beelden met geluid.

Multimodale AI-modellen zijn getraind om deze verschillende vormen van gegevens te verwerken en met elkaar in verband te brengen. Daardoor kunnen ze de wereld meer begrijpen zoals mensen dat doen.

Prompten met afbeeldingsinvoer

Een veelvoorkomende multimodale taak is een afbeelding als invoer samen met een tekstprompt gebruiken. Je kunt de AI vragen over de afbeelding stellen of beschrijven wat er gebeurt.

Hierdoor kan de AI zijn begrip baseren op visuele context, wat leidt tot nauwkeurigere en relevantere tekstreacties.

  • Voorbeeld: Upload een foto van een hond. Prompt: 'Beschrijf dit dier en raad het ras.'

Afbeeldingen genereren uit tekst

Omgekeerd kun je een gedetailleerde tekstprompt geven om een afbeelding te genereren. Dit is populair voor creatieve taken zoals kunst genereren, ontwerp en visuele verhalen vertellen.

De AI vertaalt je woorden naar een visuele weergave en brengt je beschrijvingen tot leven.

  • Voorbeeldprompt: 'Genereer een realistische afbeelding van een rustig bos bij zonsondergang, met een klein beekje dat erdoorheen stroomt en een hert dat water drinkt.'

Audio-interactie: transcriberen en genereren

Multimodale modellen kunnen ook audio verwerken en genereren. Dit biedt mogelijkheden voor spraakassistenten, het maken van inhoud en hulpmiddelen voor toegankelijkheid.

  • Audio naar tekst: Upload een audiobestand. Prompt: 'Transcribeer deze opname van de vergadering en vat de actiepunten samen.'
  • Tekst naar audio: Prompt: 'Genereer een opgewekte stem die 'Je bestelling ligt klaar om opgehaald te worden!' zegt.'

Kruismodaal begrip

De echte kracht van multimodaal prompten ontstaat door verschillende soorten invoer te combineren voor een rijker begrip.

Stel je voor dat je een afbeelding van een product en een gebruikersbeoordeling (tekst) aanlevert en de AI vraagt om het gevoel van klanten over het visuele ontwerp samen te vatten.

Hierdoor is genuanceerde analyse mogelijk die één enkele modaliteit niet zelfstandig kan bieden.

Multimodale uitvoer: rijkere reacties

Naast multimodale invoer kunnen sommige geavanceerde modellen ook multimodale uitvoer genereren. Dit betekent dat één prompt een reactie kan opleveren met zowel tekst als een afbeelding, of zelfs tekst en audio.

  • Voorbeeldprompt: 'Beschrijf het proces van fotosynthese en voeg een eenvoudig diagram toe.'

De AI kan een uitleg in tekst en een relevante afbeelding geven.

Uitdagingen en aandachtspunten

Multimodaal prompten brengt nieuwe uitdagingen met zich mee:

  • Consistentie: Ervoor zorgen dat informatie in verschillende modaliteiten elkaar niet tegenspreekt.
  • Afstemming: Ervoor zorgen dat de AI concepten tussen verschillende soorten gegevens correct met elkaar verbindt.
  • Vooringenomenheid: Vooringenomenheden in de trainingsgegevens kunnen in verschillende modaliteiten zichtbaar worden.
  • Rekenkosten: Het verwerken van meerdere modaliteiten kan veel middelen vereisen.

Voorbeeld van een multimodale API

Hier is een vereenvoudigd Python-voorbeeld van hoe je met een hypothetische multimodale API kunt werken. Let erop dat zowel tekst als een bestandspad als invoer worden doorgegeven.

Probeer het uit te voeren om de nagebootste uitvoer te bekijken!

class MultimodalAI:
  def process(self, text_prompt,
              image_path=None,
              audio_path=None):
    response = f"Processing: '{text_prompt}'"
    if image_path:
      response += f" + image: {image_path}"
    if audio_path:
      response += f" + audio: {audio_path}"
    return response + "\nAI generates: (multimodal output)"

if __name__ == "__main__":
  ai = MultimodalAI()

  # Text + Image input
  text_input = "Create a story about this image."
  image_file = "forest_cat.jpg"
  print(ai.process(text_input, image_path=image_file))

  print("\n---")

  # Text + Audio input
  text_input = "Summarize this podcast."
  audio_file = "tech_podcast.mp3"
  print(ai.process(text_input, audio_path=audio_file))

Multimodale toepassingen

Welke van de volgende situaties is het beste voorbeeld van een toepassing van multimodaal prompten?

Samenvatting: De multimodale toekomst

Je hebt de boeiende wereld van multimodale promptengineering verkend!

  • We hebben modaliteiten zoals tekst, afbeeldingen en audio gedefinieerd.
  • Je hebt geleerd om AI aan te sturen met afbeeldings- en audio-invoer.
  • Je hebt ontdekt hoe je afbeeldingen en audio uit tekst kunt genereren.
  • Je hebt de kracht van kruismodaal begrip en multimodale uitvoer leren kennen.
  • We hebben enkele belangrijke uitdagingen besproken.

Multimodale AI maakt de interactie tussen mensen en AI natuurlijker en krachtiger. Blijf experimenteren!

Gratis beginnen

Leer AI-promptengineering met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
53
Lessen
199

Veelgestelde vragen

Is de les “Multimodale prompt engineering” gratis?

Ja — je kunt hier op het web alle 3 lessen van het leerpad AI-promptengineering, waaronder “Multimodale prompt engineering”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus AI-promptengineering bevat in totaal 3 lessen.

Wat leer ik in “Multimodale prompt engineering”?

Verken hoe u AI-modellen aanstuurt die informatie uit meerdere modaliteiten, zoals tekst, afbeeldingen en audio, verwerken en genereren. Je oefent met AI-promptengineering door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met AI-promptengineering te beginnen?

Ervaring vooraf is niet nodig. AI-promptengineering op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 3.

Hoe lang duurt de les “Multimodale prompt engineering”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over AI-promptengineering?

Ja. Elke les over AI-promptengineering bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Adversarial prompting en verdediging
  2. Multimodale prompt engineering
  3. De toekomst van AI en samenwerking tussen mens en AI
← Terug naar AI-promptengineering