Promptteknik til AI · Lektion

Multimodal prompt engineering

Udforsk, hvordan De kan prompte AI-modeller, der behandler og genererer oplysninger på tværs af flere modaliteter som tekst, billeder og lyd.

Lektion 2 af 311 trin

Multimodal prompt engineering er en gratis Promptteknik til AI-lektion på CoddyKit. Dette er lektion 2 af 3. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Promptteknik til AI, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Promptteknik til AI-kurset indeholder 3 lektioner i alt.

Introduktion til multimodal AI

Velkommen til multimodal promptudvikling!

Du har lært at skrive prompter til AI med tekst. Men hvad nu, hvis AI også kunne 'se' billeder, 'høre' lyd eller endda 'forstå' video? Det er styrken ved multimodal AI.

I denne lektion undersøger vi, hvordan du formulerer prompter til AI-modeller, der forstår og genererer indhold på tværs af forskellige datatyper eller 'modaliteter'.

Forståelse af modaliteter

En modalitet er en bestemt type data eller information, f.eks.:

  • Tekst: De ord, vi læser og skriver.
  • Billeder: Fotografier, tegninger og diagrammer.
  • Lyd: Tale, musik og andre lyde.
  • Video: Billeder i bevægelse med lyd.

Multimodale AI-modeller er trænet til at behandle disse forskellige dataformer og sætte dem i relation til hinanden, så de kan forstå verden mere, som mennesker gør.

Promptning med billedinput

En almindelig multimodal opgave er at bruge et billede som input sammen med en tekstprompt. Du kan stille AI'en spørgsmål om billedet eller beskrive, hvad der sker.

Det gør det muligt for AI'en at forankre sin forståelse i en visuel kontekst, hvilket giver mere præcise og relevante tekstsvar.

  • Eksempel: Upload et billede af en hund. Prompt: 'Beskriv dette dyr, og gæt dets race.'

Generering af billeder fra tekst

Omvendt kan du give en detaljeret tekstprompt for at generere et billede. Det er populært til kreative opgaver som kunstnerisk generering, udformning eller visuel historiefortælling.

AI'en omsætter dine ord til en visuel fremstilling og bringer dine beskrivelser til live.

  • Eksempel på prompt: 'Generér et realistisk billede af en rolig skov ved solnedgang med et lille vandløb, der løber gennem den, og en hjort, der drikker vand.'

Lydinteraktion: Transskribering og generering

Multimodale modeller kan også behandle og generere lyd. Det åbner muligheder for stemmeassistenter, indholdsskabelse og værktøjer til tilgængelighed.

  • Lyd til tekst: Upload en lydfil. Prompt: 'Transskribér denne optagelse af et møde, og opsummér handlingspunkterne.'
  • Tekst til lyd: Prompt: 'Generér en glad stemme, der siger 'Din ordre er klar til afhentning!''

Tværmodal forståelse

Den virkelige styrke ved multimodal promptning kommer af at kombinere forskellige input for at opnå en mere nuanceret forståelse.

Forestil dig, at du giver et billede af et produkt sammen med en brugeranmeldelse (tekst) og beder AI'en om at opsummere kundernes holdning til produktets visuelle udformning.

Det muliggør en nuanceret analyse, som en enkelt modalitet ikke kunne levere alene.

Multimodalt output: Mere nuancerede svar

Ud over multimodale input kan nogle avancerede modeller også generere multimodale svar. Det betyder, at en enkelt prompt kan give et svar, der både indeholder tekst og et billede eller endda tekst og lyd.

  • Eksempel på prompt: 'Beskriv fotosyntesen, og medtag et enkelt diagram.'

AI'en kunne give en forklaring i tekst samt et relevant billede.

Udfordringer og overvejelser

Multimodal promptning medfører nye udfordringer:

  • Konsistens: Sørg for, at oplysninger på tværs af modaliteter ikke modsiger hinanden.
  • Overensstemmelse: Sørg for, at AI'en korrekt forbinder begreber på tværs af forskellige datatyper.
  • Bias: Skævheder i træningsdata kan komme til udtryk på tværs af modaliteter.
  • Beregningsomkostninger: Behandling af flere modaliteter kan kræve mange ressourcer.

Eksempel på multimodal API

Her er et forenklet Python-eksempel på, hvordan du kan interagere med en tænkt multimodal API. Bemærk, hvordan både tekst og en filsti sendes med som input.

Prøv at køre det for at se det simulerede resultat!

class MultimodalAI:
  def process(self, text_prompt,
              image_path=None,
              audio_path=None):
    response = f"Processing: '{text_prompt}'"
    if image_path:
      response += f" + image: {image_path}"
    if audio_path:
      response += f" + audio: {audio_path}"
    return response + "\nAI generates: (multimodal output)"

if __name__ == "__main__":
  ai = MultimodalAI()

  # Text + Image input
  text_input = "Create a story about this image."
  image_file = "forest_cat.jpg"
  print(ai.process(text_input, image_path=image_file))

  print("\n---")

  # Text + Audio input
  text_input = "Summarize this podcast."
  audio_file = "tech_podcast.mp3"
  print(ai.process(text_input, audio_path=audio_file))

Multimodale anvendelser

Hvilket af følgende scenarier er det bedste eksempel på en anvendelse af multimodal promptning?

Opsamling: Den multimodale fremtid

Du har udforsket den spændende verden inden for multimodal promptudvikling!

  • Vi definerede modaliteter som tekst, billede og lyd.
  • Du lærte at skrive prompter til AI med billed- og lydinput.
  • Du opdagede, hvordan man genererer billeder og lyd fra tekst.
  • Du forstod styrken ved tværmodal forståelse og multimodale svar.
  • Vi gennemgik nogle vigtige udfordringer.

Multimodal AI gør interaktionen mellem mennesker og AI mere naturlig og effektiv. Bliv ved med at eksperimentere!

Gratis at komme i gang

Lær Promptteknik til AI med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
199

Ofte stillede spørgsmål

Er lektionen “Multimodal prompt engineering” gratis?

Ja — alle 3 lektioner i læringssporet Promptteknik til AI, inklusive “Multimodal prompt engineering”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Promptteknik til AI-kurset indeholder 3 lektioner i alt.

Hvad lærer jeg i “Multimodal prompt engineering”?

Udforsk, hvordan De kan prompte AI-modeller, der behandler og genererer oplysninger på tværs af flere modaliteter som tekst, billeder og lyd. Du øver dig i Promptteknik til AI med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Promptteknik til AI?

Der kræves ingen tidligere erfaring. Promptteknik til AI på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 3.

Hvor lang tid tager lektionen “Multimodal prompt engineering”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Promptteknik til AI-lektion?

Ja. Alle Promptteknik til AI-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Adversarial prompting og forsvar
  2. Multimodal prompt engineering
  3. Fremtiden for AI og samarbejde mellem mennesker og AI
← Tilbage til Promptteknik til AI