Förankring mellan modaliteter
Referera till visuella belägg i text.
Förankring mellan modaliteter är en gratis lektion i AI-promptteknik på CoddyKit. Detta är lektion 2 av 4. Du kan läsa vilka 3 lektioner som helst i den här lärvägen kostnadsfritt i sin helhet – därefter låser CoddyKit PRO upp alla lektioner, plus praktisk övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Den ingår i lärvägen för AI-promptteknik, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i AI-promptteknik innehåller totalt 4 lektioner.
Vad förankring innebär
Förankring innebär att varje textpåstående måste kunna spåras till specifika belägg i en annan modalitet. Ett multimodalt svar utan förankring är en välformulerad gissning; ett förankrat svar är ett försvarbart påstående med en hänvisning tillbaka till de pixlar (eller den ljudbildruta) som styrker det.
- Förankring omvandlar ogenomskinliga utdata till granskningsbara utdata.
- Det är det enskilt mest effektiva sättet att motverka självsäkra visuella hallucinationer.
Resonemangsordning med evidens först
Tvinga modellen att extrahera belägg innan den drar slutsatsen. Om slutsatsen genereras först blir ”beläggen” en efterhandskonstruktion som passar det eventuellt felaktiga svaret.
Strukturera svaret så att observerade områden kommer först, tolkningen därefter och det slutliga svaret sist.
schema = {
'observations': '[{region: str, text_read: str}]',
'inference': 'str — reasoning over observations only',
'answer': 'str'
}
# Order in the prompt enforces order in generation.Hänvisningar till bounding boxes och regioner
Be modellen skriva ut ungefärliga normaliserade koordinater för varje visuellt påstående. Även ofullständiga bounding boxes är värdefulla: ett efterföljande system kan beskära och verifiera på nytt, och en uppenbart felaktig ruta avslöjar omedelbart en hallucination.
- Använd normaliserade [x0,y0,x1,y1] inom intervallet 0..1, så blir upplösningen irrelevant.
- Betrakta bounding boxes som lokaliseringsledtrådar, inte som pixelperfekt detektering.
instruction = (
'For each extracted field, return '
'{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)Verifiering genom att citera pixlarna
För all text som är synlig i bilden bör Ni kräva ett ordagrant citat av det modellen läser. Ett ordagrant citat kan kontrolleras: Ni kan göra en punktkontroll med OCR, och modellen löper mycket mindre risk att hitta på ett värde som den också måste transkribera exakt.
Denna begränsning att ”läsa tillbaka” är billig och oproportionerligt effektiv för dokument, diagram och skyltar.
Kontroller av konsistens mellan modaliteter
När samma fakta förekommer i två modaliteter (en bild av en presentation och den talade berättarrösten) bör Ni be modellen att korskontrollera dem. Överensstämmelse höjer konfidensen; oenighet är i sig en signal som bör synliggöras.
- ”Stämmer figurens bildtext med det diagrammet visar?”
- ”Stämmer berättarrösten överens med siffran på skärmen?”
prompt = (
'You have a slide image and its transcript. '
'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
'Flag any disagreement explicitly.'
)Avstående som förankringsresultat
Ett förankrat system måste få säga ”inte synligt”. Utan en uttrycklig utväg fyller modellen luckor med plausibla fabriceringar. Tillhandahåll en sådan utväg och belöna användningen av den.
Instruera modellen: ”Om belägget inte finns eller är oläsligt ska Ni returnera NOT_FOUND i stället för att gissa.” Gör sedan NOT_FOUND till ett förstahandsresultat som inte bestraffas i Er pipeline.
Förankra spatiala relationer
Relationella påståenden (”ventilen är till vänster om mätaren”) är svårare att förankra än objektförekomst. Be modellen förankra båda referenterna separat med bounding boxes och härled därefter relationen från koordinaterna i stället för att hävda den direkt.
Denna uppdelning omvandlar en skör relationell bedömning till två enklare lokaliseringsuppgifter plus aritmetik.
# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
return a['box'][2] < b['box'][0]Förankring av ljud och tid
Förankring kan användas även utanför bilder. För ljud eller video bör Ni kräva tidsstämplar som belägg: ”ange [mm:ss] där detta sades”. Temporala hänvisningar gör det möjligt att kontrollera påståendet mot källsegmentet.
- Tidsstämplar förankrar påståenden om transkribering och talaridentifiering.
- De avslöjar sammanfattningar som avviker från det som faktiskt sades.
Fällan med textöverskrivning
Ett självsäkert påstående i textkanalen kan undertrycka korrekta visuella belägg – modellen följer det förhandsantagande Ni har tillhandahållit. Om Er kontext säger ”fakturans totalsumma är $400” medan bilden visar $450, kan en oförankrad modell upprepa $400.
Försvar: instruera modellen att först härleda svaret enbart från bilden, därefter jämföra med den tillhandahållna texten och flagga avvikelser i stället för att stämma av dem i tysthet.
Verifiera förankring i efterföljande steg
Förankring är bara användbar om Ni agerar utifrån den. Bygg en verifierare som tar emot de strukturerade beläggen:
- Beskär varje bounding box på nytt och kör OCR på det citerade texten; avvikelse -> avvisa.
- Spela upp den angivna tidsstämpeln genom en andra ASR-körning.
- Behandla NOT_FOUND och konfliktflaggor som styrsignaler för manuell granskning.
Prompten skapar belägg; Ert system verkställer dem.
def verify(field):
crop = image.crop(field['box'])
read = ocr(crop)
return similar(read, field['value']) > 0.9Mall för ett förankringskontrakt
Ett återanvändbart förankringskontrakt samlar alla tekniker:
- Observationer före slutsatser.
- Bounding box + ordagrant citat för varje påstående.
- Utvägen NOT_FOUND – gissa aldrig.
- Bildförst-härledning, därefter avstämning mot tillhandahållen text och flaggning av konflikter.
- Tidsstämplar för alla påståenden om ljud eller video.
Formalisera det en gång och återanvänd det för alla multimodala uppgifter.
Snabbkontroll
Era kontextmetadata anger att totalsumman är $400, men Ni misstänker att den inskannade bilden kan visa något annat.
Sammanfattning: förankring mellan modaliteter
Förankring gör multimodala utdata granskningsbara: observationer före slutsatser, bounding boxes och ordagranna citat för varje påstående, tidsstämplar för ljud/video, en utväg med NOT_FOUND samt bildförst-härledning som flaggar konflikter med tillhandahållen text. Kombinera förankringskontraktet med en efterföljande verifierare som beskär på nytt, läser av på nytt och skickar flaggor till granskning. Belägg i prompten, verkställighet i systemet – tillsammans neutraliserar de självsäkra hallucinationer.
Lär dig AI-promptteknik med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 53
- Lektioner
- 199
Vanliga frågor
Är lektionen ”Förankring mellan modaliteter” gratis?
Ja – du kan läsa vilka 3 lektioner som helst i lärvägen AI-promptteknik, inklusive ”Förankring mellan modaliteter”, kostnadsfritt i sin helhet här på webben. Därefter låser CoddyKit PRO upp alla lektioner, plus interaktiv övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Kursen i AI-promptteknik innehåller totalt 4 lektioner.
Vad lär jag mig i ”Förankring mellan modaliteter”?
Referera till visuella belägg i text. Ni övar på AI-promptteknik med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig AI-promptteknik?
Du behöver inga förkunskaper. Utbildningen i AI-promptteknik på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 4.
Hur lång tid tar lektionen ”Förankring mellan modaliteter”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här AI-promptteknik-lektionen?
Ja. Varje AI-promptteknik-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Kombinera text och bilder
- Förankring mellan modaliteter
- Ljud, text och syn tillsammans
- Styra multimodala utdata