Grounding på tværs af modaliteter
Referér til visuelle beviser i tekst.
Grounding på tværs af modaliteter er en gratis Promptteknik til AI-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Promptteknik til AI, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Promptteknik til AI-kurset indeholder 4 lektioner i alt.
Hvad forankring betyder
Forankring er kravet om, at enhver tekstlig påstand skal kunne spores til specifik dokumentation i en anden modalitet. Et multimodalt svar uden forankring er et velformuleret gæt; et forankret svar er en forsvarlig påstand med en henvisning tilbage til de pixels (eller den lydsekvens), der underbygger den.
- Forankring omdanner uigennemsigtigt output til output, der kan revideres.
- Det er det mest effektive enkeltgreb mod selvsikre visuelle hallucinationer.
Rækkefølge med dokumentation først
Tving modellen til at udtrække dokumentation før den drager en konklusion. Hvis konklusionen genereres først, bliver 'dokumentationen' en efterrationalisering, der passer til det (muligvis forkerte) svar.
Strukturér svaret, så observerede områder kommer først, fortolkningen derefter og det endelige svar til sidst.
schema = {
'observations': '[{region: str, text_read: str}]',
'inference': 'str — reasoning over observations only',
'answer': 'str'
}
# Order in the prompt enforces order in generation.Citater af afgrænsningsbokse og områder
Bed modellen om at angive omtrentlige, normaliserede koordinater for hver visuel påstand. Selv upræcise bokse er værdifulde: Et efterfølgende system kan beskære og kontrollere igen, og en helt forkert boks afslører straks en hallucination.
- Brug normaliserede [x0,y0,x1,y1] i intervallet 0..1, så opløsningen er irrelevant.
- Betragt bokse som lokaliseringshints, ikke som pixelperfekt detektion.
instruction = (
'For each extracted field, return '
'{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)Verifikation ved at citere pixels
For tekst, der er synlig i billedet, skal du kræve et ordret citat af det, modellen læser. Et ordret citat kan kontrolleres: Du kan lave stikprøver med OCR, og modellen har langt mindre tilbøjelighed til at opfinde en værdi, som den også skal transskribere nøjagtigt.
Denne begrænsning om at 'læse det tilbage' er billig og uforholdsmæssigt effektiv til dokumenter, diagrammer og skilte.
Kontrol af sammenhæng på tværs af modaliteter
Når den samme oplysning forekommer i to modaliteter (et billede af en slide og den tilhørende mundtlige fortælling), skal du bede modellen om at krydskontrollere dem. Overensstemmelse øger sikkerheden; uoverensstemmelse er i sig selv et signal, der er værd at gøre synligt.
- 'Stemmer figurens billedtekst overens med det, diagrammet viser?'
- 'Stemmer fortællingen overens med tallet på skærmen?'
prompt = (
'You have a slide image and its transcript. '
'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
'Flag any disagreement explicitly.'
)Afvisning som resultat af forankring
Et forankret system skal have lov til at sige 'ikke synligt'. Uden en udtrykkelig nødudgang udfylder modellen hullerne med sandsynlig opdigtning. Giv den en sådan mulighed, og beløn brugen af den.
Instruér: 'Hvis dokumentationen ikke findes eller er ulæselig, skal du returnere NOT_FOUND i stedet for at gætte.' Gør derefter NOT_FOUND til et førsteklasses output, som ikke straffes, i dit procesforløb.
Forankring af rumlige relationer
Relationelle påstande ('ventilen er til venstre for måleren') er sværere at forankre end objekters tilstedeværelse. Bed modellen om at forankre begge henviste objekter uafhængigt med bokse, og udled derefter relationen fra koordinaterne i stedet for at fremsætte den direkte.
Denne opdeling omdanner en skrøbelig relationel vurdering til to enklere lokaliseringsopgaver plus aritmetik.
# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
return a['box'][2] < b['box'][0]Forankring af lyd og tid
Forankring rækker ud over billeder. For lyd eller video skal du kræve tidsstempler som dokumentation: 'Angiv tidsstemplet [mm:ss], hvor dette blev sagt.' Tidsmæssige henvisninger lader dig stikprøvekontrollere påstanden mod kildesekvensen.
- Tidsstempler forankrer påstande om transskription og taleridentifikation.
- De afslører opsummeringer, der afviger fra det, der faktisk blev sagt.
Fælden med tekstens tilsidesættelse
En selvsikker påstand i tekstkanalen kan undertrykke korrekte visuelle oplysninger — modellen føjer sig efter den forudantagelse, du har leveret. Hvis din kontekst siger 'fakturabeløbet er 400 $', mens billedet viser 450 $, kan en model uden forankring gentage 400 $.
Forsvar: Instruér modellen i først udelukkende at udlede svaret fra billedet, derefter sammenligne med den medfølgende tekst og markere uoverensstemmelser i stedet for at sammenholde dem i stilhed.
Verifikation af forankring efterfølgende
Forankring er kun nyttig, hvis du handler på den. Opbyg en verifikator, der modtager den strukturerede dokumentation:
- Beskær hver boks igen, og kør OCR på den citerede tekst igen; uoverensstemmelse -> afvis.
- Afspil det angivne tidsstempel gennem en anden ASR-gennemgang.
- Betragt NOT_FOUND og konfliktmarkeringer som signaler til at sende sagen til manuel gennemgang.
Prompten producerer dokumentationen; dit system håndhæver den.
def verify(field):
crop = image.crop(field['box'])
read = ocr(crop)
return similar(read, field['value']) > 0.9Skabelon til en forankringsaftale
En genanvendelig forankringsaftale samler alle teknikkerne:
- Observationer før konklusioner.
- Boks og ordret citat for hver påstand.
- Nødudgangen NOT_FOUND — gæt aldrig.
- Udledning fra billedet først, derefter sammenholdelse med den medfølgende tekst og markering af konflikter.
- Tidsstempler for enhver påstand om lyd eller video.
Fastlæg den én gang, og genbrug den på tværs af alle multimodale opgaver.
Hurtigt tjek
Dine kontekstmetadata angiver, at ordretotalen er 400 $, men du har mistanke om, at det scannede billede kan afvige.
Opsummering: Forankring på tværs af modaliteter
Forankring gør multimodalt output muligt at revidere: observationer før konklusioner, bokse og ordrette citater for hver påstand, tidsstempler for lyd og video, en nødudgang med NOT_FOUND samt udledning fra billedet først, der markerer konflikter med den medfølgende tekst. Kombinér forankringsaftalen med en efterfølgende verifikator, der beskærer igen, genlæser og sender markeringer til gennemgang. Dokumentation i prompten, håndhævelse i systemet — tilsammen neutraliserer de selvsikker hallucination.
Lær Promptteknik til AI med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 53
- Lektioner
- 199
Ofte stillede spørgsmål
Er lektionen “Grounding på tværs af modaliteter” gratis?
Ja — alle 3 lektioner i læringssporet Promptteknik til AI, inklusive “Grounding på tværs af modaliteter”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Promptteknik til AI-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Grounding på tværs af modaliteter”?
Referér til visuelle beviser i tekst. Du øver dig i Promptteknik til AI med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Promptteknik til AI?
Der kræves ingen tidligere erfaring. Promptteknik til AI på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.
Hvor lang tid tager lektionen “Grounding på tværs af modaliteter”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Promptteknik til AI-lektion?
Ja. Alle Promptteknik til AI-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Kombination af tekst og billeder
- Grounding på tværs af modaliteter
- Lyd, tekst og syn samlet
- Kontrol af multimodalt output