모달리티 간 근거 연결
텍스트에서 시각적 근거 참조
모달리티 간 근거 연결은(는) CoddyKit의 무료 AI Prompt Engineering 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Prompt Engineering 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.
근거 연결이 의미하는 것
근거 연결은 모든 텍스트 주장이 다른 양식의 구체적인 증거로 추적 가능해야 한다는 요구 사항입니다. 근거가 연결되지 않은 다중 양식 답변은 유창한 추측이고, 근거가 연결된 답변은 이를 뒷받침하는 픽셀(또는 오디오 프레임)로 되돌아가는 포인터를 가진 방어 가능한 주장입니다.
- 근거 연결은 불투명한 출력을 감사 가능한 출력으로 바꿉니다.
- 이는 확신에 찬 시각적 환각에 대응하는 가장 효과적인 단일 수단입니다.
증거 우선 추론 순서
모델이 결론을 내리기 전에 증거를 추출하도록 강제하세요. 결론이 먼저 생성되면 ‘증거’는 잘못된 답을 그럴듯하게 맞추는 사후 합리화가 됩니다.
응답을 관찰된 영역, 해석, 최종 답변 순서로 구성하세요.
schema = {
'observations': '[{region: str, text_read: str}]',
'inference': 'str — reasoning over observations only',
'answer': 'str'
}
# Order in the prompt enforces order in generation.경계 상자 및 영역 인용
각 시각적 주장에 대해 정규화된 대략적 좌표를 출력하도록 모델에 요청하세요. 불완전한 상자라도 유용합니다. 후속 시스템에서 해당 영역을 crop하여 다시 검증할 수 있고, 크게 잘못된 상자는 환각을 즉시 드러냅니다.
- 해상도와 관계없이 정규화된 [x0,y0,x1,y1]을 0..1 범위에서 사용하세요.
- 상자는 픽셀 단위로 정확한 검출이 아니라 위치 추정 힌트로 취급하세요.
instruction = (
'For each extracted field, return '
'{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)픽셀 인용 검증
이미지에 보이는 모든 텍스트에 대해 모델이 읽은 내용을 그대로 인용하도록 요구하세요. 그대로 인용한 내용은 확인할 수 있습니다. OCR로 표본 검사를 할 수 있고, 모델은 정확하게 옮겨 적어야 하는 값을 훨씬 덜 지어냅니다.
이 ‘읽어서 되돌려 말하기’ 제약은 비용이 적으면서도 문서, 도표, 표지판에 특히 효과적입니다.
양식 간 일관성 검사
같은 사실이 두 양식(슬라이드 이미지와 음성 설명)에 나타날 때는 모델에 이를 교차 확인하도록 요청하세요. 일치하면 신뢰도가 올라가고, 불일치 자체도 표면화할 가치가 있는 신호입니다.
- ‘그림의 캡션이 도표에 표시된 내용과 일치하나요?’
- ‘음성 설명이 화면에 표시된 숫자와 일치하나요?’
prompt = (
'You have a slide image and its transcript. '
'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
'Flag any disagreement explicitly.'
)근거 연결 결과로서의 거부
근거 연결 시스템은 ‘보이지 않음’이라고 말할 수 있어야 합니다. 명시적인 예외 경로가 없으면 모델은 빈틈을 그럴듯한 조작으로 채웁니다. 예외 경로를 제공하고 이를 보상하세요.
다음과 같이 지시하세요. ‘증거가 존재하지 않거나 판독할 수 없으면 추측하지 말고 NOT_FOUND를 반환하세요.’ 그런 다음 찾을 수 없음을 처리 흐름에서 불이익 없이 독립적인 출력으로 취급하세요.
공간 관계에 근거 연결하기
관계적 주장(‘밸브는 게이지의 왼쪽에 있습니다’)은 객체의 존재보다 근거를 연결하기가 어렵습니다. 두 참조 대상 모두에 대해 각각 상자로 근거를 연결한 다음, 관계를 직접 단정하지 말고 좌표에서 도출하도록 모델에 요청하세요.
이러한 분해는 취약한 관계 판단을 두 개의 단순한 위치 추정 작업과 산술 계산으로 바꿉니다.
# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
return a['box'][2] < b['box'][0]오디오 및 시간 근거 연결
근거 연결은 이미지 너머로도 일반화됩니다. 오디오나 비디오에서는 증거로 타임스탬프를 요구하세요. ‘이 내용이 말해진 [mm:ss]를 인용하세요.’ 시간 포인터를 사용하면 원본 구간과 대조하여 주장을 표본 검사할 수 있습니다.
- 타임스탬프는 전사 및 화자 분할 주장의 기준점이 됩니다.
- 실제로 말한 내용에서 벗어난 요약을 드러냅니다.
텍스트 우선 적용의 함정
텍스트 채널의 확신에 찬 주장은 올바른 시각적 증거를 억누를 수 있습니다 — 모델이 제공된 사전 정보를 우선하기 때문입니다. 맥락에 ‘청구서 합계는 $400입니다’라고 적혀 있지만 이미지에는 $450가 표시되어 있다면, 근거가 연결되지 않은 모델은 $400를 그대로 반복할 수 있습니다.
방어책은 모델이 먼저 이미지에서만 도출한 다음, 제공된 텍스트와 비교하고, 조용히 조정하지 말고 불일치를 표시하도록 지시하는 것입니다.
후속 단계에서 근거 연결 검증하기
근거 연결은 이를 실제로 활용할 때만 유용합니다. 구조화된 증거를 처리하는 검증기를 구축하세요.
- 각 상자 영역을 다시 잘라 인용된 텍스트를 다시 OCR 처리하세요. 불일치하면 거부합니다.
- 인용된 타임스탬프를 두 번째 ASR 처리에 다시 통과시키세요.
- 찾을 수 없음과 충돌 플래그를 사람 검토로 라우팅하는 신호로 취급하세요.
프롬프트는 증거를 생성하고, 시스템은 그 증거를 강제합니다.
def verify(field):
crop = image.crop(field['box'])
read = ocr(crop)
return similar(read, field['value']) > 0.9근거 연결 계약 템플릿
재사용 가능한 근거 연결 계약은 모든 기법을 하나로 묶습니다.
- 결론보다 관찰을 먼저 제시합니다.
- 주장마다 상자와 그대로 옮긴 인용을 제공합니다.
- 찾을 수 없음 예외 경로를 제공하고 절대 추측하지 않습니다.
- 이미지에서 먼저 도출한 다음 제공된 텍스트와 대조하고 충돌을 표시합니다.
- 오디오 또는 비디오 주장에는 타임스탬프를 사용합니다.
한 번 정식화한 뒤 모든 다중 양식 작업에서 재사용하세요.
빠른 확인
맥락 메타데이터에는 주문 총액이 $400이라고 적혀 있지만, 스캔한 이미지에는 다른 값이 표시되어 있을 수 있다고 의심됩니다.
요약: 양식 전반의 근거 연결
근거 연결은 다중 양식 출력을 감사 가능하게 만듭니다. 결론보다 관찰을 먼저 제시하고, 주장마다 상자와 그대로 옮긴 인용을 제공하며, 오디오와 비디오에는 타임스탬프를 사용하고, 찾을 수 없음 예외 경로를 제공하며, 이미지에서 먼저 도출한 뒤 제공된 텍스트와의 충돌을 표시합니다. 근거 연결 계약을 후속 검증기와 결합하여 영역을 다시 crop하고, 내용을 다시 읽고, 플래그를 검토 대상으로 라우팅하세요. 프롬프트에는 증거를, 시스템에는 강제를 배치하면 함께 확신에 찬 환각을 무력화할 수 있습니다.
자주 묻는 질문
“모달리티 간 근거 연결” 강의는 무료인가요?
네 — “모달리티 간 근거 연결” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Prompt Engineering 강의 전체를 잠금 해제할 수 있습니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.
“모달리티 간 근거 연결”에서 뭘 배우나요?
텍스트에서 시각적 근거 참조 브라우저에서 직접 실행하는 실습 코드로 AI Prompt Engineering을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Prompt Engineering을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Prompt Engineering은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.
“모달리티 간 근거 연결” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Prompt Engineering 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Prompt Engineering 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 텍스트와 이미지 결합
- 모달리티 간 근거 연결
- 오디오, 텍스트, 비전의 통합
- 멀티모달 출력 제어