텍스트와 이미지 결합
통합 멀티모달 프롬프트
텍스트와 이미지 결합은(는) CoddyKit의 무료 AI Prompt Engineering 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Prompt Engineering 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.
통합 멀티모달 프롬프트
멀티모달 프롬프트는 텍스트에 첨부 이미지를 더한 것이 아닙니다. 이미지 토큰과 텍스트 토큰이 동일한 문맥 안에 함께 배치되고 서로에 주의를 기울이는 하나의 인터리빙된 시퀀스입니다. 모델은 '그림을 본 다음 텍스트를 읽는' 것이 아니라 융합된 토큰 스트림을 처리합니다.
- 이미지 패치는 텍스트 토큰과 동일한 임베딩 공간으로 투영됩니다.
- 순서가 중요합니다. 이미지를 앞에 둔 질문은 이미지를 뒤에 둔 질문과 다른 주의를 유도합니다.
- 두 가지 표면 형식을 가진 하나의 프롬프트를 작성하는 것이지, 두 개의 프롬프트를 작성하는 것이 아닙니다.
인터리빙 순서와 기준점 설정
지침과 이미지의 상대적인 배치는 모델의 행동을 바꿉니다. 이미지를 먼저 배치하고 지침을 그 뒤에 두면 모델은 이미 인코딩한 내용에 따라 질문을 해석합니다. 지침을 앞에 두면 이미지는 미리 제시된 작업에 대한 근거가 됩니다.
여러 이미지가 있는 프롬프트에서는 각 이미지를 본문 안에서 표시하여 이후 텍스트가 이미지를 모호하지 않게 참조할 수 있도록 하십시오([Image 1], [Image 2]).
messages = [
{'role': 'user', 'content': [
{'type': 'text', 'text': 'You will see two product photos.'},
{'type': 'text', 'text': 'Image 1:'},
{'type': 'image', 'source': img_a},
{'type': 'text', 'text': 'Image 2:'},
{'type': 'image', 'source': img_b},
{'type': 'text', 'text': 'Which has better lighting? Cite the image label.'}
]}
]인코딩 전 작업 설정
비전 인코더는 손실형입니다. 암묵적인 작업과 관련 없는 세부 정보는 풀링 중에 버려질 수 있습니다. 이미지 앞에 작업을 명시하면 모델이 중요한 영역에 주의를 기울이도록 유도할 수 있습니다.
- 일반적인 캡션 요청은 일반적인 특징을 산출합니다.
- 구체적인 질문(‘보드의 저항 개수를 세어 주세요’)은 표현 예산을 관련 하위 영역에 집중시킵니다.
세밀한 정보가 필요할 때는 구체성을 앞부분에 배치하세요.
해상도 및 타일 분할 예산
대부분의 비전 모델은 고해상도 이미지를 고정 크기의 패치로 타일 분할하며, 각 패치에는 토큰 비용이 발생합니다. 2000x2000 이미지는 여러 타일로 나뉘고, 각 타일은 다시 축소될 수 있습니다. 토큰 예산은 다중 양식 프롬프트의 보이지 않는 제약 조건입니다.
- 전송하기 전에 관심 영역으로 crop하세요 — 모델이 확대할 것이라고 기대하지 마세요.
- 내용이 빽빽한 문서에는 페이지 전체 이미지 하나보다 페이지를 crop한 이미지를 전송하세요.
- 제공업체의 최대 타일 수를 파악하세요. 그 수를 넘으면 작은 글자를 읽을 수 없게 됩니다.
def estimate_image_tokens(w, h, tile=512, per_tile=256):
import math
tiles = math.ceil(w / tile) * math.ceil(h / tile)
return tiles * per_tile + per_tile # + thumbnail비전을 위한 구조화된 스키마로서의 텍스트
이미지와 텍스트 채널의 명시적인 출력 스키마를 결합하세요. 이미지는 내용을 제공하고 텍스트는 계약을 제공합니다. 이는 자유 형식 설명보다 훨씬 안정적입니다.
예상되는 엔터티를 키로 사용하는 JSON을 요청하고, 보이지 않는 필드에는 null을 출력하도록 지시하세요 — 이렇게 하면 환각된 세부 정보가 억제됩니다.
instruction = (
'Extract from the receipt image. Return JSON: '
'{"merchant": str|null, "total": number|null, '
'"date": str|null, "line_items": [{"name": str, "price": number}]}. '
'Use null when a field is not legible. Do not invent values.'
)지시 표현으로 모호성 해소하기
지시 표현(‘이것’, ‘왼쪽에 있는 것’, ‘강조 표시된 상자’)은 텍스트를 이미지 영역에 연결합니다. 이미지를 미리 주석 처리할 수 있다면(상자를 그리거나 화살표를 추가하는 방식) 텍스트 참조는 공간 언어만 사용하는 것보다 훨씬 견고해집니다.
- 공간 표현(‘오른쪽 위’)은 회전이나 crop 상황에서 오류가 발생하기 쉽습니다.
- 번호가 표시된 마커를 덧씌우고 ‘객체 3번’이라고 하면 모호하지 않습니다.
- 마커를 추가하도록 이미지를 전처리하는 것은 정당한 프롬프트 설계 방법입니다.
혼합 양식의 소수 예시 학습
형식과 추론 방식을 고정하기 위해 이미지-텍스트 예시를 제공할 수 있습니다. 각 예시는 교차 배치된 (이미지, 이상적인 답변) 쌍입니다. 모델은 이러한 시연에서 대응 관계를 추론합니다.
예시 이미지는 실제 데이터 분포를 대표하도록 유지하세요 — 다른 영역의 예시는 잘못된 특징 선택을 학습시킵니다.
shots = [
('image', chart_a), ('text', 'Trend: upward. Peak: Q3. Anomaly: none.'),
('image', chart_b), ('text', 'Trend: flat. Peak: Q1. Anomaly: Q4 dip.'),
('image', target_chart), ('text', 'Trend:') # model completes
]픽셀에 주장 근거 연결하기
중요한 정보 추출에서는 각 주장이 이미지의 어디에서 비롯되었는지 모델이 인용하도록 요구하세요. 대략적인 경계 상자나 이미지에 표시된 텍스트의 인용은 검증 가능한 증거로 작용하며, 확신에 찬 조작을 크게 줄입니다.
- ‘각 값에 대해 읽은 정확한 레이블 텍스트를 인용하세요.’
- ‘각 필드에 대해 정규화된 대략적 상자 [x0,y0,x1,y1]를 제시하세요.’
근거 연결은 불투명한 답변을 감사 가능한 답변으로 바꿉니다.
주의해야 할 실패 양상
다중 양식 모델은 다음과 같은 특징적인 방식으로 실패합니다.
- 작거나 양식화된 글꼴에서 발생하는 OCR 오류 — 1/7이나 0/O 같은 숫자와 문자를 혼동합니다.
- 비슷한 객체가 약 6개를 넘으면 발생하는 개수 세기 붕괴.
- 캡션 편향: 실제 장면이 아니라 전형적인 장면을 설명합니다.
- 텍스트 채널 우선 현상: 확신에 찬 잘못된 텍스트 주장이 올바른 시각적 증거를 억누를 수 있습니다.
먼저 이미지에서 도출한 다음 텍스트에 포함된 주장과 대조하도록 요청하여 완화하세요.
불일치 조정 프롬프트
텍스트 맥락과 이미지가 충돌할 때는 어느 쪽을 우선할지 명시적으로 결정해야 합니다 — 모델이 신뢰할 수 있는 기본 정책을 갖고 있지 않기 때문입니다. 다음과 같이 명시하세요. ‘이미지가 제공된 메타데이터와 모순되면 이미지를 신뢰하고 불일치를 표시하세요.’
이 한 문장은 조용한 오류를 후속 처리 흐름에서 검토 대상으로 보낼 수 있는 명시적인 표면화된 충돌로 바꿉니다.
policy = (
'You are given metadata AND a photo. '
'When they disagree, prefer the photo as ground truth. '
'Emit {"value": ..., "conflict": bool, "note": str}.'
)융합 처리 흐름 설계하기
운영 환경의 다중 양식 프롬프트 작성은 한 번의 호출이 아니라 처리 흐름입니다.
- 전처리: crop하고, 주석을 추가하고, 예산에 맞게 축소합니다.
- 융합: 작업 우선 지시와 출력 스키마를 교차 배치합니다.
- 근거 연결: 주장마다 증거를 요구합니다.
- 불일치 조정: 양식 간 우선순위를 명시합니다.
- 검증: JSON을 구문 분석하고, null과 충돌 플래그를 확인합니다.
각 단계는 순수한 프롬프트만으로는 줄일 수 없는 실패 가능 영역을 줄입니다.
빠른 확인
고해상도 계약서 스캔본에서 작은 글씨를 추출해야 하며 신뢰할 수 있는 숫자가 필요합니다.
요약: 텍스트와 이미지 융합
통합된 다중 양식 프롬프트는 하나의 교차 배치된 토큰 스트림입니다. 핵심 방법은 비전 인코더를 유도하는 작업 우선 설정, crop을 통한 해상도 및 타일 분할 인식, null 허용 필드를 포함한 명시적 출력 스키마, 모든 주장에 대한 픽셀 근거 연결, 충돌 시 양식 간 우선순위 명시입니다. 이를 처리 흐름으로 다루세요 — 전처리, 융합, 근거 연결, 불일치 조정, 검증 — 그러면 비전 프롬프트 작성의 취약한 부분을 제어할 수 있습니다.
AI 튜터와 함께 AI Prompt Engineering을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 53
- 레슨
- 199
자주 묻는 질문
“텍스트와 이미지 결합” 강의는 무료인가요?
네 — “텍스트와 이미지 결합” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Prompt Engineering 강의 전체를 잠금 해제할 수 있습니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.
“텍스트와 이미지 결합”에서 뭘 배우나요?
통합 멀티모달 프롬프트 브라우저에서 직접 실행하는 실습 코드로 AI Prompt Engineering을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Prompt Engineering을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Prompt Engineering은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.
“텍스트와 이미지 결합” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Prompt Engineering 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Prompt Engineering 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 텍스트와 이미지 결합
- 모달리티 간 근거 연결
- 오디오, 텍스트, 비전의 통합
- 멀티모달 출력 제어