0Pricing
AI Prompt Engineering · 강의

멀티모달 출력 제어

혼합 미디어 응답 구성

멀티모달 출력 제어은(는) CoddyKit의 무료 AI Prompt Engineering 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Prompt Engineering 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.

혼합 미디어 출력 제어

출력 제어란 답변이 텍스트, 구조화된 데이터, 생성되거나 선택된 미디어에 대한 참조를 아우를 때 응답이 어떤 형태를 취할지 정하는 작업입니다. 모델은 기본적으로 산문으로 답하지만, 운영 시스템에는 파싱하고 렌더링하며 조합할 수 있는 결과물이 필요합니다.

  • 단순히 질문하는 것이 아니라 렌더링 계약을 지정하는 것입니다.
  • 형식의 풍부함보다 형식의 신뢰성이 중요합니다. 예측 가능한 구조가 더 효과적입니다.

콘텐츠와 표현 분리

모델이 구조화된 콘텐츠를 출력하게 하고, 미디어는 여러분의 시스템에서 렌더링하세요. 텍스트 모델에 원시 이미지 바이트나 마크업이 많은 레이아웃을 출력하게 하는 것은 취약합니다. 모델에 형식이 지정된 설명을 요청하고 이를 렌더링기가 미디어로 변환하게 하는 편이 견고합니다.

모델은 무엇을 결정하고, 여러분의 처리 흐름은 어떻게 보일지 결정합니다.

block = {
  'type': 'figure',
  'caption': 'Quarterly revenue',
  'chart': {'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10, 14]},
  'alt_text': 'Bar chart rising from 10 to 14.'
}

블록 유형별 응답 스키마

풍부한 응답을 유형이 지정된 블록의 순서 있는 목록으로 모델링하세요. 유형에는 text, code, image_ref, table, chart_spec이 있습니다. 각 블록에는 해당 유형에 필요한 필드만 포함합니다. 렌더링기는 목록을 순회하며 유형에 맞는 구성 요소를 출력합니다.

이 방식으로 채팅 사용자 인터페이스, 보고서, 슬라이드 생성기는 수천 개의 응답에서도 안정적으로 작동합니다.

schema = {
  'blocks': [
    {'type': 'text', 'value': '...'},
    {'type': 'code', 'lang': 'python', 'value': '...'},
    {'type': 'image_ref', 'id': 'fig1', 'alt': '...'},
    {'type': 'table', 'columns': [...], 'rows': [...]}
  ]
}

미디어 참조와 삽입

미디어를 삽입하기보다 참조하는 방식을 선호하세요. 모델은 식별자나 생성 사양을 출력하고, 여러분의 시스템은 이를 실제 자산으로 확인합니다. 이렇게 하면 언어 처리 단계와 미디어 처리 단계가 분리되어, 다시 프롬프트를 작성하지 않고도 자산을 캐시하거나 재생성하거나 교체할 수 있습니다.

  • 삽입: 응답에 자산이 직접 포함됩니다(무겁고 취약함).
  • 참조: 응답에 포인터나 제작 방법이 포함됩니다(가볍고 조합 가능함).
image_block = {
  'type': 'image_ref',
  'spec': {'prompt': 'minimal line icon of a gear', 'size': '512x512'},
  'alt': 'Settings gear icon'
}
# Pipeline calls the image model with spec, fills in the URL.

생성 사양 제한

모델이 후속 생성기(이미지, 차트, TTS)를 위한 사양을 작성할 때는 그 사양을 엄격하게 제한하세요. 자유로운 사양은 쉽게 변질되지만, 열거된 선택지는 브랜드와 예산에 맞게 유지됩니다.

모델에 통제된 어휘를 제공하세요. 허용된 차트 종류, 허용된 이미지 스타일, 허용된 음성을 지정하고 자유 형식의 이탈은 금지하세요.

chart_spec = {
  'kind': 'one of [bar, line, scatter]',   # enumerated
  'palette': 'brand_default',               # not a hex free-for-all
  'max_series': 4
}

필수 접근성 필드

모든 미디어 블록에는 대체 텍스트 또는 전사문 필드가 있어야 하며, 스키마에서 이를 선택 사항이 아닌 필수 항목으로 지정해야 합니다. 이는 접근성 요구 사항인 동시에 검증 수단입니다. 대체 텍스트를 보면 모델이 미디어로 무엇을 전달하려 했는지 알 수 있고, 이를 사양과 대조할 수 있습니다.

블록 순서와 배치 의도

블록의 순서가 곧 배치입니다. 모델이 해당 차트를 설명하는 문단보다 먼저 차트를 반환하면 렌더링된 문서의 흐름이 어색해집니다. 배치 의도를 명시하세요. '설명 텍스트가 설명할 그림보다 먼저 나옵니다. 그림 뒤에는 항상 한 줄의 핵심 요약이 이어집니다.'

블록 목록이 일관된 서사로 렌더링되도록 읽기 순서 규칙을 인코딩하세요.

블록별 길이 및 밀도 예산

전체가 아니라 블록 수준에서 장황함을 제어하세요. 캡션은 한 줄이고, 섹션 도입부는 짧은 문단이며, 표는 최대 N개 행으로 제한합니다. 블록별 예산을 지정하면 모델이 한 구성 요소만 지나치게 늘리고 다른 구성 요소를 소홀히 하는 일을 막을 수 있습니다.

  • '캡션: 최대 12단어.'
  • '표: 최대 8개 행. 나머지는 마지막 행에 요약하세요.'
limits = {'caption_words': 12, 'table_rows': 8, 'intro_sentences': 3}

검증 및 복구 반복

혼합 미디어 스키마의 품질은 검증기의 품질만큼만 좋습니다. 블록 목록을 파싱하고 각 블록을 해당 유형 스키마에 대해 validate한 다음, 실패하면 정확한 위반 사항을 명시한 정밀 복구 프롬프트를 보내세요.

복구가 전체 재생성보다 낫습니다. 전체 응답을 다시 요청하면 토큰을 낭비하고 올바르게 생성된 부분까지 망가뜨릴 수 있습니다.

def validate(blocks):
    for b in blocks:
        if b['type'] == 'image_ref' and 'alt' not in b:
            return f'Block {b} missing required alt text'
    return None  # ok

혼합 미디어 스트리밍

스트리밍할 때는 UI가 전체 응답을 기다리지 않고 각 블록이 완성되는 대로 렌더링할 수 있도록 블록을 개별적으로 파싱할 수 있어야 합니다. 마지막 대괄호가 나올 때까지 유효하지 않은 하나의 거대한 배열 대신, 블록마다 형식이 올바른 JSON 객체 하나를 출력하세요(줄바꿈으로 구분).

블록 단위 스트리밍은 반응성이 좋은 UI와 조기 검증을 가능하게 합니다.

{'type': 'text', 'value': 'Revenue grew this quarter.'}
{'type': 'chart_spec', 'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10,14], 'alt': '...'}
{'type': 'text', 'value': 'The bulk came from new accounts.'}

출력 제어 계약

완전한 혼합 미디어 계약에는 유형이 지정된 블록 어휘, 삽입보다 참조를 우선하는 방식, 열거된 생성 사양, 필수 대체 텍스트/전사문, 읽기 순서 규칙, 블록별 예산, 스트리밍에 적합한 직렬화 형식이 포함됩니다. 이를 재사용 가능한 시스템 블록으로 묶으면 렌더링기는 다양한 작업에서 안정적인 대상이 됩니다.

빠른 확인

여러분의 프런트 엔드에서 직접 렌더링하는 보고서 생성기를 만들고 있으며, 응답에는 문단, 표, 그림이 섞여 있습니다.

복습: 혼합 미디어 응답 구성

풍부한 출력을 렌더링 계약으로 다루세요. 유형이 지정된 블록의 어휘, 삽입이 아닌 참조 또는 제한된 생성 사양으로 표현하는 미디어, 필수 대체 텍스트/전사문 필드, 명시적인 읽기 순서와 블록별 예산, 검증 및 복구를 지원하는 스트리밍 방식의 직렬화 형식을 정의하는 것입니다. 모델이 결정하는 내용과 처리 흐름이 렌더링하는 방식을 분리하면 혼합 미디어 응답을 예측 가능하고 검증 가능하며 쉽게 조합할 수 있습니다.

자주 묻는 질문

“멀티모달 출력 제어” 강의는 무료인가요?

네 — “멀티모달 출력 제어” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Prompt Engineering 강의 전체를 잠금 해제할 수 있습니다. AI Prompt Engineering 강의에는 총 4개의 강의가 포함되어 있습니다.

“멀티모달 출력 제어”에서 뭘 배우나요?

혼합 미디어 응답 구성 브라우저에서 직접 실행하는 실습 코드로 AI Prompt Engineering을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Prompt Engineering을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Prompt Engineering은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.

“멀티모달 출력 제어” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Prompt Engineering 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Prompt Engineering 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 텍스트와 이미지 결합
  2. 모달리티 간 근거 연결
  3. 오디오, 텍스트, 비전의 통합
  4. 멀티모달 출력 제어
← AI Prompt Engineering(으)로 돌아가기