AI Prompt Engineering · บทเรียน

การควบคุมผลลัพธ์หลายสื่อ

การกำหนดรูปแบบคำตอบที่ผสมสื่อหลายชนิด

บทเรียน 4 จาก 413 ขั้นตอน

การควบคุมผลลัพธ์หลายสื่อ เป็นบทเรียน AI Prompt Engineering ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Prompt Engineering และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน

การควบคุมผลลัพธ์สื่อผสม

การควบคุมผลลัพธ์คือหลักปฏิบัติในการกำหนดว่า การตอบสนองจะอยู่ใน รูปแบบใด เมื่อคำตอบครอบคลุมทั้งข้อความ ข้อมูลที่มีโครงสร้าง และการอ้างอิงสื่อที่สร้างหรือเลือกไว้ โมเดลจะเลือกข้อความร้อยแก้วเป็นค่าเริ่มต้น แต่ระบบใช้งานจริงต้องการชิ้นงานที่แยกวิเคราะห์ได้ แสดงผลได้ และนำมาประกอบได้

  • คุณกำลังระบุสัญญาการแสดงผล ไม่ใช่เพียงตั้งคำถาม
  • ความน่าเชื่อถือของรูปแบบสำคัญกว่าความหลากหลายของรูปแบบ — รูปแบบที่คาดเดาได้ย่อมดีกว่า

แยกเนื้อหาออกจากการนำเสนอ

ให้โมเดลส่งออก เนื้อหาที่มีโครงสร้าง แล้วแสดงผลสื่อทางฝั่งของคุณ การขอให้โมเดลข้อความส่งออกไบต์ภาพดิบหรือเค้าโครงที่เต็มไปด้วยมาร์กอัปนั้นเปราะบาง ส่วนการขอคำอธิบายที่ระบุชนิด ซึ่งตัวแสดงผลของคุณแปลงเป็นสื่อนั้นมีความทนทาน

โมเดลตัดสินใจ ว่าอะไร; กระบวนการประมวลผลของคุณตัดสินใจ ว่าจะแสดงอย่างไร

block = {
  'type': 'figure',
  'caption': 'Quarterly revenue',
  'chart': {'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10, 14]},
  'alt_text': 'Bar chart rising from 10 to 14.'
}

โครงร่างการตอบสนองแบบบล็อกระบุชนิด

กำหนดการตอบสนองที่มีเนื้อหาหลากหลายเป็นรายการบล็อกแบบระบุชนิดตามลำดับ: text, code, image_ref, table, chart_spec แต่ละบล็อกมีเฉพาะช่องข้อมูลที่ชนิดของตนต้องใช้ ตัวแสดงผลจะไล่ตามรายการและสร้างส่วนประกอบที่ถูกต้องตามแต่ละชนิด

นี่คือวิธีที่ส่วนติดต่อผู้ใช้สำหรับแชต รายงาน และตัวสร้างสไลด์ยังคงน่าเชื่อถือได้แม้ต้องรองรับการตอบสนองนับพันรายการ

schema = {
  'blocks': [
    {'type': 'text', 'value': '...'},
    {'type': 'code', 'lang': 'python', 'value': '...'},
    {'type': 'image_ref', 'id': 'fig1', 'alt': '...'},
    {'type': 'table', 'columns': [...], 'rows': [...]}
  ]
}

การอ้างอิงสื่อเทียบกับการฝังสื่อ

ควรใช้ การอ้างอิง แทนการฝัง โมเดลส่งตัวระบุหรือข้อกำหนดการสร้างออกมา แล้วระบบของคุณจึงแปลงสิ่งนั้นเป็นชิ้นงานจริง วิธีนี้แยกขั้นตอนภาษาออกจากขั้นตอนสื่อ และทำให้คุณเก็บไว้ใช้ใหม่ สร้างใหม่ หรือสับเปลี่ยนชิ้นงานได้โดยไม่ต้องเขียนพรอมต์ใหม่

  • ฝัง: การตอบสนองมีชิ้นงานอยู่ภายในโดยตรง (หนักและเปราะบาง)
  • การอ้างอิง: การตอบสนองมีตัวชี้หรือสูตร (เบาและนำมาประกอบได้)
image_block = {
  'type': 'image_ref',
  'spec': {'prompt': 'minimal line icon of a gear', 'size': '512x512'},
  'alt': 'Settings gear icon'
}
# Pipeline calls the image model with spec, fills in the URL.

การจำกัดข้อกำหนดการสร้าง

เมื่อโมเดลเขียนข้อกำหนดให้ตัวสร้างปลายทาง เช่น ภาพ แผนภูมิ หรือ TTS ให้จำกัดข้อกำหนดนั้นอย่างเข้มงวด ข้อกำหนดแบบเปิดกว้างอาจคลาดเคลื่อนได้ ส่วนตัวเลือกที่แจกแจงไว้จะยังสอดคล้องกับแนวทางและงบประมาณ

มอบชุดคำศัพท์ที่ควบคุมไว้ให้โมเดล ได้แก่ ชนิดแผนภูมิที่อนุญาต รูปแบบภาพที่อนุญาต และเสียงที่อนุญาต — พร้อมห้ามเบี่ยงเบนไปใช้รูปแบบอิสระ

chart_spec = {
  'kind': 'one of [bar, line, scatter]',   # enumerated
  'palette': 'brand_default',               # not a hex free-for-all
  'max_series': 4
}

ช่องข้อมูลการเข้าถึงที่ต้องมี

บล็อกสื่อทุกบล็อกควรมี ข้อความทดแทน หรือช่องบทถอดเสียง และคุณควรกำหนดให้ช่องนี้เป็นสิ่งที่ขาดไม่ได้ในโครงร่าง นี่เป็นทั้งข้อกำหนดด้านการเข้าถึงและจุดยึดสำหรับตรวจสอบ — ข้อความทดแทนเผยให้เห็นว่าโมเดล ตั้งใจ ให้สื่อนำเสนออะไร ซึ่งคุณสามารถตรวจสอบเทียบกับข้อกำหนดได้

ลำดับการสอดแทรกและเจตนาของเค้าโครง

ลำดับบล็อกคือเค้าโครง หากโมเดลส่งแผนภูมิมาก่อนย่อหน้าที่อธิบายแผนภูมินั้น เอกสารที่แสดงผลจะอ่านไม่ถูกต้อง ระบุเจตนาของเค้าโครงว่า 'ข้อความอธิบายต้องมาก่อนภาพประกอบที่ข้อความนั้นอธิบาย ภาพประกอบต้องตามด้วยข้อสรุปสำคัญหนึ่งบรรทัดเสมอ'

กำหนดกฎลำดับการอ่านไว้ เพื่อให้รายการบล็อกแสดงผลเป็นเรื่องราวที่ต่อเนื่องเข้าใจได้

งบประมาณความยาวและความหนาแน่นต่อบล็อก

ควบคุมความละเอียดของเนื้อหาที่ระดับบล็อก ไม่ใช่ทั้งระบบ คำบรรยายมีหนึ่งบรรทัด บทนำส่วนเป็นย่อหน้าสั้น ๆ และตารางจำกัดไม่เกิน N แถว งบประมาณต่อบล็อกป้องกันไม่ให้โมเดลขยายส่วนประกอบหนึ่งจนมากเกินไป ขณะที่ทำให้อีกส่วนหนึ่งมีเนื้อหาไม่พอ

  • 'คำบรรยาย: ไม่เกิน 12 คำ'
  • 'ตาราง: ไม่เกิน 8 แถว สรุปส่วนที่เหลือเป็นแถวสุดท้าย'
limits = {'caption_words': 12, 'table_rows': 8, 'intro_sentences': 3}

วงจรตรวจสอบและซ่อมแซม

โครงร่างสื่อผสมจะดีได้เท่ากับตัวตรวจสอบของคุณเท่านั้น แยกวิเคราะห์รายการบล็อก, validate แต่ละบล็อกเทียบกับโครงร่างชนิดของบล็อก และเมื่อไม่ผ่าน ให้ส่งพรอมต์ซ่อมแซมแบบเจาะจงที่ระบุการละเมิดอย่างแน่ชัด

การซ่อมแซมดีกว่าการสร้างใหม่: การขอคำตอบทั้งหมดอีกครั้งสิ้นเปลืองโทเค็นและอาจทำให้ส่วนที่ถูกต้องอยู่แล้วเสียหาย

def validate(blocks):
    for b in blocks:
        if b['type'] == 'image_ref' and 'alt' not in b:
            return f'Block {b} missing required alt text'
    return None  # ok

การสตรีมสื่อผสม

เมื่อสตรีม บล็อกต้องแยกวิเคราะห์ได้ทีละบล็อก เพื่อให้ส่วนติดต่อผู้ใช้แสดงผลแต่ละบล็อกได้ทันทีที่เสร็จ แทนที่จะรอการตอบสนองทั้งหมด ส่งวัตถุข้อมูลแบบ JSON ที่มีรูปแบบถูกต้องหนึ่งรายการต่อบล็อก (คั่นด้วยบรรทัดใหม่) แทนอาร์เรย์ขนาดใหญ่รายการเดียวที่ยังไม่ถูกต้องจนกว่าจะถึงวงเล็บปิดตัวสุดท้าย

การสตรีมทีละบล็อกทำให้ส่วนติดต่อผู้ใช้ตอบสนองได้ดีและตรวจสอบได้ตั้งแต่เนิ่น ๆ

{'type': 'text', 'value': 'Revenue grew this quarter.'}
{'type': 'chart_spec', 'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10,14], 'alt': '...'}
{'type': 'text', 'value': 'The bulk came from new accounts.'}

สัญญาควบคุมผลลัพธ์

สัญญาสื่อผสมที่ครบถ้วนต้องระบุ: ชุดคำศัพท์ของบล็อกที่มีชนิด การใช้การอ้างอิงแทนการฝัง ข้อกำหนดการสร้างแบบแจกแจง ช่องข้อความทดแทนหรือบทถอดเสียงที่ต้องมี กฎลำดับการอ่าน งบประมาณต่อบล็อก และการทำให้เป็นอนุกรมที่เหมาะกับการสตรีม รวมทั้งหมดไว้เป็นบล็อกระบบที่นำกลับมาใช้ได้ แล้วตัวแสดงผลของคุณจะมีเป้าหมายที่เสถียรสำหรับงานจำนวนมาก

ตรวจสอบอย่างรวดเร็ว

คุณกำลังสร้างตัวสร้างรายงานที่การตอบสนองประกอบด้วยย่อหน้า ตาราง และภาพประกอบผสมกัน โดยแสดงผลผ่านส่วนหน้าของคุณเอง

สรุป: การกำหนดรูปแบบการตอบสนองสื่อผสม

ให้ถือว่าผลลัพธ์ที่มีเนื้อหาหลากหลายเป็นสัญญาการแสดงผล: ชุดคำศัพท์ของบล็อกที่มีชนิด สื่อในรูปการอ้างอิงหรือข้อกำหนดการสร้างที่จำกัดแทนการฝัง ช่องข้อความทดแทนหรือบทถอดเสียงที่ต้องมี กฎลำดับการอ่านและงบประมาณต่อบล็อกที่ระบุชัด และการทำให้เป็นอนุกรมที่เหมาะกับการสตรีมพร้อมการตรวจสอบและซ่อมแซม แยกสิ่งที่โมเดลตัดสินใจออกจากวิธีที่กระบวนการประมวลผลของคุณแสดงผล แล้วการตอบสนองสื่อผสมจะคาดเดาได้ ตรวจสอบย้อนกลับได้ และนำมาประกอบได้ง่าย

เริ่มต้นได้ฟรี

เรียนรู้ AI Prompt Engineering ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
53
บทเรียน
199

คำถามที่พบบ่อย

บทเรียน “การควบคุมผลลัพธ์หลายสื่อ” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การควบคุมผลลัพธ์หลายสื่อ” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Prompt Engineering ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การควบคุมผลลัพธ์หลายสื่อ”

การกำหนดรูปแบบคำตอบที่ผสมสื่อหลายชนิด คุณปฏิบัติ AI Prompt Engineering ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Prompt Engineering หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Prompt Engineering บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “การควบคุมผลลัพธ์หลายสื่อ” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Prompt Engineering นี้ได้ไหม

ได้ บทเรียน AI Prompt Engineering ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การผสานข้อความและรูปภาพ
  2. การยึดโยงข้ามรูปแบบสื่อ
  3. เสียง ข้อความ และภาพร่วมกัน
  4. การควบคุมผลลัพธ์หลายสื่อ
← กลับไปที่ AI Prompt Engineering