การควบคุมผลลัพธ์หลายสื่อ
การกำหนดรูปแบบคำตอบที่ผสมสื่อหลายชนิด
การควบคุมผลลัพธ์หลายสื่อ เป็นบทเรียน AI Prompt Engineering ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Prompt Engineering และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน
การควบคุมผลลัพธ์สื่อผสม
การควบคุมผลลัพธ์คือหลักปฏิบัติในการกำหนดว่า การตอบสนองจะอยู่ใน รูปแบบใด เมื่อคำตอบครอบคลุมทั้งข้อความ ข้อมูลที่มีโครงสร้าง และการอ้างอิงสื่อที่สร้างหรือเลือกไว้ โมเดลจะเลือกข้อความร้อยแก้วเป็นค่าเริ่มต้น แต่ระบบใช้งานจริงต้องการชิ้นงานที่แยกวิเคราะห์ได้ แสดงผลได้ และนำมาประกอบได้
- คุณกำลังระบุสัญญาการแสดงผล ไม่ใช่เพียงตั้งคำถาม
- ความน่าเชื่อถือของรูปแบบสำคัญกว่าความหลากหลายของรูปแบบ — รูปแบบที่คาดเดาได้ย่อมดีกว่า
แยกเนื้อหาออกจากการนำเสนอ
ให้โมเดลส่งออก เนื้อหาที่มีโครงสร้าง แล้วแสดงผลสื่อทางฝั่งของคุณ การขอให้โมเดลข้อความส่งออกไบต์ภาพดิบหรือเค้าโครงที่เต็มไปด้วยมาร์กอัปนั้นเปราะบาง ส่วนการขอคำอธิบายที่ระบุชนิด ซึ่งตัวแสดงผลของคุณแปลงเป็นสื่อนั้นมีความทนทาน
โมเดลตัดสินใจ ว่าอะไร; กระบวนการประมวลผลของคุณตัดสินใจ ว่าจะแสดงอย่างไร
block = {
'type': 'figure',
'caption': 'Quarterly revenue',
'chart': {'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10, 14]},
'alt_text': 'Bar chart rising from 10 to 14.'
}โครงร่างการตอบสนองแบบบล็อกระบุชนิด
กำหนดการตอบสนองที่มีเนื้อหาหลากหลายเป็นรายการบล็อกแบบระบุชนิดตามลำดับ: text, code, image_ref, table, chart_spec แต่ละบล็อกมีเฉพาะช่องข้อมูลที่ชนิดของตนต้องใช้ ตัวแสดงผลจะไล่ตามรายการและสร้างส่วนประกอบที่ถูกต้องตามแต่ละชนิด
นี่คือวิธีที่ส่วนติดต่อผู้ใช้สำหรับแชต รายงาน และตัวสร้างสไลด์ยังคงน่าเชื่อถือได้แม้ต้องรองรับการตอบสนองนับพันรายการ
schema = {
'blocks': [
{'type': 'text', 'value': '...'},
{'type': 'code', 'lang': 'python', 'value': '...'},
{'type': 'image_ref', 'id': 'fig1', 'alt': '...'},
{'type': 'table', 'columns': [...], 'rows': [...]}
]
}การอ้างอิงสื่อเทียบกับการฝังสื่อ
ควรใช้ การอ้างอิง แทนการฝัง โมเดลส่งตัวระบุหรือข้อกำหนดการสร้างออกมา แล้วระบบของคุณจึงแปลงสิ่งนั้นเป็นชิ้นงานจริง วิธีนี้แยกขั้นตอนภาษาออกจากขั้นตอนสื่อ และทำให้คุณเก็บไว้ใช้ใหม่ สร้างใหม่ หรือสับเปลี่ยนชิ้นงานได้โดยไม่ต้องเขียนพรอมต์ใหม่
- ฝัง: การตอบสนองมีชิ้นงานอยู่ภายในโดยตรง (หนักและเปราะบาง)
- การอ้างอิง: การตอบสนองมีตัวชี้หรือสูตร (เบาและนำมาประกอบได้)
image_block = {
'type': 'image_ref',
'spec': {'prompt': 'minimal line icon of a gear', 'size': '512x512'},
'alt': 'Settings gear icon'
}
# Pipeline calls the image model with spec, fills in the URL.การจำกัดข้อกำหนดการสร้าง
เมื่อโมเดลเขียนข้อกำหนดให้ตัวสร้างปลายทาง เช่น ภาพ แผนภูมิ หรือ TTS ให้จำกัดข้อกำหนดนั้นอย่างเข้มงวด ข้อกำหนดแบบเปิดกว้างอาจคลาดเคลื่อนได้ ส่วนตัวเลือกที่แจกแจงไว้จะยังสอดคล้องกับแนวทางและงบประมาณ
มอบชุดคำศัพท์ที่ควบคุมไว้ให้โมเดล ได้แก่ ชนิดแผนภูมิที่อนุญาต รูปแบบภาพที่อนุญาต และเสียงที่อนุญาต — พร้อมห้ามเบี่ยงเบนไปใช้รูปแบบอิสระ
chart_spec = {
'kind': 'one of [bar, line, scatter]', # enumerated
'palette': 'brand_default', # not a hex free-for-all
'max_series': 4
}ช่องข้อมูลการเข้าถึงที่ต้องมี
บล็อกสื่อทุกบล็อกควรมี ข้อความทดแทน หรือช่องบทถอดเสียง และคุณควรกำหนดให้ช่องนี้เป็นสิ่งที่ขาดไม่ได้ในโครงร่าง นี่เป็นทั้งข้อกำหนดด้านการเข้าถึงและจุดยึดสำหรับตรวจสอบ — ข้อความทดแทนเผยให้เห็นว่าโมเดล ตั้งใจ ให้สื่อนำเสนออะไร ซึ่งคุณสามารถตรวจสอบเทียบกับข้อกำหนดได้
ลำดับการสอดแทรกและเจตนาของเค้าโครง
ลำดับบล็อกคือเค้าโครง หากโมเดลส่งแผนภูมิมาก่อนย่อหน้าที่อธิบายแผนภูมินั้น เอกสารที่แสดงผลจะอ่านไม่ถูกต้อง ระบุเจตนาของเค้าโครงว่า 'ข้อความอธิบายต้องมาก่อนภาพประกอบที่ข้อความนั้นอธิบาย ภาพประกอบต้องตามด้วยข้อสรุปสำคัญหนึ่งบรรทัดเสมอ'
กำหนดกฎลำดับการอ่านไว้ เพื่อให้รายการบล็อกแสดงผลเป็นเรื่องราวที่ต่อเนื่องเข้าใจได้
งบประมาณความยาวและความหนาแน่นต่อบล็อก
ควบคุมความละเอียดของเนื้อหาที่ระดับบล็อก ไม่ใช่ทั้งระบบ คำบรรยายมีหนึ่งบรรทัด บทนำส่วนเป็นย่อหน้าสั้น ๆ และตารางจำกัดไม่เกิน N แถว งบประมาณต่อบล็อกป้องกันไม่ให้โมเดลขยายส่วนประกอบหนึ่งจนมากเกินไป ขณะที่ทำให้อีกส่วนหนึ่งมีเนื้อหาไม่พอ
- 'คำบรรยาย: ไม่เกิน 12 คำ'
- 'ตาราง: ไม่เกิน 8 แถว สรุปส่วนที่เหลือเป็นแถวสุดท้าย'
limits = {'caption_words': 12, 'table_rows': 8, 'intro_sentences': 3}วงจรตรวจสอบและซ่อมแซม
โครงร่างสื่อผสมจะดีได้เท่ากับตัวตรวจสอบของคุณเท่านั้น แยกวิเคราะห์รายการบล็อก, validate แต่ละบล็อกเทียบกับโครงร่างชนิดของบล็อก และเมื่อไม่ผ่าน ให้ส่งพรอมต์ซ่อมแซมแบบเจาะจงที่ระบุการละเมิดอย่างแน่ชัด
การซ่อมแซมดีกว่าการสร้างใหม่: การขอคำตอบทั้งหมดอีกครั้งสิ้นเปลืองโทเค็นและอาจทำให้ส่วนที่ถูกต้องอยู่แล้วเสียหาย
def validate(blocks):
for b in blocks:
if b['type'] == 'image_ref' and 'alt' not in b:
return f'Block {b} missing required alt text'
return None # okการสตรีมสื่อผสม
เมื่อสตรีม บล็อกต้องแยกวิเคราะห์ได้ทีละบล็อก เพื่อให้ส่วนติดต่อผู้ใช้แสดงผลแต่ละบล็อกได้ทันทีที่เสร็จ แทนที่จะรอการตอบสนองทั้งหมด ส่งวัตถุข้อมูลแบบ JSON ที่มีรูปแบบถูกต้องหนึ่งรายการต่อบล็อก (คั่นด้วยบรรทัดใหม่) แทนอาร์เรย์ขนาดใหญ่รายการเดียวที่ยังไม่ถูกต้องจนกว่าจะถึงวงเล็บปิดตัวสุดท้าย
การสตรีมทีละบล็อกทำให้ส่วนติดต่อผู้ใช้ตอบสนองได้ดีและตรวจสอบได้ตั้งแต่เนิ่น ๆ
{'type': 'text', 'value': 'Revenue grew this quarter.'}
{'type': 'chart_spec', 'kind': 'bar', 'x': ['Q1','Q2'], 'y': [10,14], 'alt': '...'}
{'type': 'text', 'value': 'The bulk came from new accounts.'}สัญญาควบคุมผลลัพธ์
สัญญาสื่อผสมที่ครบถ้วนต้องระบุ: ชุดคำศัพท์ของบล็อกที่มีชนิด การใช้การอ้างอิงแทนการฝัง ข้อกำหนดการสร้างแบบแจกแจง ช่องข้อความทดแทนหรือบทถอดเสียงที่ต้องมี กฎลำดับการอ่าน งบประมาณต่อบล็อก และการทำให้เป็นอนุกรมที่เหมาะกับการสตรีม รวมทั้งหมดไว้เป็นบล็อกระบบที่นำกลับมาใช้ได้ แล้วตัวแสดงผลของคุณจะมีเป้าหมายที่เสถียรสำหรับงานจำนวนมาก
ตรวจสอบอย่างรวดเร็ว
คุณกำลังสร้างตัวสร้างรายงานที่การตอบสนองประกอบด้วยย่อหน้า ตาราง และภาพประกอบผสมกัน โดยแสดงผลผ่านส่วนหน้าของคุณเอง
สรุป: การกำหนดรูปแบบการตอบสนองสื่อผสม
ให้ถือว่าผลลัพธ์ที่มีเนื้อหาหลากหลายเป็นสัญญาการแสดงผล: ชุดคำศัพท์ของบล็อกที่มีชนิด สื่อในรูปการอ้างอิงหรือข้อกำหนดการสร้างที่จำกัดแทนการฝัง ช่องข้อความทดแทนหรือบทถอดเสียงที่ต้องมี กฎลำดับการอ่านและงบประมาณต่อบล็อกที่ระบุชัด และการทำให้เป็นอนุกรมที่เหมาะกับการสตรีมพร้อมการตรวจสอบและซ่อมแซม แยกสิ่งที่โมเดลตัดสินใจออกจากวิธีที่กระบวนการประมวลผลของคุณแสดงผล แล้วการตอบสนองสื่อผสมจะคาดเดาได้ ตรวจสอบย้อนกลับได้ และนำมาประกอบได้ง่าย
เรียนรู้ AI Prompt Engineering ด้วย AI tutor — ฟรี
เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป
- คอร์ส
- 53
- บทเรียน
- 199
คำถามที่พบบ่อย
บทเรียน “การควบคุมผลลัพธ์หลายสื่อ” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การควบคุมผลลัพธ์หลายสื่อ” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Prompt Engineering ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การควบคุมผลลัพธ์หลายสื่อ”
การกำหนดรูปแบบคำตอบที่ผสมสื่อหลายชนิด คุณปฏิบัติ AI Prompt Engineering ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Prompt Engineering หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Prompt Engineering บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน
บทเรียน “การควบคุมผลลัพธ์หลายสื่อ” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Prompt Engineering นี้ได้ไหม
ได้ บทเรียน AI Prompt Engineering ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การผสานข้อความและรูปภาพ
- การยึดโยงข้ามรูปแบบสื่อ
- เสียง ข้อความ และภาพร่วมกัน
- การควบคุมผลลัพธ์หลายสื่อ