0Pricing
AI Prompt Engineering · บทเรียน

การยึดโยงข้ามรูปแบบสื่อ

การอ้างอิงหลักฐานภาพในข้อความ

การยึดโยงข้ามรูปแบบสื่อ เป็นบทเรียน AI Prompt Engineering ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Prompt Engineering และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน

ความหมายของการยึดโยงหลักฐาน

การยึดโยงหลักฐานคือข้อกำหนดให้ข้ออ้างที่เป็นข้อความทุกข้อสามารถสืบย้อนกลับไปยังหลักฐานเฉพาะในรูปแบบข้อมูลอื่นได้ คำตอบหลายสื่อที่ไม่ยึดโยงหลักฐานเป็นเพียงการคาดเดาที่ลื่นไหล ส่วนคำตอบที่ยึดโยงหลักฐานคือข้อยืนยันที่ปกป้องได้ พร้อมตัวชี้กลับไปยังพิกเซล (หรือเฟรมเสียง) ที่สนับสนุนข้อยืนยันนั้น

  • การยึดโยงหลักฐานเปลี่ยนผลลัพธ์ที่ทึบแสงให้เป็นผลลัพธ์ที่ตรวจสอบย้อนกลับได้
  • นี่คือวิธีการเดียวที่มีประสิทธิภาพสูงสุดในการต่อต้านการสร้างข้อมูลภาพหลอนอย่างมั่นใจ

ลำดับการให้เหตุผลที่เริ่มจากหลักฐาน

บังคับให้โมเดลดึงหลักฐาน ก่อน สรุป หากสร้างข้อสรุปก่อน 'หลักฐาน' จะกลายเป็นการหาเหตุผลมารองรับย้อนหลังให้ตรงกับคำตอบที่อาจผิด

จัดโครงสร้างคำตอบให้บริเวณที่สังเกตพบมาก่อน การตีความอยู่ลำดับที่สอง และคำตอบสุดท้ายอยู่ท้ายสุด

schema = {
  'observations': '[{region: str, text_read: str}]',
  'inference': 'str — reasoning over observations only',
  'answer': 'str'
}
# Order in the prompt enforces order in generation.

การอ้างอิงกรอบล้อมและบริเวณ

ขอให้โมเดลส่งพิกัดมาตรฐานโดยประมาณสำหรับข้ออ้างด้านภาพแต่ละข้อ แม้กรอบล้อมจะไม่สมบูรณ์ก็ยังมีประโยชน์: ระบบในขั้นถัดไปสามารถ crop แล้วตรวจสอบซ้ำได้ และกรอบที่ผิดไปอย่างมากจะแสดงการกุเรื่องให้เห็นทันที

  • ใช้พิกัดมาตรฐาน [x0,y0,x1,y1] ในช่วง 0..1 เพื่อให้ไม่ขึ้นกับความละเอียด
  • ให้ถือว่ากรอบล้อมเป็น คำใบ้ระบุตำแหน่ง ไม่ใช่การตรวจจับที่แม่นยำถึงระดับพิกเซล
instruction = (
  'For each extracted field, return '
  '{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
  'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)

การตรวจสอบด้วยการยกข้อความจากพิกเซล

สำหรับข้อความใด ๆ ที่มองเห็นในภาพ กำหนดให้ยกข้อความที่โมเดลอ่านได้มาแบบตรงตามต้นฉบับ การยกข้อความตรงตามต้นฉบับตรวจสอบได้: คุณสามารถตรวจสอบแบบสุ่มด้วย OCR และโมเดลจะมีโอกาสน้อยลงมากที่จะสร้างค่าขึ้นมาเอง เพราะต้องถอดข้อความนั้นให้ตรงทุกประการด้วย

ข้อจำกัดแบบ 'อ่านกลับมา' นี้มีต้นทุนต่ำและได้ผลอย่างมากเป็นพิเศษกับเอกสาร แผนภูมิ และป้ายประกาศ

การตรวจสอบความสอดคล้องข้ามรูปแบบข้อมูล

เมื่อข้อเท็จจริงเดียวกันปรากฏในรูปแบบข้อมูลสองแบบ (ภาพสไลด์และคำบรรยายที่พูดประกอบ) ให้เขียนคำสั่งให้โมเดล ตรวจสอบไขว้ข้อมูลเหล่านั้น ความสอดคล้องกันเพิ่มความมั่นใจ ส่วนความไม่ตรงกันก็เป็นสัญญาณที่ควรแสดงออกมาเช่นกัน

  • 'คำบรรยายของรูปตรงกับสิ่งที่แผนภูมิแสดงหรือไม่?'
  • 'คำบรรยายที่พูดประกอบตรงกับตัวเลขบนหน้าจอหรือไม่?'
prompt = (
  'You have a slide image and its transcript. '
  'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
  'Flag any disagreement explicitly.'
)

การปฏิเสธในฐานะผลลัพธ์ของการยึดโยงหลักฐาน

ระบบที่ยึดโยงหลักฐานต้องได้รับอนุญาตให้ตอบว่า 'มองไม่เห็น' หากไม่มีทางออกที่ระบุไว้อย่างชัดเจน โมเดลจะเติมช่องว่างด้วยข้อมูลที่กุขึ้นอย่างน่าเชื่อถือ จัดเตรียมทางออกนี้ไว้และให้คุณค่ากับการใช้ทางออกดังกล่าว

กำชับว่า: 'หากไม่มีหลักฐานหรืออ่านไม่ออก ให้ส่ง NOT_FOUND แทนการเดา' จากนั้นทำให้ NOT_FOUND เป็นผลลัพธ์สำคัญที่ไม่ถูกลงโทษในกระบวนการของคุณ

การยึดโยงความสัมพันธ์เชิงพื้นที่

ข้ออ้างเชิงความสัมพันธ์ ('วาล์วอยู่ทางซ้ายของเกจวัด') ยึดโยงกับหลักฐานได้ยากกว่าการระบุว่ามีวัตถุอยู่ ขอให้โมเดลยึดโยง ทั้งสิ่งอ้างอิงสองสิ่งแยกกันด้วยกรอบล้อม แล้วค่อยอนุมานความสัมพันธ์จากพิกัด แทนการยืนยันความสัมพันธ์โดยตรง

การแยกย่อยนี้เปลี่ยนการตัดสินความสัมพันธ์ที่เปราะบางให้เป็นงานระบุตำแหน่งที่ง่ายกว่าสองงาน แล้วจึงคำนวณเลขคณิต

# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
    return a['box'][2] < b['box'][0]

การยึดโยงเสียงและเวลา

การยึดโยงหลักฐานใช้ได้กับสิ่งที่อยู่นอกเหนือจากภาพด้วย สำหรับเสียงหรือวิดีโอ กำหนดให้ใช้ การประทับเวลาเป็นหลักฐาน: 'ระบุ [mm:ss] ที่มีการพูดข้อความนี้' ตัวชี้ตามเวลาช่วยให้ตรวจสอบข้ออ้างเทียบกับช่วงต้นฉบับได้

  • การประทับเวลายึดโยงข้ออ้างเกี่ยวกับการถอดเสียงและการแยกผู้พูด
  • การประทับเวลาแสดงให้เห็นการสรุปที่คลาดเคลื่อนจากสิ่งที่พูดจริง

กับดักการครอบงำจากข้อความ

ข้อยืนยันในช่องข้อความที่แสดงอย่างมั่นใจอาจกดทับหลักฐานภาพที่ถูกต้อง — โมเดลยอมทำตามความเชื่อเดิมที่คุณป้อน หากบริบทของคุณระบุว่า 'ยอดรวมใบแจ้งหนี้คือ $400' แต่ภาพแสดง $450 โมเดลที่ไม่ยึดโยงหลักฐานอาจตอบตามว่า $400

แนวป้องกัน: กำชับให้โมเดลอนุมานจากภาพเพียงอย่างเดียวก่อน จากนั้นจึงเปรียบเทียบกับข้อความที่ให้มา และแจ้งความไม่ตรงกันแทนการประนีประนอมข้อมูลอย่างเงียบ ๆ

การตรวจสอบการยึดโยงหลักฐานในขั้นถัดไป

การยึดโยงหลักฐานมีประโยชน์ก็ต่อเมื่อคุณนำไปใช้ สร้างตัวตรวจสอบที่รับหลักฐานแบบมีโครงสร้าง:

  • ใช้ crop ซ้ำกับแต่ละกรอบล้อม แล้วทำ OCR ข้อความที่ยกมาอีกครั้ง หากไม่ตรงกัน -> ปฏิเสธ
  • นำการประทับเวลาที่อ้างถึงไปประมวลผลผ่าน ASR รอบที่สอง
  • ใช้ NOT_FOUND และเครื่องหมายข้อขัดแย้งเป็นสัญญาณส่งต่อให้มนุษย์ตรวจสอบ

คำสั่งสร้างหลักฐาน ส่วนระบบของคุณเป็นผู้บังคับใช้หลักฐานนั้น

def verify(field):
    crop = image.crop(field['box'])
    read = ocr(crop)
    return similar(read, field['value']) > 0.9

แม่แบบข้อตกลงการยึดโยงหลักฐาน

ข้อตกลงการยึดโยงหลักฐานที่นำกลับมาใช้ใหม่ได้จะรวมเทคนิคทุกอย่างไว้ด้วยกัน:

  • ข้อสังเกตก่อนข้อสรุป
  • กรอบล้อมและข้อความตรงตามต้นฉบับต่อข้ออ้างแต่ละข้อ
  • ทางออก NOT_FOUND และห้ามเดาโดยเด็ดขาด
  • อนุมานจากภาพก่อน จากนั้นจึงเทียบกับข้อความที่ให้มาและแจ้งข้อขัดแย้ง
  • การประทับเวลาสำหรับข้ออ้างเกี่ยวกับเสียงหรือวิดีโอทุกข้อ

กำหนดเป็นระบบครั้งเดียวแล้วนำกลับมาใช้กับงานหลายสื่อทุกงาน

ตรวจสอบความเข้าใจอย่างรวดเร็ว

ข้อมูลเมตาของบริบทระบุว่ายอดรวมคำสั่งซื้อคือ $400 แต่คุณสงสัยว่าภาพสแกนอาจแตกต่างกัน

ทบทวน: การยึดโยงหลักฐานข้ามรูปแบบข้อมูล

การยึดโยงหลักฐานทำให้ผลลัพธ์หลายสื่อตรวจสอบย้อนกลับได้: ข้อสังเกตก่อนข้อสรุป กรอบล้อมและข้อความตรงตามต้นฉบับต่อข้ออ้าง การประทับเวลาสำหรับเสียงหรือวิดีโอ ทางออก NOT_FOUND และการอนุมานจากภาพก่อนที่จะแจ้งข้อขัดแย้งกับข้อความที่ให้มา จับคู่ข้อตกลงการยึดโยงหลักฐานเข้ากับตัวตรวจสอบในขั้นถัดไปที่ตัดภาพใหม่ อ่านซ้ำ และส่งเครื่องหมายไปตรวจสอบ หลักฐานอยู่ในคำสั่ง การบังคับใช้อยู่ในระบบ — ทั้งสองส่วนร่วมกันกำจัดการกุเรื่องอย่างมั่นใจ

คำถามที่พบบ่อย

บทเรียน “การยึดโยงข้ามรูปแบบสื่อ” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การยึดโยงข้ามรูปแบบสื่อ” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Prompt Engineering ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Prompt Engineering มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การยึดโยงข้ามรูปแบบสื่อ”

การอ้างอิงหลักฐานภาพในข้อความ คุณปฏิบัติ AI Prompt Engineering ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Prompt Engineering หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Prompt Engineering บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน

บทเรียน “การยึดโยงข้ามรูปแบบสื่อ” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Prompt Engineering นี้ได้ไหม

ได้ บทเรียน AI Prompt Engineering ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การผสานข้อความและรูปภาพ
  2. การยึดโยงข้ามรูปแบบสื่อ
  3. เสียง ข้อความ และภาพร่วมกัน
  4. การควบคุมผลลัพธ์หลายสื่อ
← กลับไปที่ AI Prompt Engineering