0Pricing
Deep Learning Academy · บทเรียน

ความสนใจในตัวเอง: คิวรี คีย์ และแวลู

เปิดให้ทุกโทเค็นมองโทเค็นอื่นได้

ความสนใจในตัวเอง: คิวรี คีย์ และแวลู เป็นบทเรียน Deep Learning Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Deep Learning Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Deep Learning Academy มีบทเรียนทั้งหมด 4 บทเรียน

โทเค็นที่สื่อสารกัน

ในลำดับหนึ่ง ความหมายของคำหนึ่งขึ้นอยู่กับคำอื่น ๆ การใส่ใจตนเองทำให้โทเค็นทุกตัวมองโทเค็นอื่นทุกตัวเพื่อรวบรวมบริบทที่จำเป็น

สามบทบาทต่อหนึ่งโทเค็น

โทเค็นแต่ละตัวมีสามบทบาท: คำค้นที่ใช้ถาม คีย์ที่ใช้ตอบ และค่า ​​ที่บรรจุเนื้อหา ทั้งหมดมาจากคำเดียวกันแต่ถูกใช้งานสามรูปแบบ

คำค้น

คำค้นของโทเค็นอธิบายสิ่งที่โทเค็นกำลังค้นหา ลองคิดว่าคำนี้กำลังถามคำถามอะไรเกี่ยวกับส่วนที่เหลือของประโยค

คีย์

โทเค็นทุกตัวยังแสดงคีย์ ซึ่งเป็นป้ายกำกับที่บอกว่าตนเองมีอะไรให้ คำค้นจะถูกเปรียบเทียบกับคีย์ทั้งหมดเพื่อค้นหาคู่ที่เหมาะสม

ค่า

เมื่อพบคู่ที่ตรงกัน ค่าคือข้อมูลจริงที่ถูกส่งต่อ คีย์เป็นตัวกำหนดปริมาณ ส่วนค่าเป็นตัวกำหนดเนื้อหา

สร้าง Q, K, V

คุณสร้างคำค้น คีย์ และค่าโดยฉายอินพุตผ่านเลเยอร์เชิงเส้นที่เรียนรู้มา 3 เลเยอร์ อินพุตเดียวกัน แต่มีกลุ่มเมทริกซ์น้ำหนัก 3 แบบ

q = self.W_q(x)
k = self.W_k(x)
v = self.W_v(x)

ให้คะแนนตามความคล้ายคลึง

ในการดูว่าคำค้นตรงกับคีย์มากเพียงใด ให้คำนวณผลคูณจุดของทั้งสอง ค่าแรงกว่าหมายความว่าโทเค็นทั้งสองเกี่ยวข้องกันมากกว่า

scores = q @ k.transpose(-2, -1)

เปลี่ยนคะแนนเป็นน้ำหนัก

คะแนนดิบจะกลายเป็นน้ำหนักการใส่ใจด้วย softmax ทำให้น้ำหนักของคำค้นแต่ละคำเป็นบวกและรวมกันได้หนึ่งเมื่อพิจารณาคีย์ทั้งหมด

weights = scores.softmax(dim=-1)

ผสมค่า

เอาต์พุตของโทเค็นแต่ละตัวคือผลรวมถ่วงน้ำหนักของค่าทั้งหมด โดยผสมตามน้ำหนักการใส่ใจ โทเค็นที่เกี่ยวข้องจะมีส่วนร่วมมากกว่า

out = weights @ v

เหตุใดจึงดีกว่า RNN

การใส่ใจตนเองเชื่อมโทเค็นสองตัวใด ๆ ได้ในขั้นตอนเดียว ดังนั้นระยะห่างจึงไม่สำคัญ มุมมองแบบขนานนี้เป็นเหตุผลที่ทำให้ทรานส์ฟอร์เมอร์จัดการบริบทยาว ๆ ได้ดี

เรียนรู้ ไม่ได้กำหนดตายตัว

การฉาย Q, K, V จะถูกฝึกด้วยการลดตามความชัน เครือข่ายเรียนรู้เองว่าจะถามอะไร บอกอะไร และแบ่งปันอะไร ทั้งหมดจากข้อมูล

ตรวจสอบอย่างรวดเร็ว

มาทดสอบกันว่าการใส่ใจผสมองค์ประกอบต่าง ๆ อย่างไร

สรุปทบทวน

คุณได้เรียนรู้ว่าการใส่ใจตนเองเปลี่ยนโทเค็นแต่ละตัวให้เป็นคำค้น คีย์ และค่า ให้คะแนนการจับคู่ระหว่างคำค้นกับคีย์ และผสมค่าด้วยน้ำหนักจาก softmax ทำได้ดีมาก

คำถามที่พบบ่อย

บทเรียน “ความสนใจในตัวเอง: คิวรี คีย์ และแวลู” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “ความสนใจในตัวเอง: คิวรี คีย์ และแวลู” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Deep Learning Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Deep Learning Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “ความสนใจในตัวเอง: คิวรี คีย์ และแวลู”

เปิดให้ทุกโทเค็นมองโทเค็นอื่นได้ คุณปฏิบัติ Deep Learning Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Deep Learning Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Deep Learning Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน

บทเรียน “ความสนใจในตัวเอง: คิวรี คีย์ และแวลู” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Deep Learning Academy นี้ได้ไหม

ได้ บทเรียน Deep Learning Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. ความสนใจในตัวเอง: คิวรี คีย์ และแวลู
  2. ผลคูณจุดแบบปรับสเกลและหลายหัว
  3. การเข้ารหัสตำแหน่งเพื่อบอกลำดับ
  4. วางบล็อกตัวเข้ารหัส Transformer ซ้อนกัน
← กลับไปที่ Deep Learning Academy