CUDA Academy · บทเรียน

ความแม่นยำผสม: FP16, BF16, TF32

แลกความแม่นยำกับอัตราการประมวลผล

บทเรียน 2 จาก 413 ขั้นตอน

ความแม่นยำผสม: FP16, BF16, TF32 เป็นบทเรียน CUDA Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน CUDA Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

แลกบิตกับความเร็ว

แกน Tensor ได้ความเร็วจากความละเอียดผสม โดยป้อนรูปแบบตัวเลขที่เล็กลง เพื่อให้ฮาร์ดแวร์ทำคณิตศาสตร์ได้มากขึ้นในแต่ละรอบ ⚡

FP32 มีต้นทุนเท่าใด

FP32 มาตรฐานใช้ 32 บิตต่อค่า มีความแม่นยำสูงแต่ใช้ทรัพยากรมาก ดังนั้นการย้ายและคูณค่า FP32 จำนวนมากจึงกินแบนด์วิดท์และเวลา

พบกับ FP16

FP16ใช้เพียง 16 บิต โดยมีเลขชี้กำลังที่เล็กลงและบิตแมนทิสซาน้อยลง ขนาดครึ่งหนึ่งหมายถึงสามารถย้ายและคูณค่าได้มากขึ้นพร้อมกัน

FP16 มีช่วงค่าขนาดเล็ก

FP16 ช่วยประหยัดพื้นที่ แต่เลขชี้กำลังที่มีช่วงแคบทำให้มีช่วงไดนามิกเล็กมาก ค่าที่ใหญ่มากหรือเล็กมากอาจล้นหรือหายไปเป็นศูนย์

พบกับ BF16

BF16มีขนาด 16 บิตเช่นกัน แต่คงเลขชี้กำลังเต็มช่วงของ FP32 ไว้ โดยแลกด้วยบิตแมนทิสซาแทน จึงมีช่วงค่าเท่า FP32 แต่ความแม่นยำน้อยกว่า

เหตุใด BF16 จึงเหมาะกับการฝึก

เนื่องจาก BF16 มีช่วงค่ากว้างเหมือน FP32 ค่าเกรเดียนต์จึงแทบไม่ล้น ทำให้BF16เป็นตัวเลือกยอดนิยมสำหรับฝึกโครงข่ายประสาทขนาดใหญ่อย่างปลอดภัย

พบกับ TF32

TF32เป็นรูปแบบ 19 บิตสำหรับแกน Tensor ใช้เลขชี้กำลังของ FP32 แต่ลดขนาดแมนทิสซา ช่วยเร่งคณิตศาสตร์ขณะเดียวกันโค้ดยังมองเห็นเป็น FP32

ตัวสะสมยังคงมีความละเอียดสูง

ไม่ว่าอินพุตจะอยู่ในรูปแบบใด แกน Tensor มักจะสะสมผลรวมบางส่วนใน FP32 ความเร็วอยู่ที่อินพุต ส่วนความปลอดภัยอยู่ที่ผลรวมต่อเนื่อง

ช่วงค่าเทียบกับความแม่นยำ

แนวคิดสำคัญคือ FP16 และ BF16 ใช้ 16 บิตเท่ากัน แต่แบ่งบิตต่างกัน แบบหนึ่งเน้นความแม่นยำ ส่วนอีกแบบเน้นช่วงค่า

เลือกรูปแบบข้อมูล

ใช้ BF16 หรือ TF32 เมื่อช่วงค่ามีความสำคัญ และใช้ FP16 เมื่อคุณจัดการการปรับสเกลได้ รูปแบบข้อมูลที่เหมาะสมขึ้นอยู่กับข้อมูลของคุณ ไม่ใช่แค่ความเร็ว

ประกาศค่าความละเอียดครึ่งหนึ่ง

ใน CUDA C++ ชนิดข้อมูล FP16 มีชื่อสั้น ๆ บรรทัดนี้ประกาศค่าความละเอียดครึ่งหนึ่งหนึ่งค่า ซึ่งพร้อมใช้กับคณิตศาสตร์ของแกน Tensor

__half x = __float2half(1.5f);

ตรวจสอบอย่างรวดเร็ว

รูปแบบใดคงช่วงเลขชี้กำลังเต็มของ FP32 ไว้ได้ภายใน 16 บิต

สรุป

คุณได้เห็นแล้วว่าความละเอียดผสมแลกบิตกับปริมาณงานอย่างไร FP16 เน้นความแม่นยำ BF16 เน้นช่วงค่า และ TF32 เร่งคณิตศาสตร์แบบ FP32 การสะสมด้วยความละเอียดสูงช่วยรักษาความปลอดภัยของผลลัพธ์ ✨

เริ่มต้นได้ฟรี

เรียนรู้ C++ ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
30
บทเรียน
120

คำถามที่พบบ่อย

บทเรียน “ความแม่นยำผสม: FP16, BF16, TF32” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “ความแม่นยำผสม: FP16, BF16, TF32” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส CUDA Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส CUDA Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “ความแม่นยำผสม: FP16, BF16, TF32”

แลกความแม่นยำกับอัตราการประมวลผล คุณปฏิบัติ CUDA Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน CUDA Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน CUDA Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 4 บทเรียน

บทเรียน “ความแม่นยำผสม: FP16, BF16, TF32” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน CUDA Academy นี้ได้ไหม

ได้ บทเรียน CUDA Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. Tensor Core คำนวณอะไร
  2. ความแม่นยำผสม: FP16, BF16, TF32
  3. API ส่วนย่อยของ WMMA
  4. ข้อแลกเปลี่ยนด้านเสถียรภาพเชิงตัวเลข
← กลับไปที่ CUDA Academy