Blandad precision: FP16, BF16, TF32
Byt precision mot genomströmning
Blandad precision: FP16, BF16, TF32 är en gratis lektion i CUDA Academy på CoddyKit. Detta är lektion 2 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för CUDA Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i CUDA Academy innehåller totalt 4 lektioner.
Byt bitar mot hastighet
Tensor Cores får sin hastighet från blandad precision: mindre talformat som gör att hårdvaran kan utföra betydligt fler beräkningar per cykel. ⚡
Vad FP32 kostar
Standardformatet FP32 använder 32 bitar per värde. Det är noggrant men tungt, så att flytta och multiplicera många FP32-tal kräver bandbredd och tid.
Möt FP16
FP16 använder bara 16 bitar: en mindre exponent och färre mantissabitar. Halva storleken innebär att fler värden kan flyttas och multipliceras samtidigt.
FP16 har ett litet intervall
FP16 sparar utrymme, men den begränsade exponenten ger ett litet dynamiskt intervall. Mycket stora eller mycket små värden kan flöda över eller försvinna till noll.
Möt BF16
BF16 har också 16 bitar, men behåller FP32:s fullständiga exponent och offrar i stället mantissabitar. Det ger FP32:s intervall med lägre precision.
Varför BF16 vinner vid träning
Eftersom BF16 delar FP32:s breda intervall flödar gradienter sällan över. Därför är BF16 populärt för säker träning av stora neurala nätverk.
Möt TF32
TF32 är ett 19-bitarsformat för Tensor Cores: FP32:s exponent med en kortare mantissa. Det snabbar upp beräkningarna samtidigt som det ser ut som FP32 för koden.
Ackumulatorn förblir bred
Oavsett indatasformat ackumulerar Tensor Cores vanligtvis delsummor i FP32. Hastigheten finns i indatan; säkerheten i den löpande totalsumman.
Intervall kontra precision
Huvudidén är att FP16 och BF16 kostar samma 16 bitar men fördelar dem på olika sätt. Det ena gynnar precision, det andra intervall.
Välj ett format
Använd BF16 eller TF32 när intervallet är viktigt, och FP16 när Ni kan hantera skalning. Rätt format beror på Era data, inte bara på hastigheten.
Deklarera halv precision
I CUDA C++ har typen FP16 ett kort namn. Den här raden deklarerar ett half-värde som är klart för Tensor Core-beräkningar.
__half x = __float2half(1.5f);Snabb kontroll
Vilket format behåller FP32:s fullständiga exponentintervall med endast 16 bitar?
Sammanfattning
Ni såg hur blandad precision byter bitar mot genomströmning: FP16 gynnar precision, BF16 intervall och TF32 snabbar upp FP32-liknande beräkningar. Bred ackumulering håller resultaten säkra. ✨
Lär dig C++ med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 30
- Lektioner
- 120
Vanliga frågor
Är lektionen ”Blandad precision: FP16, BF16, TF32” gratis?
Ja – hela texten till ”Blandad precision: FP16, BF16, TF32” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i CUDA Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i CUDA Academy innehåller totalt 4 lektioner.
Vad lär jag mig i ”Blandad precision: FP16, BF16, TF32”?
Byt precision mot genomströmning Ni övar på CUDA Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig CUDA Academy?
Du behöver inga förkunskaper. Utbildningen i CUDA Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 4.
Hur lång tid tar lektionen ”Blandad precision: FP16, BF16, TF32”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här CUDA Academy-lektionen?
Ja. Varje CUDA Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Vad Tensor Cores beräknar
- Blandad precision: FP16, BF16, TF32
- WMMA-fragment-API:t
- Avvägningar kring numerisk stabilitet