Précision mixte : FP16, BF16, TF32
Échanger de la précision contre du débit
Précision mixte : FP16, BF16, TF32 est une leçon CUDA Academy gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage CUDA Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours CUDA Academy comprend 4 leçons au total.
Échanger des bits contre de la vitesse
Les Tensor Cores tirent leur vitesse de la précision mixte : utiliser des formats numériques plus compacts afin que le matériel puisse effectuer bien plus de calculs par cycle. ⚡
Le coût de FP32
Le format standard FP32 utilise 32 bits par valeur. Il est précis mais lourd : déplacer et multiplier de nombreuses valeurs FP32 consomme de la bande passante et du temps.
Découvrez FP16
FP16 n’utilise que 16 bits : un exposant plus petit et moins de bits de mantisse. Une taille réduite permet de déplacer et de multiplier davantage de valeurs à la fois.
FP16 a une plage réduite
FP16 économise de l’espace, mais son exposant limité lui donne une plage dynamique très réduite. Les valeurs très grandes ou très petites peuvent dépasser la capacité représentable ou devenir nulles.
Découvrez BF16
BF16 utilise également 16 bits, mais conserve l’exposant complet de FP32 en sacrifiant plutôt des bits de mantisse. Il correspond à la plage de FP32 avec moins de précision.
Pourquoi BF16 est privilégié pour l’entraînement
Comme BF16 partage la large plage de FP32, les gradients débordent rarement. Cela fait de BF16 un format apprécié pour entraîner de grands réseaux neuronaux en toute sécurité.
Découvrez TF32
TF32 est un format de Tensor Core de 19 bits : l’exposant de FP32 avec une mantisse réduite. Il accélère les calculs tout en se présentant comme FP32 dans votre code.
L’accumulateur conserve une grande précision
Quel que soit le format d’entrée, les Tensor Cores accumulent généralement les sommes partielles en FP32. La vitesse vient des entrées ; la fiabilité, du total cumulé.
Plage contre précision
L’idée essentielle : FP16 et BF16 coûtent tous deux 16 bits, mais les répartissent différemment. L’un privilégie la précision, l’autre la plage de valeurs.
Choisir un format
Utilisez BF16 ou TF32 lorsque la plage compte, et FP16 lorsque vous pouvez gérer la mise à l’échelle. Le bon format dépend de vos données, pas seulement de la vitesse.
Déclarer une précision demi-mot
En CUDA C++, le type FP16 possède un nom court. Cette ligne déclare une valeur half prête pour les calculs avec les Tensor Cores.
__half x = __float2half(1.5f);Vérification rapide
Quel format conserve toute la plage d’exposant de FP32 avec seulement 16 bits ?
Récapitulatif
Vous avez vu comment la précision mixte échange des bits contre du débit : FP16 privilégie la précision, BF16 la plage, et TF32 accélère les calculs de type FP32. Une accumulation avec une grande précision protège les résultats. ✨
Questions Fréquemment Posées
La leçon « Précision mixte : FP16, BF16, TF32 » est-elle gratuite ?
Oui — le texte complet de « Précision mixte : FP16, BF16, TF32 » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours CUDA Academy, passe à CoddyKit PRO. Le cours CUDA Academy comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Précision mixte : FP16, BF16, TF32 » ?
Échanger de la précision contre du débit Tu pratiques CUDA Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer CUDA Academy ?
Aucune expérience préalable n'est requise. CUDA Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.
Combien de temps prend la leçon « Précision mixte : FP16, BF16, TF32 » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon CUDA Academy ?
Oui. Chaque leçon CUDA Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Ce que calculent les cœurs tensoriels
- Précision mixte : FP16, BF16, TF32
- L’API de fragments WMMA
- Compromis de stabilité numérique