0Pricing
CUDA Academy · Aula

Compromissos de estabilidade numérica

Onde a menor precisão exige cuidado.

Compromissos de estabilidade numérica é uma aula grátis de CUDA Academy no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de CUDA Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de CUDA Academy inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Speed Has a Cost

Lower-precision Tensor Core math is fast, but fewer bits mean rounding errors. Numerical stability is the art of keeping results trustworthy. ⚖️

What Rounding Error Is

Each low-precision value is rounded to the nearest representable number. That tiny rounding error is harmless once but can pile up over many steps.

FP16 Underflow

FP16's narrow range lets small numbers fall to zero, called underflow. Gradients and tiny weights can simply disappear during training.

FP16 Overflow

The same narrow range causes overflow: a large value becomes infinity. One bad sum can then poison everything downstream.

Loss Scaling to the Rescue

A common fix is loss scaling: multiply values up before FP16 math so they leave the underflow zone, then scale back down afterward.

Why Wide Accumulation Helps

Tensor Cores accumulate in FP32 for a reason. That wider accumulator stops thousands of small additions from drifting badly.

BF16 Sidesteps Range Issues

Because BF16 keeps FP32's exponent, it rarely overflows or underflows. Its weakness is lower precision, not a shrunken range.

Catastrophic Cancellation

Subtracting two close numbers wipes out leading digits, called cancellation. Low precision makes the surviving error far more visible.

Keep Critical Parts in FP32

A safe pattern is mixed precision: do bulk multiplies in FP16 or BF16 but keep sensitive sums, norms, and updates in FP32.

Always Validate Accuracy

Never assume a fast kernel is correct. Compare against an FP32 reference and check the error stays within an acceptable tolerance.

Measuring the Error

A simple check is the absolute difference against a trusted result. Compare this error to a small threshold you choose.

float err = fabsf(gpu_result - cpu_result);

Quick Check

Why do Tensor Cores accumulate partial sums in FP32 even with FP16 inputs?

Recap

You learned the precision tradeoffs: watch for FP16 overflow and underflow, use loss scaling and FP32 accumulation, and always validate against a reference. 🎯

Perguntas Frequentes

A aula “Compromissos de estabilidade numérica” é grátis?

Sim — o texto completo de “Compromissos de estabilidade numérica” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de CUDA Academy, atualize para CoddyKit PRO. O curso de CUDA Academy inclui 4 aulas no total.

O que vou aprender em “Compromissos de estabilidade numérica”?

Onde a menor precisão exige cuidado. Você pratica CUDA Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar CUDA Academy?

Nenhuma experiência prévia é necessária. CUDA Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.

Quanto tempo leva a aula “Compromissos de estabilidade numérica”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de CUDA Academy?

Sim. Cada aula de CUDA Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. O que os Tensor Cores calculam
  2. Precisão mista: FP16, BF16, TF32
  3. A API de fragmentos WMMA
  4. Compromissos de estabilidade numérica
← Voltar para CUDA Academy