Compromisos de estabilidad numérica
Cuándo hay que tener cuidado con una menor precisión
Compromisos de estabilidad numérica es una lección gratuita de CUDA Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de CUDA Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de CUDA Academy incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
Speed Has a Cost
Lower-precision Tensor Core math is fast, but fewer bits mean rounding errors. Numerical stability is the art of keeping results trustworthy. ⚖️
What Rounding Error Is
Each low-precision value is rounded to the nearest representable number. That tiny rounding error is harmless once but can pile up over many steps.
FP16 Underflow
FP16's narrow range lets small numbers fall to zero, called underflow. Gradients and tiny weights can simply disappear during training.
FP16 Overflow
The same narrow range causes overflow: a large value becomes infinity. One bad sum can then poison everything downstream.
Loss Scaling to the Rescue
A common fix is loss scaling: multiply values up before FP16 math so they leave the underflow zone, then scale back down afterward.
Why Wide Accumulation Helps
Tensor Cores accumulate in FP32 for a reason. That wider accumulator stops thousands of small additions from drifting badly.
BF16 Sidesteps Range Issues
Because BF16 keeps FP32's exponent, it rarely overflows or underflows. Its weakness is lower precision, not a shrunken range.
Catastrophic Cancellation
Subtracting two close numbers wipes out leading digits, called cancellation. Low precision makes the surviving error far more visible.
Keep Critical Parts in FP32
A safe pattern is mixed precision: do bulk multiplies in FP16 or BF16 but keep sensitive sums, norms, and updates in FP32.
Always Validate Accuracy
Never assume a fast kernel is correct. Compare against an FP32 reference and check the error stays within an acceptable tolerance.
Measuring the Error
A simple check is the absolute difference against a trusted result. Compare this error to a small threshold you choose.
float err = fabsf(gpu_result - cpu_result);Quick Check
Why do Tensor Cores accumulate partial sums in FP32 even with FP16 inputs?
Recap
You learned the precision tradeoffs: watch for FP16 overflow and underflow, use loss scaling and FP32 accumulation, and always validate against a reference. 🎯
Preguntas frecuentes
¿La lección «Compromisos de estabilidad numérica» es gratis?
Sí — el texto completo de «Compromisos de estabilidad numérica» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de CUDA Academy, actualiza a CoddyKit PRO. El curso de CUDA Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Compromisos de estabilidad numérica»?
Cuándo hay que tener cuidado con una menor precisión Practicas CUDA Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar CUDA Academy?
No se requiere experiencia previa. CUDA Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.
¿Cuánto tiempo toma la lección «Compromisos de estabilidad numérica»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de CUDA Academy?
Sí. Cada lección de CUDA Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Qué calculan los Tensor Cores
- Precisión mixta: FP16, BF16 y TF32
- API de fragmentos de WMMA
- Compromisos de estabilidad numérica