Cuantización para modelos más pequeños y rápidos
Reduzca los pesos mediante inferencia int8
Cuantización para modelos más pequeños y rápidos es una lección gratuita de Deep Learning Academy en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Deep Learning Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Deep Learning Academy incluye 4 lecciones en total.
Pesos más pequeños, modelos más rápidos
Los modelos grandes son lentos y pesados al servirlos. La cuantización los reduce al almacenar los números con menos bits, de modo que se ejecutan más rápido y ocupan menos. 📉
Float32 frente a Int8
Normalmente, los modelos almacenan los pesos como números de coma flotante de 32 bits. La cuantización los convierte en enteros de 8 bits, lo que reduce su tamaño aproximadamente cuatro veces.
Por qué Int8 se ejecuta más rápido
En la mayoría del hardware, las operaciones con enteros son menos costosas que las de coma flotante, por lo que la inferencia int8 utiliza menos ancho de banda de memoria y termina antes.
Asignar números de coma flotante a enteros
Una escala y un punto cero asignan cada rango de números de coma flotante a enteros. Permiten que el modelo recupere un valor de coma flotante aproximado durante los cálculos.
Espere una pequeña pérdida de precisión
Menos bits implican perder algo de precisión, por lo que la exactitud puede disminuir ligeramente. En la mayoría de los modelos, la pérdida es pequeña y la mejora de velocidad compensa con creces.
Cuantización dinámica: la opción sencilla
La cuantización dinámica es la opción más sencilla. Cuantiza los pesos de antemano y las activaciones sobre la marcha, por lo que resulta ideal para capas lineales y RNN.
import torch
q = torch.quantization.quantize_dynamic(
model, {torch.nn.Linear}, dtype=torch.qint8)Cuantización estática: calibre primero
La cuantización estática también cuantiza las activaciones de antemano. Se proporcionan datos de ejemplo para calibrar los rangos y obtener más velocidad en las CPU.
Entrenamiento consciente de la cuantización
Para obtener la máxima exactitud, el entrenamiento consciente de la cuantización simula int8 durante el entrenamiento, de modo que el modelo aprende a tolerar la menor precisión.
Mida la reducción de tamaño
Después de cuantizar el modelo, guárdelo y compare los tamaños de archivo. Normalmente, una versión int8 ocupa aproximadamente una cuarta parte de la versión original en float32. 💾
torch.save(q.state_dict(), 'model_int8.pt')Vuelva a comprobar siempre la exactitud
Ejecute el conjunto de validación en el modelo cuantizado y confirme que la exactitud sigue siendo aceptable antes de implementarlo para usuarios reales.
La cuantización destaca en CPU y dispositivos periféricos
La cuantización ofrece mayores beneficios en CPU, teléfonos y dispositivos periféricos, donde la memoria es limitada y las operaciones con enteros cuentan con buen soporte. 📱
Comprobación rápida
Quiere la cuantización más rápida, sin ningún paso de calibración. ¿Cuál corresponde?
Repaso: más ligero y rápido
Redujo el tamaño de un modelo con cuantización, sustituyó float32 por int8, eligió entrenamiento dinámico, estático o consciente de la cuantización y volvió a comprobar la exactitud. 🎉
Aprende Python con un tutor de IA — gratis
Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.
- Cursos
- 30
- Lecciones
- 120
Preguntas frecuentes
¿La lección «Cuantización para modelos más pequeños y rápidos» es gratis?
Sí — el texto completo de «Cuantización para modelos más pequeños y rápidos» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Deep Learning Academy, actualiza a CoddyKit PRO. El curso de Deep Learning Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Cuantización para modelos más pequeños y rápidos»?
Reduzca los pesos mediante inferencia int8 Practicas Deep Learning Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar Deep Learning Academy?
No se requiere experiencia previa. Deep Learning Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.
¿Cuánto tiempo toma la lección «Cuantización para modelos más pequeños y rápidos»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de Deep Learning Academy?
Sí. Cada lección de Deep Learning Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- TorchScript y torch.compile
- Exporte a ONNX
- Cuantización para modelos más pequeños y rápidos
- Sirva con FastAPI