Deep Learning Academy · Lección

Cuantización para modelos más pequeños y rápidos

Reduzca los pesos mediante inferencia int8

Lección 3 de 413 pasos

Cuantización para modelos más pequeños y rápidos es una lección gratuita de Deep Learning Academy en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Deep Learning Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Deep Learning Academy incluye 4 lecciones en total.

Pesos más pequeños, modelos más rápidos

Los modelos grandes son lentos y pesados al servirlos. La cuantización los reduce al almacenar los números con menos bits, de modo que se ejecutan más rápido y ocupan menos. 📉

Float32 frente a Int8

Normalmente, los modelos almacenan los pesos como números de coma flotante de 32 bits. La cuantización los convierte en enteros de 8 bits, lo que reduce su tamaño aproximadamente cuatro veces.

Por qué Int8 se ejecuta más rápido

En la mayoría del hardware, las operaciones con enteros son menos costosas que las de coma flotante, por lo que la inferencia int8 utiliza menos ancho de banda de memoria y termina antes.

Asignar números de coma flotante a enteros

Una escala y un punto cero asignan cada rango de números de coma flotante a enteros. Permiten que el modelo recupere un valor de coma flotante aproximado durante los cálculos.

Espere una pequeña pérdida de precisión

Menos bits implican perder algo de precisión, por lo que la exactitud puede disminuir ligeramente. En la mayoría de los modelos, la pérdida es pequeña y la mejora de velocidad compensa con creces.

Cuantización dinámica: la opción sencilla

La cuantización dinámica es la opción más sencilla. Cuantiza los pesos de antemano y las activaciones sobre la marcha, por lo que resulta ideal para capas lineales y RNN.

import torch
q = torch.quantization.quantize_dynamic(
  model, {torch.nn.Linear}, dtype=torch.qint8)

Cuantización estática: calibre primero

La cuantización estática también cuantiza las activaciones de antemano. Se proporcionan datos de ejemplo para calibrar los rangos y obtener más velocidad en las CPU.

Entrenamiento consciente de la cuantización

Para obtener la máxima exactitud, el entrenamiento consciente de la cuantización simula int8 durante el entrenamiento, de modo que el modelo aprende a tolerar la menor precisión.

Mida la reducción de tamaño

Después de cuantizar el modelo, guárdelo y compare los tamaños de archivo. Normalmente, una versión int8 ocupa aproximadamente una cuarta parte de la versión original en float32. 💾

torch.save(q.state_dict(), 'model_int8.pt')

Vuelva a comprobar siempre la exactitud

Ejecute el conjunto de validación en el modelo cuantizado y confirme que la exactitud sigue siendo aceptable antes de implementarlo para usuarios reales.

La cuantización destaca en CPU y dispositivos periféricos

La cuantización ofrece mayores beneficios en CPU, teléfonos y dispositivos periféricos, donde la memoria es limitada y las operaciones con enteros cuentan con buen soporte. 📱

Comprobación rápida

Quiere la cuantización más rápida, sin ningún paso de calibración. ¿Cuál corresponde?

Repaso: más ligero y rápido

Redujo el tamaño de un modelo con cuantización, sustituyó float32 por int8, eligió entrenamiento dinámico, estático o consciente de la cuantización y volvió a comprobar la exactitud. 🎉

Gratis para empezar

Aprende Python con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
30
Lecciones
120

Preguntas frecuentes

¿La lección «Cuantización para modelos más pequeños y rápidos» es gratis?

Sí — el texto completo de «Cuantización para modelos más pequeños y rápidos» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Deep Learning Academy, actualiza a CoddyKit PRO. El curso de Deep Learning Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Cuantización para modelos más pequeños y rápidos»?

Reduzca los pesos mediante inferencia int8 Practicas Deep Learning Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar Deep Learning Academy?

No se requiere experiencia previa. Deep Learning Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.

¿Cuánto tiempo toma la lección «Cuantización para modelos más pequeños y rápidos»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de Deep Learning Academy?

Sí. Cada lección de Deep Learning Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. TorchScript y torch.compile
  2. Exporte a ONNX
  3. Cuantización para modelos más pequeños y rápidos
  4. Sirva con FastAPI
← Volver a Deep Learning Academy