MLOps Academy · Lezione

Quantizzare e distillare per un'inferenza più economica

Riduca le dimensioni dei modelli mantenendo alta la qualità.

Lezione 2 di 413 passaggi

Quantizzare e distillare per un'inferenza più economica è una lezione MLOps Academy gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento MLOps Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso MLOps Academy include 4 lezioni in totale.

Riduca il modello, non il budget

Un modello più piccolo richiede meno memoria e hardware meno costoso per il serving. La compressione del modello ne riduce dimensioni e costi, mantenendo gran parte della precisione ottenuta.

Che cosa significa quantizzazione

La quantizzazione memorizza i pesi con un numero inferiore di bit, ad esempio int8 invece di float32. Il modello diventa circa quattro volte più piccolo e spesso più veloce sullo stesso chip.

Quantizzazione post-addestramento

Il percorso più semplice consiste nel quantizzare un modello già addestrato senza riaddestrarlo. La quantizzazione post-addestramento richiede una sola chiamata di funzione e comporta una perdita minima di precisione.

import torch
q = torch.quantization.quantize_dynamic(model, dtype=torch.qint8)

Calibri per una precisione migliore

Fornire alcuni batch reali aiuta la quantizzazione a scegliere buoni intervalli di valori. Questo passaggio di calibrazione preserva una precisione maggiore rispetto alla sola conversione automatica.

Addestramento consapevole della quantizzazione

Quando la precisione è fondamentale, simuli l'aritmetica int8 direttamente durante l'addestramento. Il quantization-aware training richiede più lavoro, ma recupera gran parte della precisione persa.

Che cosa significa distillazione

La distillazione della conoscenza addestra un piccolo modello studente a imitare un grande modello insegnante. Lo studente conserva gran parte delle capacità dell'insegnante a una frazione del costo.

Apprenda dalle etichette morbide

Lo studente apprende dagli output di probabilità completi dell'insegnante, non solo dalle risposte rigide. Queste etichette morbide contengono un segnale più ricco rispetto a una singola classe.

Scelga un'architettura più economica

La distillazione consente di sostituire un modello pesante con uno più leggero, come DistilBERT al posto di BERT. Uno studente più piccolo significa una latenza inferiore e un'istanza di serving più piccola.

Esegua anche il pruning dei pesi inutili

Il pruning rimuove i pesi che incidono appena sull'output, lasciando una rete più sparsa e leggera. Si abbina bene sia alla quantizzazione sia alla distillazione.

Misuri sempre il compromesso

Ogni riduzione può compromettere la precisione, quindi testi il modello compresso su dati reali. Osservi la curva precisione rispetto al costo e si fermi prima che la qualità diminuisca troppo.

Esporti e distribuisca in modo leggero

I modelli compressi si abbinano bene a runtime veloci come ONNX Runtime. Esporti una volta, poi distribuisca l'artefatto più piccolo su hardware meno costoso.

Verifica rapida

Precisiamo che cosa fa realmente la distillazione.

Riepilogo

Ha quantizzato i pesi con un numero inferiore di bit, distillato un piccolo studente da un grande insegnante ed eseguito il pruning dei pesi inutili, monitorando sempre il compromesso sulla precisione. 🪶

Gratis per iniziare

Impara Python con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
30
Lezioni
120

Domande Frequenti

La lezione «Quantizzare e distillare per un'inferenza più economica» è gratuita?

Sì — il testo completo di «Quantizzare e distillare per un'inferenza più economica» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso MLOps Academy, passa a CoddyKit PRO. Il corso MLOps Academy include 4 lezioni in totale.

Cosa imparerò in «Quantizzare e distillare per un'inferenza più economica»?

Riduca le dimensioni dei modelli mantenendo alta la qualità. Eserciti MLOps Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare MLOps Academy?

Non è richiesta alcuna esperienza precedente. MLOps Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.

Quanto tempo richiede la lezione «Quantizzare e distillare per un'inferenza più economica»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione MLOps Academy?

Sì. Ogni lezione MLOps Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Dimensionare correttamente istanze e repliche
  2. Quantizzare e distillare per un'inferenza più economica
  3. Usare istanze Spot per l'addestramento
  4. Monitorare il costo per previsione
← Torna a MLOps Academy