Lær AI med Python · leksjon

Innlasting og tilgjengeliggjøring av ML-modeller

Innlasting av joblib-/keras-modell ved oppstart, trådsikker inferens og endepunkter for prediksjon i batcher.

Leksjon 3 av 413 trinn

Innlasting og tilgjengeliggjøring av ML-modeller er en gratis leksjon i Lær AI med Python på CoddyKit. Dette er leksjon 3 av 4. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Lær AI med Python, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Lær AI med Python inneholder totalt 4 leksjoner.

Lastingsproblemet

Det tar tid å laste en modell fra disk. Hvis den lastes på nytt for hver forespørsel, øker latenstiden kraftig. Løsningen er å laste modellen én gang ved oppstart og gjenbruke den for alle forespørsler.

startup-hendelsen

Kroken @app.on_event("startup") kjøres én gang når serveren starter, og er derfor det perfekte stedet å laste modellen før den første forespørselen kommer.

from fastapi import FastAPI
import joblib

app = FastAPI()

@app.on_event("startup")
def load_model():
    app.state.model = joblib.load("model.joblib")

app.state for trådsikker lagring

app.state er det anbefalte stedet for å lagre delte objekter som modellen. Objektet lagres én gang ved oppstart og leses bare under forespørsler, noe som unngår problemene med mutable globale variabler på modulnivå.

from fastapi import Request

@app.post("/predict")
def predict(req: PredictRequest, request: Request):
    model = request.app.state.model
    return {"prediction": model.predict([req.features])[0]}

Hvorfor ikke en global variabel?

En vanlig global variabel på modulnivå fungerer, men knytter lasting til importtidspunktet og er vanskeligere å teste eller bytte ut. app.state knytter objektets livssyklus til appen, noe som er ryddigere og den anbefalte FastAPI-mønsteret.

Den moderne lifespan-tilnærmingen

Nyere FastAPI erstatter on_event med en lifespan-kontekstbehandler som håndterer både oppstart og avslutning på ett sted.

from contextlib import asynccontextmanager

@asynccontextmanager
async def lifespan(app):
    app.state.model = joblib.load("model.joblib")  # startup
    yield
    app.state.model = None                          # shutdown

app = FastAPI(lifespan=lifespan)

Oppvarming av modellen

Den første prediksjonen er ofte treg fordi rammeverk initialiseres lat ved det første kallet. Varm opp modellen ved oppstart med en dummy-prediksjon, slik at den første virkelige brukerforespørselen allerede går raskt.

@app.on_event("startup")
def load_and_warm():
    app.state.model = joblib.load("model.joblib")
    app.state.model.predict([[0.0, 0.0, 0.0, 0.0]])  # warm-up

Hvorfor oppvarming er viktig

Uten oppvarming kan den første forespørselen etter en distribusjon ta mange ganger lengre tid, noe som svekker tail-latens og kan føre til at helsesjekker mislykkes. Én dummy-inferens ved oppstart tar denne kostnaden utenfor den kritiske banen.

Et endepunkt for batchprediksjon

Det er langt mer effektivt å predikere mange rader i ett kall enn å gjøre mange enkeltkall, siden modeller vektoriserer over en batch. Ta imot en liste med funksjonsvektorer og returner en liste med prediksjoner.

class BatchRequest(BaseModel):
    items: list[list[float]]

@app.post("/predict/batch")
def predict_batch(req: BatchRequest, request: Request):
    model = request.app.state.model
    preds = model.predict(req.items)
    return {"predictions": preds.tolist()}

Enkeltprediksjon kontra batchprediksjon

  • Enkelt: én inndata, lavest latenstid per kall og enkle klienter.
  • Batch: mange inndata samtidig, langt høyere gjennomstrømming og ideelt for offline-scoring.

Ved å tilby begge deler dekkes både sanntids- og massebehandlingsbehov.

Lese fra state i endepunkter

Alle endepunkter leser den delte modellen via request.app.state.model uten å laste den på nytt, slik at alle forespørsler deler én instans i minnet.

Sette det sammen

Et oppsett klart for produksjon: last og varm opp modellen i lifespan/startup, lagre den i app.state, og eksponer både enkelt- og batch-endepunkter som leser fra state. Dette minimerer latenstiden og maksimerer gjennomstrømmingen.

Hurtigsjekk

Test kunnskapene om modelllevering.

Oppsummering

Modellen ble lastet én gang via startup/lifespan, lagret i app.state for trådsikker gjenbruk, og en oppvarmings-prediksjon med dummy-inndata ble lagt til. Et batch-endepunkt ble eksponert for høyere gjennomstrømming. Neste tema er å dockerisere API-et.

Gratis å komme i gang

Lær deg Python med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
53
Leksjoner
225

Ofte stilte spørsmål

Er leksjonen «Innlasting og tilgjengeliggjøring av ML-modeller» gratis?

Ja – du kan lese valgfritt 3 av leksjonene i læringsstien Lær AI med Python, inkludert «Innlasting og tilgjengeliggjøring av ML-modeller», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i Lær AI med Python inneholder totalt 4 leksjoner.

Hva lærer jeg i «Innlasting og tilgjengeliggjøring av ML-modeller»?

Innlasting av joblib-/keras-modell ved oppstart, trådsikker inferens og endepunkter for prediksjon i batcher. Du øver på Lær AI med Python med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med Lær AI med Python?

Ingen tidligere erfaring er nødvendig. Lær AI med Python på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 3 av 4.

Hvor lang tid tar leksjonen «Innlasting og tilgjengeliggjøring av ML-modeller»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne Lær AI med Python-leksjonen?

Ja. Alle Lær AI med Python-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Grunnleggende FastAPI for ML-utviklere
  2. Pydantic-skjemaer for forespørsler og svar
  3. Innlasting og tilgjengeliggjøring av ML-modeller
  4. Konteinerisering av modell-API-et
← Tilbake til Lær AI med Python