Innlasting og tilgjengeliggjøring av ML-modeller
Innlasting av joblib-/keras-modell ved oppstart, trådsikker inferens og endepunkter for prediksjon i batcher.
Innlasting og tilgjengeliggjøring av ML-modeller er en gratis leksjon i Lær AI med Python på CoddyKit. Dette er leksjon 3 av 4. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Lær AI med Python, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Lær AI med Python inneholder totalt 4 leksjoner.
Lastingsproblemet
Det tar tid å laste en modell fra disk. Hvis den lastes på nytt for hver forespørsel, øker latenstiden kraftig. Løsningen er å laste modellen én gang ved oppstart og gjenbruke den for alle forespørsler.
startup-hendelsen
Kroken @app.on_event("startup") kjøres én gang når serveren starter, og er derfor det perfekte stedet å laste modellen før den første forespørselen kommer.
from fastapi import FastAPI
import joblib
app = FastAPI()
@app.on_event("startup")
def load_model():
app.state.model = joblib.load("model.joblib")app.state for trådsikker lagring
app.state er det anbefalte stedet for å lagre delte objekter som modellen. Objektet lagres én gang ved oppstart og leses bare under forespørsler, noe som unngår problemene med mutable globale variabler på modulnivå.
from fastapi import Request
@app.post("/predict")
def predict(req: PredictRequest, request: Request):
model = request.app.state.model
return {"prediction": model.predict([req.features])[0]}Hvorfor ikke en global variabel?
En vanlig global variabel på modulnivå fungerer, men knytter lasting til importtidspunktet og er vanskeligere å teste eller bytte ut. app.state knytter objektets livssyklus til appen, noe som er ryddigere og den anbefalte FastAPI-mønsteret.
Den moderne lifespan-tilnærmingen
Nyere FastAPI erstatter on_event med en lifespan-kontekstbehandler som håndterer både oppstart og avslutning på ett sted.
from contextlib import asynccontextmanager
@asynccontextmanager
async def lifespan(app):
app.state.model = joblib.load("model.joblib") # startup
yield
app.state.model = None # shutdown
app = FastAPI(lifespan=lifespan)Oppvarming av modellen
Den første prediksjonen er ofte treg fordi rammeverk initialiseres lat ved det første kallet. Varm opp modellen ved oppstart med en dummy-prediksjon, slik at den første virkelige brukerforespørselen allerede går raskt.
@app.on_event("startup")
def load_and_warm():
app.state.model = joblib.load("model.joblib")
app.state.model.predict([[0.0, 0.0, 0.0, 0.0]]) # warm-upHvorfor oppvarming er viktig
Uten oppvarming kan den første forespørselen etter en distribusjon ta mange ganger lengre tid, noe som svekker tail-latens og kan føre til at helsesjekker mislykkes. Én dummy-inferens ved oppstart tar denne kostnaden utenfor den kritiske banen.
Et endepunkt for batchprediksjon
Det er langt mer effektivt å predikere mange rader i ett kall enn å gjøre mange enkeltkall, siden modeller vektoriserer over en batch. Ta imot en liste med funksjonsvektorer og returner en liste med prediksjoner.
class BatchRequest(BaseModel):
items: list[list[float]]
@app.post("/predict/batch")
def predict_batch(req: BatchRequest, request: Request):
model = request.app.state.model
preds = model.predict(req.items)
return {"predictions": preds.tolist()}Enkeltprediksjon kontra batchprediksjon
- Enkelt: én inndata, lavest latenstid per kall og enkle klienter.
- Batch: mange inndata samtidig, langt høyere gjennomstrømming og ideelt for offline-scoring.
Ved å tilby begge deler dekkes både sanntids- og massebehandlingsbehov.
Lese fra state i endepunkter
Alle endepunkter leser den delte modellen via request.app.state.model uten å laste den på nytt, slik at alle forespørsler deler én instans i minnet.
Sette det sammen
Et oppsett klart for produksjon: last og varm opp modellen i lifespan/startup, lagre den i app.state, og eksponer både enkelt- og batch-endepunkter som leser fra state. Dette minimerer latenstiden og maksimerer gjennomstrømmingen.
Hurtigsjekk
Test kunnskapene om modelllevering.
Oppsummering
Modellen ble lastet én gang via startup/lifespan, lagret i app.state for trådsikker gjenbruk, og en oppvarmings-prediksjon med dummy-inndata ble lagt til. Et batch-endepunkt ble eksponert for høyere gjennomstrømming. Neste tema er å dockerisere API-et.
Lær deg Python med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 53
- Leksjoner
- 225
Ofte stilte spørsmål
Er leksjonen «Innlasting og tilgjengeliggjøring av ML-modeller» gratis?
Ja – du kan lese valgfritt 3 av leksjonene i læringsstien Lær AI med Python, inkludert «Innlasting og tilgjengeliggjøring av ML-modeller», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i Lær AI med Python inneholder totalt 4 leksjoner.
Hva lærer jeg i «Innlasting og tilgjengeliggjøring av ML-modeller»?
Innlasting av joblib-/keras-modell ved oppstart, trådsikker inferens og endepunkter for prediksjon i batcher. Du øver på Lær AI med Python med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med Lær AI med Python?
Ingen tidligere erfaring er nødvendig. Lær AI med Python på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 3 av 4.
Hvor lang tid tar leksjonen «Innlasting og tilgjengeliggjøring av ML-modeller»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne Lær AI med Python-leksjonen?
Ja. Alle Lær AI med Python-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- Grunnleggende FastAPI for ML-utviklere
- Pydantic-skjemaer for forespørsler og svar
- Innlasting og tilgjengeliggjøring av ML-modeller
- Konteinerisering av modell-API-et