Lær AI med Python · Lektion

Matrixfaktorisering med SVD

Bruger-item-matrix, SVD-dekomponering, latente faktorer, implementering med Surprise-biblioteket.

Lektion 2 af 413 trin

Matrixfaktorisering med SVD er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvorfor matrixfaktorisering

Bruger-element-matricen er enorm og for det meste tom. Matrixfaktorisering komprimerer den til to mindre matricer med latente faktorer, én for brugere og én for elementer. Deres produkt genskaber og udfylder bedømmelserne. Det håndterer sparsomme data langt bedre end nabobaserede metoder.

Intuitionen bag latente faktorer

Hver bruger og hvert element beskrives med en kort vektor af skjulte egenskaber, for eksempel hvor actionpræget eller komediepræget en film er. En forudsagt bedømmelse er skalarproduktet af en brugervektor og en elementvektor, som læres udelukkende ud fra dataene.

SVD i anbefalinger

Modeller af SVD-typen lærer disse faktorer ved at minimere forudsigelsesfejlen for kendte bedømmelser samt anvende regularisering. Biblioteket surprise indeholder en klar-til-brug-SVD, der er optimeret til anbefalinger og blev kendt gennem Netflix Prize.

Surprise-biblioteket

Importér de dele, du har brug for: algoritmen, datasættets omslag og læseren, der beskriver formatet på dine data.

from surprise import SVD, Dataset, Reader
from surprise.model_selection import cross_validate

Reader og rating_scale

Reader fortæller Surprise det gyldige interval for bedømmelser via rating_scale. Tilpas det til dine data, for eksempel 1 til 5 stjerner, ellers bliver forudsigelserne forkert kalibreret.

reader = Reader(rating_scale=(1, 5))

Indlæsning af en DataFrame

Indlæs en DataFrame med præcis tre kolonner i denne rækkefølge: bruger, element, bedømmelse.

data = Dataset.load_from_df(
    df[["user_id", "item_id", "rating"]],
    reader
)

Krydsvalidering

cross_validate evaluerer modellen over flere delmængder og rapporterer fejltal, så du kan vurdere nøjagtigheden ærligt på tilbageholdte data.

results = cross_validate(
    SVD(), data,
    measures=["RMSE", "MAE"],
    cv=5,
    verbose=True
)

RMSE og MAE

  • RMSE (kvadratroden af den gennemsnitlige kvadratiske fejl) straffer store fejl kraftigt.
  • MAE (gennemsnitlig absolut fejl) er den gennemsnitlige absolutte afvigelse og er lettere at fortolke.

Lavere er bedre for begge mål; RMSE er det standardiserede hovedmål for forudsigelse af bedømmelser.

Træning på hele datasættet

Efter valideringen skal du træne på hele datasættet, før du leverer forudsigelser.

trainset = data.build_full_trainset()
algo = SVD()
algo.fit(trainset)

Oprettelse af forudsigelser

algo.predict(uid, iid) returnerer et forudsigelsesobjekt, hvis felt .est indeholder den estimerede bedømmelse for det pågældende bruger-element-par.

pred = algo.predict(uid="user_42", iid="item_99")
print(pred.est)  # estimated rating

Justering af hyperparametre

De vigtigste SVD-parametre er n_factors (latent dimension), n_epochs, lr_all (indlæringsrate) og reg_all (regularisering). Brug GridSearchCV til at finde den bedste kombination målt på RMSE.

from surprise.model_selection import GridSearchCV

grid = {"n_factors": [50, 100], "reg_all": [0.02, 0.1]}
gs = GridSearchCV(SVD, grid, measures=["rmse"], cv=3)
gs.fit(data)
print(gs.best_params["rmse"])

Hurtig kontrol

Test din viden om matrixfaktorisering.

Opsummering

Du lærte matrixfaktorisering via SVD: latente vektorer for brugere og elementer, hvis skalarprodukt forudsiger bedømmelser. Med surprise angav du rating_scale, indlæste data, kørte cross_validate med RMSE/MAE, tilpassede modellen og kaldte algo.predict(uid, iid). Næste emne: indholdsbaseret filtrering.

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
225

Ofte stillede spørgsmål

Er lektionen “Matrixfaktorisering med SVD” gratis?

Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Matrixfaktorisering med SVD”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Matrixfaktorisering med SVD”?

Bruger-item-matrix, SVD-dekomponering, latente faktorer, implementering med Surprise-biblioteket. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Lær AI med Python?

Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.

Hvor lang tid tager lektionen “Matrixfaktorisering med SVD”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?

Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Collaborative filtering: brugerbaseret og item-baseret
  2. Matrixfaktorisering med SVD
  3. Indholdsbaseret filtrering
  4. Hybridsystemer og evalueringsmetrikker
← Tilbage til Lær AI med Python