Lær AI med Python · Lektion

Indholdsbaseret filtrering

TF-IDF-repræsentationer af items, cosinuslighed, bygning af en filmanbefaler ud fra metadata.

Lektion 3 af 413 trin

Indholdsbaseret filtrering er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 3 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvad er indholdsbaseret filtrering

Indholdsbaseret filtrering anbefaler elementer, der minder om dem, en bruger allerede har kunnet lide, baseret på elementernes egne egenskaber (tekst, genre, mærker). I modsætning til kollaborativ filtrering kræver metoden ingen data om andre brugere og undgår derfor problemet med koldstart for elementer.

Elementer som egenskabsvektorer

Grundideen er at omdanne hvert element til en numerisk vektor, der beskriver dets indhold, og derefter måle ligheden mellem vektorerne. For tekstbeskrivelser er TF-IDF den klassiske metode til at opbygge disse vektorer.

Hvad er TF-IDF

TF-IDF (termfrekvens – invers dokumentfrekvens) vægter ord efter, hvor ofte de forekommer i et element, men nedvægter ord, der er almindelige på tværs af alle elementer. Sjældne og særprægede ord får høje vægte, hvilket indfanger det, der gør et element unikt.

TfidfVectorizer

scikit-learn omdanner en liste med elementbeskrivelser til en TF-IDF-matrix på to linjer.

from sklearn.feature_extraction.text import TfidfVectorizer

vectorizer = TfidfVectorizer(stop_words="english")
tfidf_matrix = vectorizer.fit_transform(df["description"])

Forstå matrixens dimensioner

tfidf_matrix har formen (n_items, n_terms): én række pr. element og én kolonne pr. unikt ord i ordforrådet. Den er sparsom, fordi de fleste elementer kun bruger en brøkdel af alle ord.

print(tfidf_matrix.shape)  # (n_items, vocabulary_size)

Justering af vektoriseringen

Nyttige parametre er: stop_words fjerner almindelige ord, max_features begrænser størrelsen på ordforrådet, og ngram_range=(1,2) medtager fraser på to ord for at give mere detaljerede egenskaber.

vectorizer = TfidfVectorizer(
    stop_words="english",
    max_features=5000,
    ngram_range=(1, 2)
)

Cosinuslighed mellem elementer

Beregn ligheden parvist på tværs af alle elementer. Resultatet er en matrix på n_items x n_items, hvor hver celle angiver, hvor ens beskrivelserne af to elementer er.

from sklearn.metrics.pairwise import cosine_similarity

cosine_sim = cosine_similarity(tfidf_matrix)
print(cosine_sim.shape)  # (n_items, n_items)

Genvej med lineær kerne

Da TF-IDF-vektorer som standard er L2-normaliserede, giver linear_kernel samme resultat som cosinuslighed, men hurtigere. Det er en almindelig optimering til store kataloger.

from sklearn.metrics.pairwise import linear_kernel

cosine_sim = linear_kernel(tfidf_matrix, tfidf_matrix)

Kobling af titler til indeks

Hvis du vil slå et element op ved navn, skal du opbygge et omvendt indeks fra titel til rækkeplacering.

indices = pd.Series(df.index, index=df["title"]).drop_duplicates()

Funktionen get_recommendations

Med en titel som udgangspunkt henter funktionen rækken med ligheder, sorterer faldende, springer selve elementet over og returnerer de bedste match.

def get_recommendations(title, n=10):
    idx = indices[title]
    scores = list(enumerate(cosine_sim[idx]))
    scores = sorted(scores, key=lambda x: x[1], reverse=True)
    top = scores[1:n+1]          # skip itself at position 0
    item_idxs = [i for i, _ in top]
    return df["title"].iloc[item_idxs]

Styrker og begrænsninger

Styrker: fungerer for helt nye elementer, og anbefalingerne kan forklares ("fordi det deler disse ord").

Begrænsninger: metoden holder sig inden for brugerens kendte præferencer (overspecialisering) og kan ikke finde overraskende fund på tværs af genrer, sådan som kollaborativ filtrering kan.

Hurtig kontrol

Test din viden om indholdsbaseret filtrering.

Opsummering

Du opbyggede indholdsbaseret filtrering: TfidfVectorizer omdanner beskrivelser til en matrix med formen (n_items, n_terms), cosine_similarity sammenligner elementer, og get_recommendations returnerer de mest lignende elementer, mens selve elementet springes over. Metoden håndterer koldstart, men risikerer overspecialisering. Næste emne: hybridsystemer og evalueringsmål.

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
225

Ofte stillede spørgsmål

Er lektionen “Indholdsbaseret filtrering” gratis?

Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Indholdsbaseret filtrering”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Indholdsbaseret filtrering”?

TF-IDF-repræsentationer af items, cosinuslighed, bygning af en filmanbefaler ud fra metadata. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Lær AI med Python?

Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 3 af 4.

Hvor lang tid tager lektionen “Indholdsbaseret filtrering”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?

Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Collaborative filtering: brugerbaseret og item-baseret
  2. Matrixfaktorisering med SVD
  3. Indholdsbaseret filtrering
  4. Hybridsystemer og evalueringsmetrikker
← Tilbage til Lær AI med Python