Lær AI med Python · Lektion

Tekstklassifikation med BERT

HuggingFace transformers, AutoTokenizer, AutoModelForSequenceClassification, finetuning.

Lektion 3 af 413 trin

Tekstklassifikation med BERT er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 3 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Begrænsninger ved statiske indlejringer

Word2Vec og GloVe giver hvert ord én fast vektor. Men "bank" betyder forskellige ting i "flodbred" og "sparebank". Kontekstafhængige modeller som BERT løser dette.

Hvad er BERT

BERT er en transformer-model, der læser en hel sætning på én gang og producerer kontekstafhængige indlejringer. Den er fortrænet på enorme tekstmængder og kan finjusteres til opgaver som klassifikation.

Hugging Face-biblioteket transformers

Biblioteket transformers giver nem adgang til BERT og tusindvis af fortrænede modeller med ensartede klasser til tokenizere og modeller.

from transformers import AutoTokenizer, AutoModelForSequenceClassification

name = "distilbert-base-uncased-finetuned-sst-2-english"
tokenizer = AutoTokenizer.from_pretrained(name)
model = AutoModelForSequenceClassification.from_pretrained(name)

AutoTokenizer

AutoTokenizer indlæser den korrekte tokenizer til en model. Den opdeler tekst i undertokens og mapper dem til de id'er, modellen forventer.

from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("bert-base-uncased")
print(tokenizer.tokenize("unbelievable"))
# subwords like ["un", "##bel", "##ievable"]

AutoModelForSequenceClassification

AutoModelForSequenceClassification indlæser BERT med et klassifikationshoved ovenpå, som udsender én score pr. klasse for hele sekvensen.

from transformers import AutoModelForSequenceClassification

model = AutoModelForSequenceClassification.from_pretrained(
    "distilbert-base-uncased-finetuned-sst-2-english"
)

Tokenisering af inddata

Kør tokenizeren på din tekst med truncation, padding og return_tensors for at få tensorer, der er klar til modellen. Afkortning begrænser lange inddata, mens udfyldning tilpasser længderne i et parti.

inputs = tokenizer(
    "This movie was fantastic!",
    truncation=True,
    padding=True,
    return_tensors="pt",
)
print(inputs["input_ids"].shape)

De særlige tokens

BERT tilføjer automatisk særlige tokens: [CLS] i starten (den skjulte tilstand opsummerer sekvensen) og [SEP] mellem og efter sætninger. Klassifikatoren læser fra [CLS]-repræsentationen.

Kørsel af modellen

Send de tokeniserede inddata til modellen for at få logits, de rå, ikke-normaliserede klassescores.

import torch

with torch.no_grad():
    outputs = model(**inputs)
logits = outputs.logits
print(logits)

Fra logits til forudsigelser

Anvend softmax på logits for at få sandsynligheder, og brug derefter argmax til at finde indekset for den forudsagte klasse. Knyt dette indeks til en etiket.

import torch

probs = torch.softmax(logits, dim=-1)
pred = torch.argmax(probs, dim=-1).item()
print(model.config.id2label[pred])

Finjustering til din opgave

Med et tilpasset datasæt finjusterer du BERT ved at træne klassifikationshovedet (og eventuelt hele modellen) på dine mærkede eksempler. API'et Trainer håndterer træningsløkken.

from transformers import Trainer, TrainingArguments

args = TrainingArguments(output_dir="out", num_train_epochs=3)
trainer = Trainer(model=model, args=args, train_dataset=train_ds)
trainer.train()

Genvejen pipeline

Til hurtig inferens samler hjælperen pipeline tokenisering, kørsel og afkodning i ét kald, hvilket er ideelt til prototyper.

from transformers import pipeline

clf = pipeline("sentiment-analysis")
print(clf("I love this product!"))
# [{"label": "POSITIVE", "score": 0.99...}]

Hurtig test

Test din viden om BERT.

Opsummering

Opsummering: BERT producerer kontekstafhængige indlejringer via transformere. Brug AutoTokenizer til at tokenisere med truncation/padding/return_tensors, og brug AutoModelForSequenceClassification til at få logits. Konvertér logits med softmax og derefter argmax. Finjustér med Trainer, eller lav hurtigt en prototype med pipeline.

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
225

Ofte stillede spørgsmål

Er lektionen “Tekstklassifikation med BERT” gratis?

Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Tekstklassifikation med BERT”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Tekstklassifikation med BERT”?

HuggingFace transformers, AutoTokenizer, AutoModelForSequenceClassification, finetuning. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Lær AI med Python?

Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 3 af 4.

Hvor lang tid tager lektionen “Tekstklassifikation med BERT”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?

Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Word2Vec: Skip-gram og CBOW
  2. GloVe- og FastText-embeddings
  3. Tekstklassifikation med BERT
  4. Semantisk lighed og sentence embeddings
← Tilbage til Lær AI med Python