NLP Academy · Les

Strings, tekens en encoderingen

Hoe tekst wordt opgeslagen als bytes en Unicode

Les 1 van 413 stappen

Strings, tekens en encoderingen is een gratis NLP Academy-les op CoddyKit. Dit is les 1 van 4. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject NLP Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus NLP Academy bevat in totaal 4 lessen.

Tekst bestaat uit tekens

Elk stukje tekst dat je verwerkt is een string: een geordende reeks tekens, zoals letters, cijfers, spaties en symbolen. 🔤

Strings in Python

In Python staat een string tussen aanhalingstekens. Je kunt een hele zin in één variabele opslaan en ermee werken als met één waarde.

text = "NLP turns text into insight"
print(type(text))  # <class 'str'>

Elk teken heeft een positie

Een string is geïndexeerd, dus elk teken staat op een genummerde positie die bij nul begint. Zo kun je elke afzonderlijke letter bereiken.

word = "data"
print(word[0])  # d
print(word[3])  # a

Computers slaan getallen op

Een computer kan de letter A niet rechtstreeks opslaan. Hij slaat een getal op, en een codering is de afgesproken koppeling tussen tekens en die getallen.

ASCII kwam eerst

ASCII koppelde 128 basistekens uit het Engels aan getallen. Dat werkte voor eenvoudig Engels, maar er was geen ruimte voor accenten of andere alfabetten.

Unicode omvat alles

Unicode geeft elk teken een uniek codepunt, van Engelse letters tot Chinese schriften en emoji. Moderne Python-strings zijn Unicode.

Codepunten in Python

De functie ord toont het Unicode-getal van een teken en chr zet een getal weer om in het bijbehorende teken.

print(ord('A'))   # 65
print(chr(233))   # é

Codering zet tekst om in bytes

Om tekst op te slaan of te verzenden, zet Python die om in bytes met een schema zoals UTF-8. Bytes zijn wat bestanden en netwerken daadwerkelijk vervoeren.

data = "café".encode("utf-8")
print(data)  # b'caf\xc3\xa9'

UTF-8 is de standaardkeuze

UTF-8 slaat veelvoorkomende tekens op in één byte en zeldzamere tekens in meerdere bytes. Het is compact, universeel en tegenwoordig de standaard voor vrijwel alle tekst.

Bytes weer decoderen naar tekst

Het lezen van onbewerkte bytes betekent dat je ze decodeert met hetzelfde schema als waarmee ze zijn gecodeerd. Het verkeerde schema levert vervormde of beschadigde tekens op.

raw = b'caf\xc3\xa9'
print(raw.decode("utf-8"))  # café

Coderingsfouten veroorzaken mojibake

Decoderen met de verkeerde codering levert mojibake op: die wirwar van vreemde symbolen. Zorg altijd dat je je codering kent en op de juiste manier toepast.

Korte controle

Laten we het verschil tussen twee belangrijke tekststandaarden controleren.

Samenvatting: tekst als gecodeerde strings

Je hebt gezien dat tekst een string met tekens is, die door Unicode aan getallen wordt gekoppeld en als UTF-8-bytes wordt opgeslagen. Stem coderingen op elkaar af, dan blijft je tekst netjes. ✅

Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
30
Lessen
120

Veelgestelde vragen

Is de les “Strings, tekens en encoderingen” gratis?

Ja — je kunt hier op het web alle 3 lessen van het leerpad NLP Academy, waaronder “Strings, tekens en encoderingen”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus NLP Academy bevat in totaal 4 lessen.

Wat leer ik in “Strings, tekens en encoderingen”?

Hoe tekst wordt opgeslagen als bytes en Unicode Je oefent met NLP Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met NLP Academy te beginnen?

Ervaring vooraf is niet nodig. NLP Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 1 van 4.

Hoe lang duurt de les “Strings, tekens en encoderingen”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over NLP Academy?

Ja. Elke les over NLP Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Strings, tekens en encoderingen
  2. Tekstbestanden in Python inlezen
  3. Woorden en tekens tellen
  4. Uw eerste woordfrequentietabel bouwen
← Terug naar NLP Academy