Strings, Zeichen und Codierungen
Wie Text als Bytes und Unicode gespeichert wird
Strings, Zeichen und Codierungen ist eine kostenlose NLP Academy-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des NLP Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Text Is Made of Characters
Jedes Textstück, das Sie verarbeiten, ist eine Zeichenkette (ein String): eine geordnete Folge von Zeichen wie Buchstaben, Ziffern, Leerzeichen und Symbolen. 🔤
Strings in Python
In Python ist ein String in Anführungszeichen eingeschlossen. Sie können einen ganzen Satz in einer einzigen Variable speichern und als einen Wert damit arbeiten.
text = "NLP turns text into insight"
print(type(text)) # <class 'str'>Each Character Has a Position
Eine Zeichenkette ist indiziert, sodass jedes Zeichen an einer nummerierten Position sitzt, die bei Null beginnt. Das ermöglicht es Ihnen, jeden einzelnen Buchstaben zu erreichen.
word = "data"
print(word[0]) # d
print(word[3]) # aComputers Store Numbers
Ein Computer kann den Buchstaben A nicht direkt speichern. Er speichert eine Zahl, und eine Codierung ist die vereinbarte Zuordnung zwischen Zeichen und diesen Zahlen.
ASCII Came First
ASCII ordnete 128 einfache englische Zeichen Zahlen zu. Es funktionierte für einfaches Englisch, hatte aber keinen Platz für Akzente oder andere Alphabete.
Unicode Covers Everything
Unicode weist jedem Zeichen einen eindeutigen Codepunkt zu, von englischen Buchstaben bis hin zu chinesischer Schrift und Emojis. Moderne Python-Strings sind Unicode.
Code Points in Python
Die ord-Funktion zeigt die Unicode-Nummer eines Zeichens an, und chr wandelt eine Nummer wieder in ihr Zeichen um.
print(ord('A')) # 65
print(chr(233)) # éEncoding Turns Text Into Bytes
Um Text zu speichern oder zu senden, wandelt Python ihn mithilfe eines Schemas wie UTF-8 in Bytes um. Bytes sind das, was Dateien und Netzwerke tatsächlich übertragen.
data = "café".encode("utf-8")
print(data) # b'caf\xc3\xa9'UTF-8 Is the Default Choice
UTF-8 speichert häufig vorkommende Zeichen in einem Byte und seltenere in mehreren. Es ist kompakt, universell und der Standard für fast den gesamten heutigen Text.
Decoding Bytes Back to Text
Das Lesen von Rohbytes bedeutet, sie mit demselben Schema zu dekodieren, das für die Kodierung verwendet wurde. Das falsche Schema erzeugt unverständliche oder kaputte Zeichen.
raw = b'caf\xc3\xa9'
print(raw.decode("utf-8")) # caféEncoding Mistakes Cause Mojibake
Das Dekodieren mit der falschen Kodierung führt zu Mojibake, diesem Wirrwarr aus seltsamen Symbolen. Kennen und passen Sie Ihre Kodierung immer an, um dies zu vermeiden.
Quick Check
Schauen wir uns den Unterschied zwischen zwei wichtigen Textstandards an.
Recap: Text as Encoded Strings
Du hast gesehen, dass Text eine Zeichenkette (String) aus Zeichen ist, die durch Unicode auf Zahlen abgebildet und als UTF-8-Bytes gespeichert werden. Stimmen die Codierungen überein, bleibt dein Text sauber. ✅
Häufig gestellte Fragen
Ist die Lektion „Strings, Zeichen und Codierungen“ kostenlos?
Ja — der vollständige Text von „Strings, Zeichen und Codierungen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des NLP Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Strings, Zeichen und Codierungen“?
Wie Text als Bytes und Unicode gespeichert wird Du übst NLP Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um NLP Academy zu starten?
Keine Vorkenntnisse erforderlich. NLP Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „Strings, Zeichen und Codierungen“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser NLP Academy-Lektion Code schreiben und ausführen?
Ja. Jede NLP Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Strings, Zeichen und Codierungen
- Textdateien in Python einlesen
- Wörter und Zeichen zählen
- Ihre erste Worthäufigkeitstabelle erstellen