Ciągi, znaki i kodowania
Jak tekst jest przechowywany jako bajty i Unicode
Ciągi, znaki i kodowania to bezpłatna lekcja NLP Academy na CoddyKit. To lekcja 1 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej NLP Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs NLP Academy zawiera 4 lekcji w sumie.
Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.
Text Is Made of Characters
Every piece of text you process is a string: an ordered run of characters like letters, digits, spaces, and symbols. 🔤
Strings in Python
In Python a string is wrapped in quotes. You can store a whole sentence in a single variable and work with it as one value.
text = "NLP turns text into insight"
print(type(text)) # <class 'str'>Each Character Has a Position
A string is indexed, so each character sits at a numbered position starting from zero. That lets you reach any single letter.
word = "data"
print(word[0]) # d
print(word[3]) # aComputers Store Numbers
A computer cannot store the letter A directly. It stores a number, and an encoding is the agreed map between characters and those numbers.
ASCII Came First
ASCII mapped 128 basic English characters to numbers. It worked for plain English but had no room for accents or other alphabets.
Unicode Covers Everything
Unicode gives every character a unique code point, from English letters to Chinese script and emoji. Modern Python strings are Unicode.
Code Points in Python
The ord function shows a character's Unicode number, and chr turns a number back into its character.
print(ord('A')) # 65
print(chr(233)) # éEncoding Turns Text Into Bytes
To save or send text, Python turns it into bytes using a scheme like UTF-8. Bytes are what files and networks actually carry.
data = "café".encode("utf-8")
print(data) # b'caf\xc3\xa9'UTF-8 Is the Default Choice
UTF-8 stores common characters in one byte and rarer ones in more. It is compact, universal, and the standard for almost all text today.
Decoding Bytes Back to Text
Reading raw bytes means decoding them with the same scheme used to encode. The wrong scheme produces garbled or broken characters.
raw = b'caf\xc3\xa9'
print(raw.decode("utf-8")) # caféEncoding Mistakes Cause Mojibake
Decoding with the wrong encoding gives mojibake, that jumble of odd symbols. Always know and match your encoding to avoid it.
Quick Check
Let us check the difference between two key text standards.
Recap: Text as Encoded Strings
You saw that text is a string of characters, mapped to numbers by Unicode and stored as UTF-8 bytes. Match encodings and your text stays clean. ✅
Często zadawane pytania
Czy lekcja „Ciągi, znaki i kodowania” jest bezpłatna?
Tak — pełny tekst „Ciągi, znaki i kodowania” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu NLP Academy, przejdź na CoddyKit PRO. Kurs NLP Academy zawiera 4 lekcji w sumie.
Co nauczysz się w „Ciągi, znaki i kodowania”?
Jak tekst jest przechowywany jako bajty i Unicode Ćwiczysz NLP Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć NLP Academy?
Nie wymagamy żadnego doświadczenia. NLP Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 1 z 4.
Ile czasu zajmuje lekcja „Ciągi, znaki i kodowania”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji NLP Academy?
Tak. Każda lekcja NLP Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Ciągi, znaki i kodowania
- Wczytywanie plików tekstowych do Pythona
- Liczenie słów i znaków
- Tworzenie pierwszej tabeli częstości słów