0Pricing
HTML Academy · Lekcja

charset i obsługa Unicode — znaki specjalne

Używanie UTF-8 i encji HTML do prawidłowego wyświetlania dowolnych znaków

charset i obsługa Unicode — znaki specjalne to bezpłatna lekcja HTML Academy na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej HTML Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs HTML Academy zawiera 4 lekcji w sumie.

Deklaracja charset

Każdy dokument HTML musi deklarować swoje kodowanie znaków. Standardem jest UTF-8: <meta charset="utf-8"> jako pierwszy element <head>. Bez tego przeglądarka zgaduje kodowanie, co często prowadzi do błędów w przypadku tekstu spoza ASCII.

<!doctype html>
<html lang="en">
<head>
  <meta charset="utf-8">
  <title>Page</title>

Dlaczego UTF-8?

UTF-8 koduje każdy znak Unicode: każdy skrypt, każde emoji i każdy symbol. Jest wstecznie zgodne z ASCII (a-z i 0-9 nadal zajmują jeden bajt) i stanowi dominujące kodowanie we współczesnym internecie — w 2024 roku ponad 98% stron używa UTF-8.

Położenie ma kluczowe znaczenie

Znacznik meta charset musi znajdować się w pierwszych 1024 bajtach dokumentu — zwykle w pierwszym wierszu <head>. Przeglądarka rozpoznaje kodowanie na podstawie tych bajtów; deklaracja charset umieszczona później może nie wpłynąć na wynik tego rozpoznawania.

Zapisywanie plików w UTF-8

Znacznik meta deklaruje kodowanie, ale edytor musi faktycznie zapisać plik w tym kodowaniu. VS Code, IntelliJ i Sublime w nowoczesnych wersjach domyślnie używają UTF-8. Pliki zapisane jako Windows-1252 lub ISO-8859-1 powodują powstanie mojibake (zniekształconych znaków) nawet przy prawidłowym znaczniku meta.

Encje HTML

Specjalne znaki HTML (<, >, &, ") trzeba zamieniać na encje, aby uniknąć nieprawidłowej interpretacji przez parser: &lt; dla <, &gt; dla >, &amp; dla & oraz &quot; dla ". W wartościach atrybutów zapisanych w cudzysłowie &quot; jest obowiązkowe, gdy wartość jest ujęta w podwójne cudzysłowy.

Numeryczne odwołania do znaków

Do dowolnego znaku Unicode można odwołać się za pomocą jego punktu kodowego: &#9731; lub &#x2603; oznacza bałwanka (☃). Należy używać tego zapisu, gdy bezpośrednie wpisanie znaku jest niepraktyczne (w przypadku rzadkich symboli lub znaków sterujących), ale jeśli edytor to obsługuje, lepiej użyć bezpośrednio znaku Unicode.

Emoji i pary zastępcze

Emoji to znaki Unicode o kodach powyżej U+FFFF, reprezentowane jako pary zastępcze w UTF-16 (kodowaniu używanym wewnątrz ciągów znaków JavaScript). UTF-8 koduje je za pomocą sekwencji 4-bajtowych. Po ustawieniu charset="utf-8" emoji są wyświetlane natywnie, bez encji.

Typowe błędy kodowania

Wyświetlenie tekstu "Don't" jako "Don’t" oznacza, że plik jest interpretowany jako Latin-1, mimo że zapisano go jako UTF-8. Należy zapisać plik jako UTF-8 i upewnić się, że obecny jest znacznik <meta charset="utf-8">. Współczesne przeglądarki domyślnie używają UTF-8 tylko wtedy, gdy brakuje znacznika meta, a plik wygląda na poprawnie zapisany w UTF-8.

Nagłówek HTTP Content-Type

Serwer może również zadeklarować kodowanie za pomocą nagłówka odpowiedzi: Content-Type: text/html; charset=utf-8. Nagłówek ma pierwszeństwo przed znacznikiem meta, dlatego nieprawidłowo skonfigurowane serwery mogą powodować błędy kodowania nawet w doskonale napisanym kodzie HTML.

Praca z formularzami

Formularze są domyślnie wysyłane z użyciem kodowania strony. Strony w UTF-8 wysyłają dane formularzy w UTF-8, a serwer powinien dekodować je jako UTF-8. Niezgodność między kodowaniem strony a dekodowaniem po stronie serwera jest częstą przyczyną zniekształcenia danych wprowadzanych przez użytkowników w wielojęzycznych witrynach.

Unikanie BOM

Pliki UTF-8 mogą zaczynać się od znacznika kolejności bajtów (BOM, 0xEF 0xBB 0xBF). Większość przeglądarek go toleruje, ale niektóre narzędzia i CDN-y już nie — ponadto w niektórych edytorach tekstu BOM pojawia się jako widoczny znak. Aby uniknąć niespodzianek, należy zapisywać pliki jako "UTF-8 bez BOM".

Sprawdzenie wiedzy

Dlaczego znacznik musi znajdować się w pierwszych 1024 bajtach dokumentu HTML?

Podsumowanie

Należy umieścić <meta charset="utf-8"> jako pierwsze dziecko <head> i zapisywać pliki w UTF-8. UTF-8 koduje każdy znak Unicode, w tym emoji i wszystkie skrypty. Znaki <, >, & i " należy zapisywać jako encje; w przypadku rzadkich znaków można użyć odwołań numerycznych. Należy pamiętać, że nagłówek HTTP Content-Type może nadpisać znacznik meta, a w niektórych narzędziach BOM może pojawić się jako widoczny znak.

Często zadawane pytania

Czy lekcja „charset i obsługa Unicode — znaki specjalne” jest bezpłatna?

Tak — pełny tekst „charset i obsługa Unicode — znaki specjalne” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu HTML Academy, przejdź na CoddyKit PRO. Kurs HTML Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „charset i obsługa Unicode — znaki specjalne”?

Używanie UTF-8 i encji HTML do prawidłowego wyświetlania dowolnych znaków Ćwiczysz HTML Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć HTML Academy?

Nie wymagamy żadnego doświadczenia. HTML Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.

Ile czasu zajmuje lekcja „charset i obsługa Unicode — znaki specjalne”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji HTML Academy?

Tak. Każda lekcja HTML Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Atrybut lang i czytniki ekranu
  2. dir=rtl dla tekstu pisanego od prawej do lewej
  3. Elementy bdi i bdo
  4. charset i obsługa Unicode — znaki specjalne
← Powrót do HTML Academy