Unicode und utf8
Mehrbyte-Text verarbeiten
Unicode und utf8 ist eine kostenlose Go Academy-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Go Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Go Academy-Kurs umfasst insgesamt 4 Lektionen.
Warum Unicode wichtig ist
Moderner Text enthält Akzente, Emojis und nicht-lateinische Schriften. Unicode weist jedem Zeichen eine Zahl zu, die als Codepoint bezeichnet wird.
Go speichert Strings als UTF-8, einer variablen Kodierung dieser Codepoints.
package main
import "fmt"
func main() {
s := "héllo 世界"
fmt.Println(s)
}Bytes pro Zeichen variieren
In UTF-8 verwendet ein Zeichen 1 bis 4 Bytes:
- ASCII-Buchstaben: 1 Byte.
- Lateinische Buchstaben mit Akzent: normalerweise 2 Bytes.
- CJK-Zeichen: normalerweise 3 Bytes.
package main
import "fmt"
func main() {
fmt.Println(len("a"))
fmt.Println(len("é"))
fmt.Println(len("世"))
}Das Paket unicode/utf8
Das Paket unicode/utf8 versteht die Kodierung. utf8.RuneCountInString(s) zählt Zeichen korrekt – anders als len.
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
s := "héllo"
fmt.Println(len(s))
fmt.Println(utf8.RuneCountInString(s))
}UTF-8 validieren
Verwenden Sie utf8.ValidString(s), um zu bestätigen, dass eine Zeichenkette gültiges UTF-8 enthält, bevor Sie sie verarbeiten.
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
fmt.Println(utf8.ValidString("héllo"))
fmt.Println(utf8.ValidString(string([]byte{0xff, 0xfe})))
}Eine Rune dekodieren
utf8.DecodeRuneInString(s) gibt die erste Rune und die Anzahl der von ihr verbrauchten Bytes zurück. So können Sie eine Zeichenkette manuell durchlaufen.
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
r, size := utf8.DecodeRuneInString("世界")
fmt.Println(string(r), size)
}Range übernimmt die Dekodierung
Eine for range-Schleife übernimmt die UTF-8-Dekodierung bereits für Sie. Der Index springt bei jedem Schritt um die Byte-Größe der Rune weiter.
package main
import "fmt"
func main() {
for i, r := range "a世b" {
fmt.Println(i, string(r))
}
}Das Paket unicode
Das Paket unicode klassifiziert einzelne Runen. Funktionen wie unicode.IsLetter und unicode.IsDigit beantworten Fragen zu einem Zeichen.
package main
import (
"fmt"
"unicode"
)
func main() {
fmt.Println(unicode.IsLetter('A'))
fmt.Println(unicode.IsDigit('7'))
fmt.Println(unicode.IsSpace(' '))
}Groß- und Kleinschreibung pro Rune ändern
unicode.ToUpper und unicode.ToLower arbeiten mit einzelnen Runen, einschließlich vieler Nicht-ASCII-Buchstaben.
package main
import (
"fmt"
"unicode"
)
func main() {
fmt.Println(string(unicode.ToUpper('a')))
fmt.Println(string(unicode.ToLower('Z')))
}Buchstaben sicher zählen
Kombinieren Sie die Pakete, um in gemischtem Text nur Buchstaben zu zählen und dabei jede Rune korrekt zu behandeln.
package main
import (
"fmt"
"unicode"
)
func main() {
count := 0
for _, r := range "a1 b2 世!" {
if unicode.IsLetter(r) {
count++
}
}
fmt.Println(count)
}Nach Runen umkehren
Um Text sicher umzukehren, müssen Sie Runen statt Bytes umkehren, da sonst Mehrbytezeichen auseinandergerissen werden.
package main
import "fmt"
func main() {
runes := []rune("a世b")
for i, j := 0, len(runes)-1; i < j; i, j = i+1, j-1 {
runes[i], runes[j] = runes[j], runes[i]
}
fmt.Println(string(runes))
}Alles zusammenführen
Ein einfaches Zusammenfassungsprogramm: Geben Sie die Byte-Länge, die Anzahl der Runen und an, ob der Text gültiges UTF-8 ist.
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
s := "Go 世界!"
fmt.Println("bytes:", len(s))
fmt.Println("runes:", utf8.RuneCountInString(s))
fmt.Println("valid:", utf8.ValidString(s))
}Schnelltest
Wählen Sie die richtige Methode zum Zählen von Zeichen.
Rückblick: Unicode und utf8
Sie können nun sicher mit Multibyte-Text umgehen:
- Go-Zeichenketten sind UTF-8-kodiert; Zeichen benötigen 1 bis 4 Bytes.
unicode/utf8zählt, validiert und dekodiert Runen.unicodeklassifiziert einzelne Runen und ändert ihre Groß- und Kleinschreibung.
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
s := "café 語"
fmt.Println(utf8.RuneCountInString(s), "runes")
}Häufig gestellte Fragen
Ist die Lektion „Unicode und utf8“ kostenlos?
Ja — der vollständige Text von „Unicode und utf8“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Go Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Go Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Unicode und utf8“?
Mehrbyte-Text verarbeiten Du übst Go Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Go Academy zu starten?
Keine Vorkenntnisse erforderlich. Go Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.
Wie lange dauert die Lektion „Unicode und utf8“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Go Academy-Lektion Code schreiben und ausführen?
Ja. Jede Go Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Runes vs. Bytes
- Funktionen des strings-Pakets
- strings.Builder
- Unicode und utf8