0Pricing
Go Academy · Lektion

Unicode und utf8

Mehrbyte-Text verarbeiten

Unicode und utf8 ist eine kostenlose Go Academy-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Go Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Go Academy-Kurs umfasst insgesamt 4 Lektionen.

Warum Unicode wichtig ist

Moderner Text enthält Akzente, Emojis und nicht-lateinische Schriften. Unicode weist jedem Zeichen eine Zahl zu, die als Codepoint bezeichnet wird.

Go speichert Strings als UTF-8, einer variablen Kodierung dieser Codepoints.

package main

import "fmt"

func main() {
    s := "héllo 世界"
    fmt.Println(s)
}

Bytes pro Zeichen variieren

In UTF-8 verwendet ein Zeichen 1 bis 4 Bytes:

  • ASCII-Buchstaben: 1 Byte.
  • Lateinische Buchstaben mit Akzent: normalerweise 2 Bytes.
  • CJK-Zeichen: normalerweise 3 Bytes.
package main

import "fmt"

func main() {
    fmt.Println(len("a"))
    fmt.Println(len("é"))
    fmt.Println(len("世"))
}

Das Paket unicode/utf8

Das Paket unicode/utf8 versteht die Kodierung. utf8.RuneCountInString(s) zählt Zeichen korrekt – anders als len.

package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    s := "héllo"
    fmt.Println(len(s))
    fmt.Println(utf8.RuneCountInString(s))
}

UTF-8 validieren

Verwenden Sie utf8.ValidString(s), um zu bestätigen, dass eine Zeichenkette gültiges UTF-8 enthält, bevor Sie sie verarbeiten.

package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    fmt.Println(utf8.ValidString("héllo"))
    fmt.Println(utf8.ValidString(string([]byte{0xff, 0xfe})))
}

Eine Rune dekodieren

utf8.DecodeRuneInString(s) gibt die erste Rune und die Anzahl der von ihr verbrauchten Bytes zurück. So können Sie eine Zeichenkette manuell durchlaufen.

package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    r, size := utf8.DecodeRuneInString("世界")
    fmt.Println(string(r), size)
}

Range übernimmt die Dekodierung

Eine for range-Schleife übernimmt die UTF-8-Dekodierung bereits für Sie. Der Index springt bei jedem Schritt um die Byte-Größe der Rune weiter.

package main

import "fmt"

func main() {
    for i, r := range "a世b" {
        fmt.Println(i, string(r))
    }
}

Das Paket unicode

Das Paket unicode klassifiziert einzelne Runen. Funktionen wie unicode.IsLetter und unicode.IsDigit beantworten Fragen zu einem Zeichen.

package main

import (
    "fmt"
    "unicode"
)

func main() {
    fmt.Println(unicode.IsLetter('A'))
    fmt.Println(unicode.IsDigit('7'))
    fmt.Println(unicode.IsSpace(' '))
}

Groß- und Kleinschreibung pro Rune ändern

unicode.ToUpper und unicode.ToLower arbeiten mit einzelnen Runen, einschließlich vieler Nicht-ASCII-Buchstaben.

package main

import (
    "fmt"
    "unicode"
)

func main() {
    fmt.Println(string(unicode.ToUpper('a')))
    fmt.Println(string(unicode.ToLower('Z')))
}

Buchstaben sicher zählen

Kombinieren Sie die Pakete, um in gemischtem Text nur Buchstaben zu zählen und dabei jede Rune korrekt zu behandeln.

package main

import (
    "fmt"
    "unicode"
)

func main() {
    count := 0
    for _, r := range "a1 b2 世!" {
        if unicode.IsLetter(r) {
            count++
        }
    }
    fmt.Println(count)
}

Nach Runen umkehren

Um Text sicher umzukehren, müssen Sie Runen statt Bytes umkehren, da sonst Mehrbytezeichen auseinandergerissen werden.

package main

import "fmt"

func main() {
    runes := []rune("a世b")
    for i, j := 0, len(runes)-1; i < j; i, j = i+1, j-1 {
        runes[i], runes[j] = runes[j], runes[i]
    }
    fmt.Println(string(runes))
}

Alles zusammenführen

Ein einfaches Zusammenfassungsprogramm: Geben Sie die Byte-Länge, die Anzahl der Runen und an, ob der Text gültiges UTF-8 ist.

package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    s := "Go 世界!"
    fmt.Println("bytes:", len(s))
    fmt.Println("runes:", utf8.RuneCountInString(s))
    fmt.Println("valid:", utf8.ValidString(s))
}

Schnelltest

Wählen Sie die richtige Methode zum Zählen von Zeichen.

Rückblick: Unicode und utf8

Sie können nun sicher mit Multibyte-Text umgehen:

  • Go-Zeichenketten sind UTF-8-kodiert; Zeichen benötigen 1 bis 4 Bytes.
  • unicode/utf8 zählt, validiert und dekodiert Runen.
  • unicode klassifiziert einzelne Runen und ändert ihre Groß- und Kleinschreibung.
package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    s := "café 語"
    fmt.Println(utf8.RuneCountInString(s), "runes")
}

Häufig gestellte Fragen

Ist die Lektion „Unicode und utf8“ kostenlos?

Ja — der vollständige Text von „Unicode und utf8“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Go Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Go Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Unicode und utf8“?

Mehrbyte-Text verarbeiten Du übst Go Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Go Academy zu starten?

Keine Vorkenntnisse erforderlich. Go Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Unicode und utf8“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Go Academy-Lektion Code schreiben und ausführen?

Ja. Jede Go Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Runes vs. Bytes
  2. Funktionen des strings-Pakets
  3. strings.Builder
  4. Unicode und utf8
← Zurück zu Go Academy