Unicode e utf8
Gestire testo multibyte
Unicode e utf8 è una lezione Go Academy gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Go Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Go Academy include 4 lezioni in totale.
Perché Unicode è importante
Il testo moderno contiene accenti, emoji e alfabeti non latini. Unicode assegna a ogni carattere un numero chiamato punto di codice.
Go memorizza le stringhe come UTF-8, una codifica a larghezza variabile di questi punti di codice.
package main
import "fmt"
func main() {
s := "héllo 世界"
fmt.Println(s)
}Il numero di byte per carattere varia
In UTF-8, un carattere occupa da 1 a 4 byte:
- Lettere ASCII: 1 byte.
- Caratteri latini accentati: generalmente 2 byte.
- Caratteri CJK: generalmente 3 byte.
package main
import "fmt"
func main() {
fmt.Println(len("a"))
fmt.Println(len("é"))
fmt.Println(len("世"))
}Il pacchetto unicode/utf8
Il pacchetto unicode/utf8 gestisce la codifica. utf8.RuneCountInString(s) conta correttamente i caratteri, a differenza di len.
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
s := "héllo"
fmt.Println(len(s))
fmt.Println(utf8.RuneCountInString(s))
}Convalidare UTF-8
Utilizzi utf8.ValidString(s) per verificare che una stringa contenga UTF-8 ben formato prima di elaborarla.
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
fmt.Println(utf8.ValidString("héllo"))
fmt.Println(utf8.ValidString(string([]byte{0xff, 0xfe})))
}Decodificare una rune
utf8.DecodeRuneInString(s) restituisce la prima rune e il numero di byte consumati. In questo modo è possibile attraversare manualmente una stringa.
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
r, size := utf8.DecodeRuneInString("世界")
fmt.Println(string(r), size)
}Range esegue la decodifica automaticamente
Un ciclo for range esegue già la decodifica UTF-8. L'indice aumenta di un numero di byte pari alla dimensione della rune a ogni iterazione.
package main
import "fmt"
func main() {
for i, r := range "a世b" {
fmt.Println(i, string(r))
}
}Il pacchetto unicode
Il pacchetto unicode classifica le singole rune. Funzioni come unicode.IsLetter e unicode.IsDigit rispondono a domande su un carattere.
package main
import (
"fmt"
"unicode"
)
func main() {
fmt.Println(unicode.IsLetter('A'))
fmt.Println(unicode.IsDigit('7'))
fmt.Println(unicode.IsSpace(' '))
}Cambiare maiuscole e minuscole per rune
unicode.ToUpper e unicode.ToLower operano su singole rune, incluse molte lettere non ASCII.
package main
import (
"fmt"
"unicode"
)
func main() {
fmt.Println(string(unicode.ToUpper('a')))
fmt.Println(string(unicode.ToLower('Z')))
}Contare le lettere in modo sicuro
Combini i pacchetti per contare solo le lettere in un testo misto, gestendo correttamente ogni rune.
package main
import (
"fmt"
"unicode"
)
func main() {
count := 0
for _, r := range "a1 b2 世!" {
if unicode.IsLetter(r) {
count++
}
}
fmt.Println(count)
}Invertire per rune
Per invertire il testo in modo sicuro è necessario invertire le rune, non i byte, altrimenti i caratteri multibyte si separano.
package main
import "fmt"
func main() {
runes := []rune("a世b")
for i, j := 0, len(runes)-1; i < j; i, j = i+1, j-1 {
runes[i], runes[j] = runes[j], runes[i]
}
fmt.Println(string(runes))
}Mettere tutto insieme
Un rapido strumento di riepilogo: riportare la lunghezza in byte, il numero di rune e indicare se il testo è UTF-8 valido.
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
s := "Go 世界!"
fmt.Println("bytes:", len(s))
fmt.Println("runes:", utf8.RuneCountInString(s))
fmt.Println("valid:", utf8.ValidString(s))
}Verifica rapida
Scelga il modo corretto per contare i caratteri.
Riepilogo: Unicode e utf8
Ora è in grado di gestire con sicurezza il testo multibyte:
- Le stringhe Go sono UTF-8; i caratteri occupano da 1 a 4 byte.
unicode/utf8conta, convalida e decodifica le rune.unicodeclassifica e modifica le maiuscole e minuscole delle singole rune.
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
s := "café 語"
fmt.Println(utf8.RuneCountInString(s), "runes")
}Impara Go con un tutor IA — gratis
Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.
- Corsi
- 51
- Lezioni
- 203
Domande Frequenti
La lezione «Unicode e utf8» è gratuita?
Sì — il testo completo di «Unicode e utf8» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Go Academy, passa a CoddyKit PRO. Il corso Go Academy include 4 lezioni in totale.
Cosa imparerò in «Unicode e utf8»?
Gestire testo multibyte Eserciti Go Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare Go Academy?
Non è richiesta alcuna esperienza precedente. Go Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.
Quanto tempo richiede la lezione «Unicode e utf8»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione Go Academy?
Sì. Ogni lezione Go Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Rune e byte
- Funzioni del package strings
- strings.Builder
- Unicode e utf8