Unicode 与 utf8
处理多字节文本
Unicode 与 utf8 是 CoddyKit 上的免费 Go Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Go Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Go Academy 课程共包含 4 节课。
为什么 Unicode 很重要
现代文本包含重音符号、表情符号和非拉丁文字。Unicode 为每个字符分配一个称为码点的数字。
Go 使用 UTF-8 存储字符串;UTF-8 是一种对这些码点进行变长编码的方式。
package main
import "fmt"
func main() {
s := "héllo 世界"
fmt.Println(s)
}每个字符的字节数各不相同
在 UTF-8 中,一个字符占用 1 到 4 个字节:
- ASCII 字母:1 个字节。
- 带重音符号的拉丁字符:通常占用 2 个字节。
- CJK 字符:通常占用 3 个字节。
package main
import "fmt"
func main() {
fmt.Println(len("a"))
fmt.Println(len("é"))
fmt.Println(len("世"))
}unicode/utf8 包
unicode/utf8 包可以理解这种编码。utf8.RuneCountInString(s) 可以正确统计字符数,不同于 len。
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
s := "héllo"
fmt.Println(len(s))
fmt.Println(utf8.RuneCountInString(s))
}验证 UTF-8
在处理字符串之前,请使用 utf8.ValidString(s) 确认其中保存的是格式正确的 UTF-8。
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
fmt.Println(utf8.ValidString("héllo"))
fmt.Println(utf8.ValidString(string([]byte{0xff, 0xfe})))
}解码一个符文
utf8.DecodeRuneInString(s) 会返回第一个符文,以及它消耗的字节数。这样您就可以手动遍历字符串。
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
r, size := utf8.DecodeRuneInString("世界")
fmt.Println(string(r), size)
}range 会为您完成解码
for range 循环已经会完成 UTF-8 解码。索引在每一步都会按照符文的字节大小向前跳过相应位置。
package main
import "fmt"
func main() {
for i, r := range "a世b" {
fmt.Println(i, string(r))
}
}unicode 包
unicode 包可以对单个符文进行分类。unicode.IsLetter 和 unicode.IsDigit 等函数可以回答有关字符的问题。
package main
import (
"fmt"
"unicode"
)
func main() {
fmt.Println(unicode.IsLetter('A'))
fmt.Println(unicode.IsDigit('7'))
fmt.Println(unicode.IsSpace(' '))
}按符文更改大小写
unicode.ToUpper 和 unicode.ToLower 作用于单个符文,包括许多非 ASCII 字母。
package main
import (
"fmt"
"unicode"
)
func main() {
fmt.Println(string(unicode.ToUpper('a')))
fmt.Println(string(unicode.ToLower('Z')))
}安全地统计字母
组合使用这两个包,就可以在混合文本中只统计字母,并正确处理每个符文。
package main
import (
"fmt"
"unicode"
)
func main() {
count := 0
for _, r := range "a1 b2 世!" {
if unicode.IsLetter(r) {
count++
}
}
fmt.Println(count)
}按符文反转
要安全地反转文本,您必须反转符文而不是字节,否则多字节字符会被拆散。
package main
import "fmt"
func main() {
runes := []rune("a世b")
for i, j := 0, len(runes)-1; i < j; i, j = i+1, j-1 {
runes[i], runes[j] = runes[j], runes[i]
}
fmt.Println(string(runes))
}综合运用
一个快速摘要工具:报告字节长度、符文数量,以及文本是否是有效的 UTF-8。
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
s := "Go 世界!"
fmt.Println("bytes:", len(s))
fmt.Println("runes:", utf8.RuneCountInString(s))
fmt.Println("valid:", utf8.ValidString(s))
}快速检查
请选择正确的字符统计方式。
回顾:Unicode 和 utf8
现在,您已经能够自信地处理多字节文本:
- Go 字符串使用 UTF-8;字符占用 1 到 4 个字节。
unicode/utf8可以统计、验证并解码符文。unicode可以对单个符文进行分类并更改其大小写。
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
s := "café 語"
fmt.Println(utf8.RuneCountInString(s), "runes")
}用 AI 导师学习 Go — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 51
- 课程
- 203
常见问题解答
「Unicode 与 utf8」课时是免费的吗?
是的 — 「Unicode 与 utf8」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Go Academy 课程的其余内容,请升级到 CoddyKit PRO。 Go Academy 课程共包含 4 节课。
「Unicode 与 utf8」这节课中我会学到什么?
处理多字节文本 你通过在浏览器中直接运行的动手代码来练习 Go Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Go Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Go Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。
「Unicode 与 utf8」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Go Academy 课中编写并运行代码吗?
能。每节 Go Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 符文与字节
- strings 包函数
- strings.Builder
- Unicode 与 utf8