Go Academy · 课时

Unicode 与 utf8

处理多字节文本

第 4 / 4 课13 个步骤

Unicode 与 utf8 是 CoddyKit 上的免费 Go Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Go Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Go Academy 课程共包含 4 节课。

为什么 Unicode 很重要

现代文本包含重音符号、表情符号和非拉丁文字。Unicode 为每个字符分配一个称为码点的数字。

Go 使用 UTF-8 存储字符串;UTF-8 是一种对这些码点进行变长编码的方式。

package main

import "fmt"

func main() {
    s := "héllo 世界"
    fmt.Println(s)
}

每个字符的字节数各不相同

在 UTF-8 中,一个字符占用 1 到 4 个字节:

  • ASCII 字母:1 个字节。
  • 带重音符号的拉丁字符:通常占用 2 个字节。
  • CJK 字符:通常占用 3 个字节。
package main

import "fmt"

func main() {
    fmt.Println(len("a"))
    fmt.Println(len("é"))
    fmt.Println(len("世"))
}

unicode/utf8 包

unicode/utf8 包可以理解这种编码。utf8.RuneCountInString(s) 可以正确统计字符数,不同于 len。

package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    s := "héllo"
    fmt.Println(len(s))
    fmt.Println(utf8.RuneCountInString(s))
}

验证 UTF-8

在处理字符串之前,请使用 utf8.ValidString(s) 确认其中保存的是格式正确的 UTF-8。

package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    fmt.Println(utf8.ValidString("héllo"))
    fmt.Println(utf8.ValidString(string([]byte{0xff, 0xfe})))
}

解码一个符文

utf8.DecodeRuneInString(s) 会返回第一个符文,以及它消耗的字节数。这样您就可以手动遍历字符串。

package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    r, size := utf8.DecodeRuneInString("世界")
    fmt.Println(string(r), size)
}

range 会为您完成解码

for range 循环已经会完成 UTF-8 解码。索引在每一步都会按照符文的字节大小向前跳过相应位置。

package main

import "fmt"

func main() {
    for i, r := range "a世b" {
        fmt.Println(i, string(r))
    }
}

unicode 包

unicode 包可以对单个符文进行分类。unicode.IsLetter 和 unicode.IsDigit 等函数可以回答有关字符的问题。

package main

import (
    "fmt"
    "unicode"
)

func main() {
    fmt.Println(unicode.IsLetter('A'))
    fmt.Println(unicode.IsDigit('7'))
    fmt.Println(unicode.IsSpace(' '))
}

按符文更改大小写

unicode.ToUpper 和 unicode.ToLower 作用于单个符文,包括许多非 ASCII 字母。

package main

import (
    "fmt"
    "unicode"
)

func main() {
    fmt.Println(string(unicode.ToUpper('a')))
    fmt.Println(string(unicode.ToLower('Z')))
}

安全地统计字母

组合使用这两个包,就可以在混合文本中只统计字母,并正确处理每个符文。

package main

import (
    "fmt"
    "unicode"
)

func main() {
    count := 0
    for _, r := range "a1 b2 世!" {
        if unicode.IsLetter(r) {
            count++
        }
    }
    fmt.Println(count)
}

按符文反转

要安全地反转文本,您必须反转符文而不是字节,否则多字节字符会被拆散。

package main

import "fmt"

func main() {
    runes := []rune("a世b")
    for i, j := 0, len(runes)-1; i < j; i, j = i+1, j-1 {
        runes[i], runes[j] = runes[j], runes[i]
    }
    fmt.Println(string(runes))
}

综合运用

一个快速摘要工具:报告字节长度、符文数量,以及文本是否是有效的 UTF-8。

package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    s := "Go 世界!"
    fmt.Println("bytes:", len(s))
    fmt.Println("runes:", utf8.RuneCountInString(s))
    fmt.Println("valid:", utf8.ValidString(s))
}

快速检查

请选择正确的字符统计方式。

回顾:Unicode 和 utf8

现在,您已经能够自信地处理多字节文本:

  • Go 字符串使用 UTF-8;字符占用 1 到 4 个字节。
  • unicode/utf8 可以统计、验证并解码符文。
  • unicode 可以对单个符文进行分类并更改其大小写。
package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    s := "café 語"
    fmt.Println(utf8.RuneCountInString(s), "runes")
}
免费开始

用 AI 导师学习 Go — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
51
课程
203

常见问题解答

「Unicode 与 utf8」课时是免费的吗?

是的 — 「Unicode 与 utf8」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Go Academy 课程的其余内容,请升级到 CoddyKit PRO。 Go Academy 课程共包含 4 节课。

「Unicode 与 utf8」这节课中我会学到什么?

处理多字节文本 你通过在浏览器中直接运行的动手代码来练习 Go Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 Go Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 Go Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。

「Unicode 与 utf8」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 Go Academy 课中编写并运行代码吗?

能。每节 Go Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 符文与字节
  2. strings 包函数
  3. strings.Builder
  4. Unicode 与 utf8
← 返回 Go Academy