0Pricing
Go Academy · 课时

流式处理 JSON 与 CSV

使用 json.Decoder 和 encoding/csv 处理大型数据

流式处理 JSON 与 CSV 是 CoddyKit 上的免费 Go Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Go Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Go Academy 课程共包含 4 节课。

为什么要使用流式处理

将大型 JSON 或 CSV 文件全部加载到内存中会导致堆内存占用过高。流式处理一次处理一条记录,无论文件大小如何,都能保持内存占用稳定。

使用 json.Decoder 进行流式处理

json.NewDecoder 可以包装任意 io.Reader。使用 Token() 遍历 JSON 令牌流,或在循环中对 JSON 数组使用 Decode。

dec := json.NewDecoder(file)
// consume opening [
for dec.More() {
    var record Record
    dec.Decode(&record)
    process(record)
}

检测数组开始

在解码循环之前调用 dec.Token(),以消耗开头的方括号:

t, _ := dec.Token() // consume [
for dec.More() {
    var r Record
    dec.Decode(&r)
}

从 HTTP 进行流式处理

直接从 HTTP 响应正文解码 JSON,而无需缓冲整个响应:

resp, _ := http.Get(url)
defer resp.Body.Close()
dec := json.NewDecoder(resp.Body)
for dec.More() {
    var item Item
    dec.Decode(&item)
    process(item)
}

encoding/csv 读取器

csv.NewReader 会逐行读取 CSV。设置 LazyQuotes、TrimLeadingSpace 和 Comment,即可处理实际场景中的各种 CSV 变体。

r := csv.NewReader(file)
for {
    record, err := r.Read()
    if err == io.EOF { break }
    if err != nil { return err }
    process(record)
}

跳过 CSV 标题行

读取并丢弃第一条记录,以跳过标题行:

r.Read() // discard header
for {
    record, err := r.Read()
    if err == io.EOF { break }
}

csv.Writer

使用 csv.NewWriter 逐行写入 CSV。写入后始终调用 w.Flush(),并检查 w.Error()。

w := csv.NewWriter(file)
w.Write([]string{"name", "age"})
w.Flush()
if err := w.Error(); err != nil { return err }

自定义分隔符

CSV 文件有时使用分号或制表符。将 r.Comma 设置为所需的字符。

r := csv.NewReader(file)
r.Comma = ';' // semicolon-separated

JSON 行流式处理(NDJSON)

以换行符分隔的 JSON(每行一个 JSON 对象)易于进行流式处理:逐行读取,并独立解码每一行。

scanner := bufio.NewScanner(file)
for scanner.Scan() {
    var record Record
    json.Unmarshal(scanner.Bytes(), &record)
}

内存配置文件流式处理

使用流式处理时,堆分配保持在 O(记录大小),而不是 O(文件大小)。对于包含 1 KB 记录的 1 GB 文件,流式处理约使用 1 KB 内存,而在内存中加载约使用 1 GB。

流式处理中的上下文取消

请在解码循环内检查 ctx.Done(),以便在上下文取消时中止流式处理,防止协程一直读取到 EOF。

for dec.More() {
    select {
    case <-ctx.Done():
        return ctx.Err()
    default:
    }
    dec.Decode(&record)
}

快速检查

使用 json.Decoder 流式处理 JSON,相比使用 json.Unmarshal 有什么优势?

回顾:流式处理 JSON 和 CSV

关键要点:

  • json.Decoder:对于 JSON 数组,使用 dec.More() 循环读取
  • csv.NewReader:逐行读取;对于自定义分隔符,请设置 Comma
  • NDJSON:使用 bufio.Scanner + 逐行 Unmarshal
  • 无论文件大小如何,流式处理都能保持内存占用稳定

常见问题解答

「流式处理 JSON 与 CSV」课时是免费的吗?

是的 — 「流式处理 JSON 与 CSV」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Go Academy 课程的其余内容,请升级到 CoddyKit PRO。 Go Academy 课程共包含 4 节课。

「流式处理 JSON 与 CSV」这节课中我会学到什么?

使用 json.Decoder 和 encoding/csv 处理大型数据 你通过在浏览器中直接运行的动手代码来练习 Go Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 Go Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 Go Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。

「流式处理 JSON 与 CSV」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 Go Academy 课中编写并运行代码吗?

能。每节 Go Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 使用 os 与 bufio 读取文件
  2. 写入文件与临时文件
  3. JSON 编码与解码
  4. 流式处理 JSON 与 CSV
← 返回 Go Academy