流式处理 JSON 与 CSV
使用 json.Decoder 和 encoding/csv 处理大型数据
流式处理 JSON 与 CSV 是 CoddyKit 上的免费 Go Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Go Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Go Academy 课程共包含 4 节课。
为什么要使用流式处理
将大型 JSON 或 CSV 文件全部加载到内存中会导致堆内存占用过高。流式处理一次处理一条记录,无论文件大小如何,都能保持内存占用稳定。
使用 json.Decoder 进行流式处理
json.NewDecoder 可以包装任意 io.Reader。使用 Token() 遍历 JSON 令牌流,或在循环中对 JSON 数组使用 Decode。
dec := json.NewDecoder(file)
// consume opening [
for dec.More() {
var record Record
dec.Decode(&record)
process(record)
}检测数组开始
在解码循环之前调用 dec.Token(),以消耗开头的方括号:
t, _ := dec.Token() // consume [
for dec.More() {
var r Record
dec.Decode(&r)
}从 HTTP 进行流式处理
直接从 HTTP 响应正文解码 JSON,而无需缓冲整个响应:
resp, _ := http.Get(url)
defer resp.Body.Close()
dec := json.NewDecoder(resp.Body)
for dec.More() {
var item Item
dec.Decode(&item)
process(item)
}encoding/csv 读取器
csv.NewReader 会逐行读取 CSV。设置 LazyQuotes、TrimLeadingSpace 和 Comment,即可处理实际场景中的各种 CSV 变体。
r := csv.NewReader(file)
for {
record, err := r.Read()
if err == io.EOF { break }
if err != nil { return err }
process(record)
}跳过 CSV 标题行
读取并丢弃第一条记录,以跳过标题行:
r.Read() // discard header
for {
record, err := r.Read()
if err == io.EOF { break }
}csv.Writer
使用 csv.NewWriter 逐行写入 CSV。写入后始终调用 w.Flush(),并检查 w.Error()。
w := csv.NewWriter(file)
w.Write([]string{"name", "age"})
w.Flush()
if err := w.Error(); err != nil { return err }自定义分隔符
CSV 文件有时使用分号或制表符。将 r.Comma 设置为所需的字符。
r := csv.NewReader(file)
r.Comma = ';' // semicolon-separatedJSON 行流式处理(NDJSON)
以换行符分隔的 JSON(每行一个 JSON 对象)易于进行流式处理:逐行读取,并独立解码每一行。
scanner := bufio.NewScanner(file)
for scanner.Scan() {
var record Record
json.Unmarshal(scanner.Bytes(), &record)
}内存配置文件流式处理
使用流式处理时,堆分配保持在 O(记录大小),而不是 O(文件大小)。对于包含 1 KB 记录的 1 GB 文件,流式处理约使用 1 KB 内存,而在内存中加载约使用 1 GB。
流式处理中的上下文取消
请在解码循环内检查 ctx.Done(),以便在上下文取消时中止流式处理,防止协程一直读取到 EOF。
for dec.More() {
select {
case <-ctx.Done():
return ctx.Err()
default:
}
dec.Decode(&record)
}快速检查
使用 json.Decoder 流式处理 JSON,相比使用 json.Unmarshal 有什么优势?
回顾:流式处理 JSON 和 CSV
关键要点:
- json.Decoder:对于 JSON 数组,使用 dec.More() 循环读取
- csv.NewReader:逐行读取;对于自定义分隔符,请设置 Comma
- NDJSON:使用 bufio.Scanner + 逐行 Unmarshal
- 无论文件大小如何,流式处理都能保持内存占用稳定
常见问题解答
「流式处理 JSON 与 CSV」课时是免费的吗?
是的 — 「流式处理 JSON 与 CSV」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Go Academy 课程的其余内容,请升级到 CoddyKit PRO。 Go Academy 课程共包含 4 节课。
「流式处理 JSON 与 CSV」这节课中我会学到什么?
使用 json.Decoder 和 encoding/csv 处理大型数据 你通过在浏览器中直接运行的动手代码来练习 Go Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 Go Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 Go Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。
「流式处理 JSON 与 CSV」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 Go Academy 课中编写并运行代码吗?
能。每节 Go Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 使用 os 与 bufio 读取文件
- 写入文件与临时文件
- JSON 编码与解码
- 流式处理 JSON 与 CSV