0Pricing
C Academy · 课时

标记化输入

将文本转换为标记。

标记化输入 是 CoddyKit 上的免费 C Academy 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 C Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 C Academy 课程共包含 4 节课。

什么是分词器?

解释器首先会将原始文本转换为 Token——最小的有意义单位。对于字符串 3 + 4 * 2,分词器(或词法分析器)会产生数字和运算符。

这一阶段会去除空白并对每组字符进行分类,因此语法分析器无需处理原始字节。

一种 Token 类型

我们使用枚举标签和有效载荷来表示每个 Token。数字携带一个整数值;运算符和括号只需要记录其种类。

将值保存在结构体中,可以避免之后重新扫描源代码。

typedef enum {
  TOK_NUM, TOK_PLUS, TOK_MINUS,
  TOK_STAR, TOK_SLASH,
  TOK_LPAREN, TOK_RPAREN, TOK_EOF
} TokKind;

typedef struct {
  TokKind kind;
  int value; /* used when kind == TOK_NUM */
} Token;

扫描位置

词法分析器使用游标指针遍历源代码。一个小型辅助函数可以查看当前字符而不消耗它,并在末尾返回 '\0'。

指针运算使扫描器保持快速而简单。

static const char *src;

static char peek(void) {
  return *src;
}

static char advance(void) {
  return *src++;
}

跳过空白

读取 Token 之前,我们会丢弃空格和制表符。<ctype.h> 中的标准 isspace 可以处理所有空白字符。

在这里,换行符也算作空白,因此表达式可以跨越多行。

#include <ctype.h>

static void skip_ws(void) {
  while (isspace((unsigned char)peek()))
    advance();
}

词法分析数字

当游标位于数字上时,我们会将连续的数字累积成一个整数。通过乘以十并加上每个数字,可以从左到右构建数值。

循环会在遇到第一个非数字字符时停止,让游标准备好读取下一个 Token。

static int lex_number(void) {
  int n = 0;
  while (isdigit((unsigned char)peek())) {
    n = n * 10 + (advance() - '0');
  }
  return n;
}

next_token 函数

核心例程会跳过空白,然后根据当前字符进行分派。数字会变成 TOK_NUM;每个运算符都会映射到自己的种类。

遇到结尾的 NUL 时会产生 TOK_EOF,这是停止处理的信号。

static Token next_token(void) {
  skip_ws();
  char c = peek();
  if (c == '\0') return (Token){TOK_EOF, 0};
  if (isdigit((unsigned char)c))
    return (Token){TOK_NUM, lex_number()};
  advance();
  switch (c) {
    case '+': return (Token){TOK_PLUS, 0};
    case '-': return (Token){TOK_MINUS, 0};
    case '*': return (Token){TOK_STAR, 0};
    case '/': return (Token){TOK_SLASH, 0};
    case '(': return (Token){TOK_LPAREN, 0};
    case ')': return (Token){TOK_RPAREN, 0};
  }
  return (Token){TOK_EOF, 0};
}

运行词法分析器

这是一个完整的程序,用于对表达式进行分词并打印每个 Token 的种类。数字还会打印其值。

请注意,循环会在读到 TOK_EOF 时结束。

#include <stdio.h>
#include <ctype.h>

typedef enum { TOK_NUM, TOK_PLUS, TOK_STAR, TOK_EOF } TokKind;
typedef struct { TokKind kind; int value; } Token;

static const char *src;
static char peek(void){ return *src; }
static char advance(void){ return *src++; }

static Token next_token(void){
  while (isspace((unsigned char)peek())) advance();
  char c = peek();
  if (c=='\0') return (Token){TOK_EOF,0};
  if (isdigit((unsigned char)c)){
    int n=0; while(isdigit((unsigned char)peek())) n=n*10+(advance()-'0');
    return (Token){TOK_NUM,n};
  }
  advance();
  if (c=='+') return (Token){TOK_PLUS,0};
  return (Token){TOK_STAR,0};
}

int main(void){
  src = "12 + 3 * 4";
  Token t;
  do {
    t = next_token();
    if (t.kind==TOK_NUM) printf("NUM %d\n", t.value);
    else if (t.kind==TOK_PLUS) printf("PLUS\n");
    else if (t.kind==TOK_STAR) printf("STAR\n");
    else printf("EOF\n");
  } while (t.kind != TOK_EOF);
  return 0;
}

查看一个后续 Token

语法分析器通常需要在消耗下一个 Token 之前先检查它。我们会将一个 Token 存储在全局变量 current 中,并在每次匹配后重新填充它。

对于我们的 LL(1) 语法,一个 Token 的向前查看就足够了。

static Token current;

static void init_lexer(const char *s) {
  src = s;
  current = next_token();
}

static Token cur(void) { return current; }

static void bump(void) { current = next_token(); }

报告词法错误

未知字符——例如 $ 或 @——不应悄无声息地消失。健壮的词法分析器会报告出错的字节并中止处理。

在词法分析阶段快速失败,可以避免后续阶段看到无效的 Token。

#include <stdio.h>
#include <stdlib.h>

static void lex_error(char c) {
  fprintf(stderr, "lex error: unexpected '%c'\n", c);
  exit(1);
}

多字符运算符

实际语言中有 == 或 <= 这样的 Token。要对它们进行词法分析,我们会在第一个字符之后再查看一个字符。

如果下一个字节使运算符完整,我们就消耗这两个字符;否则就产生单字符形式。

/* fragment: distinguish '=' from '==' */
if (peek() == '=') {
  advance();
  if (peek() == '=') { advance(); /* TOK_EQ */ }
  else { /* TOK_ASSIGN */ }
}

Token 为什么重要

将字符归并成 Token 后,语法分析器处理的是干净且带类型的流。运算符优先级、分组和错误都会更容易理解。

下一步,我们会将这些 Token 输入递归下降语法分析器。

快速检查

思考词法分析器会为分组符号产生什么。

回顾

您构建了一个词法分析器:包括 Token 类型、扫描游标、跳过空白、数字词法分析,以及带一个 Token 向前查看功能的 next_token 分派器。

这些 Token 会作为语法分析的输入,语法分析器将据此构建语法树。

常见问题解答

「标记化输入」课时是免费的吗?

是的 — 「标记化输入」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 C Academy 课程的其余内容,请升级到 CoddyKit PRO。 C Academy 课程共包含 4 节课。

「标记化输入」这节课中我会学到什么?

将文本转换为标记。 你通过在浏览器中直接运行的动手代码来练习 C Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 C Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 C Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。

「标记化输入」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 C Academy 课中编写并运行代码吗?

能。每节 C Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 标记化输入
  2. 解析表达式
  3. 计算语法树
  4. 添加变量
← 返回 C Academy