您的当前位置:首页>全部文章>文章详情

Token 与分词:大模型理解文字的最小单位

果子发表于:2026-10-03 15:00:51浏览:0次TAG:

一、什么是 Token

模型并不直接「读字」,而是把文字先切成一个个更小的片段,每个片段叫一个 Token(词元)。模型处理的、计费的、上下文长度限制的,统统以 Token 为单位。

举几个例子(不同模型略有差异):

  • 英文单词 hello 通常是 1 个 Token。
  • 常见单词 language 约 1 个 Token,生僻词 hippopotamus 可能被拆成多个。
  • 一个中文字符通常是 1~2 个 Token,中文标点也算。

二、为什么中英文「不等价」

英文有天然的空格分词,且高频词可整体映射成 1 个 Token;中文没有空格,且字/词组合多,所以同样一句话,中文消耗的 Token 往往比英文多。这也是「同样内容中文更费钱」的原因。

三、分词器(Tokenizer)在做什么

分词器是模型入口处的一个组件,负责把原始文本转成一串数字 ID,再交给模型计算。主流做法是 BPE(字节对编码)等子词算法:

  1. 把文本切成字符/字节;
  2. 统计高频相邻组合,逐步合并成更大单元;
  3. 最终得到一个「词表」,里面既有完整常用词,也有词根、前后缀等子词。

这样既能覆盖海量词汇,又能控制词表大小、减少未知词。

四、Token 为什么重要

  • 计费:API 按输入 + 输出 Token 收费。
  • 上下文窗口:模型一次能「看」的 Token 数有限,超出会被截断或遗忘。
  • 成本优化:精简 Prompt、减少无关历史,能显著省钱。

五、小结

Token 是大模型的「基本计量单位」。理解它,你就能看懂 API 账单、上下文限制,也能更有意识地优化提示词。下一课我们讲模型内部的 Transformer 架构。