Token 与分词:大模型理解文字的最小单位
果子发表于:2026-10-03 15:00:51浏览:0次
一、什么是 Token
模型并不直接「读字」,而是把文字先切成一个个更小的片段,每个片段叫一个 Token(词元)。模型处理的、计费的、上下文长度限制的,统统以 Token 为单位。
举几个例子(不同模型略有差异):
- 英文单词
hello通常是 1 个 Token。 - 常见单词
language约 1 个 Token,生僻词hippopotamus可能被拆成多个。 - 一个中文字符通常是 1~2 个 Token,中文标点也算。
二、为什么中英文「不等价」
英文有天然的空格分词,且高频词可整体映射成 1 个 Token;中文没有空格,且字/词组合多,所以同样一句话,中文消耗的 Token 往往比英文多。这也是「同样内容中文更费钱」的原因。
三、分词器(Tokenizer)在做什么
分词器是模型入口处的一个组件,负责把原始文本转成一串数字 ID,再交给模型计算。主流做法是 BPE(字节对编码)等子词算法:
- 把文本切成字符/字节;
- 统计高频相邻组合,逐步合并成更大单元;
- 最终得到一个「词表」,里面既有完整常用词,也有词根、前后缀等子词。
这样既能覆盖海量词汇,又能控制词表大小、减少未知词。
四、Token 为什么重要
- 计费:API 按输入 + 输出 Token 收费。
- 上下文窗口:模型一次能「看」的 Token 数有限,超出会被截断或遗忘。
- 成本优化:精简 Prompt、减少无关历史,能显著省钱。
五、小结
Token 是大模型的「基本计量单位」。理解它,你就能看懂 API 账单、上下文限制,也能更有意识地优化提示词。下一课我们讲模型内部的 Transformer 架构。
推荐文章
- ThinkPHP8后端访问uniCloud云函数URL化,用密钥签名认证访问策略分析
- Transformer 架构入门:注意力机制是怎么工作的
- element-ui 表格组件el-table操作toggleRowSelection事件会主动触发selection-change的坑
- docker 基本操作之 镜像文件、容器启动等
- iframe嵌套微信公众号不显示最佳解决方案,使用cors-anywhere 解决跨域问题
- 宝塔Linux面板安装Redis
- Embedding 嵌入:把文字变成向量
- 大模型量化技术:INT8 与 INT4 是什么
- 大模型的「幻觉」是什么?为什么会胡说八道
- PhpStorm 链接管理Mysql数据库(远程数据库和本地数据库)

