上下文窗口与长文本:大模型能「记住」多少
果子发表于:2026-10-03 15:01:51浏览:0次
一、什么是上下文窗口
上下文窗口(Context Window)指模型一次能「看到」的最大 Token 数量,等于输入 + 输出的总和,是模型的一个硬性上限。
例如某模型上下文是 8K Token,那么你输入 7000 Token 的问题,模型最多只能输出 1000 Token 左右,再多就会被截断。
二、上下文窗口为什么重要
- 决定能塞多少资料:窗口越大,一次能提供的文档、代码、对话历史越多。
- 影响「记忆」:多轮对话中,超过窗口的早期内容会被遗忘或截断。
- 影响成本:窗口越长,同样输入可能消耗更多 Token 费用。
三、模型真的能「记住」整个窗口吗
窗口大并不等于全程记忆都清晰。研究发现,很多模型对「开头」和「结尾」的信息记得更牢,中间内容容易被忽略,这被称为「Lost in the Middle」现象。所以重要信息应尽量放在提示词的开头或结尾。
四、长文本处理技巧
- 精简输入:删除无关内容,只保留相关段落。
- 分段处理:长文档切成多段分别总结,再合并。
- 使用 RAG:只检索相关片段送入窗口,而不是塞全文(后续课程详述)。
- 摘要压缩历史:长对话定期压缩成摘要,腾出空间。
五、主流模型的上下文发展
从早期 GPT-2 的 1K、GPT-3 的 2K/4K,到如今 32K、128K、甚至百万 Token 级别。但窗口越大,推理算力和成本也越高,需要权衡。
六、小结
上下文窗口是理解大模型能力边界的关键概念。学会「在有限窗口内安排信息」,是实战中最重要的基本功之一。

