大模型是怎么训练的:预训练、微调与 RLHF
果子发表于:2026-10-03 15:00:51浏览:1次
一、训练三阶段总览
一个能聊天的模型,通常要经历三个阶段:
- 预训练(Pre-training):学语言和知识。
- 监督微调(SFT):学会「对话」这种格式。
- 人类反馈强化学习(RLHF):学会「符合人类偏好」。
二、预训练:疯狂读书的阶段
预训练让模型在海量文本上做「预测下一个词」的自监督学习:给定前面的词,猜下一个词,猜错就调整参数。这个过程不需要人工标注,数据来自公开网页、书籍、代码等。
经过预训练,模型成了「补全高手」——你给它半句话,它能接着写。但此时它还不一定听指令,可能只会「续写」而不是「回答」。
三、监督微调:学会对话
SFT 用「问题-答案」对(指令数据)进一步训练。这些数据通常由人工或更强的模型生成。模型从此学会了:看到问题,给出回答,而不是继续续写。
这一步让模型从「文字预测器」变成「助手」。
四、RLHF:符合人类偏好
RLHF 的核心思路:
- 让模型对同一问题生成多个回答;
- 人工对回答排序,训练一个「奖励模型」;
- 用强化学习(如 PPO)优化模型,让它输出奖励更高的回答。
于是模型变得更礼貌、更有用、更安全,也更少胡说八道。
五、后续:对齐与安全
近年还发展出 DPO 等更简单高效的对齐方法,以及基于宪法 AI 的安全约束。这些都为了一个目标:让模型「能力强」的同时「可控、无害」。
六、小结
预训练给知识,SFT 给对话能力,RLHF 给「人味」。理解这条链路,你就知道为什么「微调」和「从头训练」成本天差地别,也为后续学习 LoRA 微调打下基础。
推荐文章
- iframe嵌套微信公众号不显示最佳解决方案,使用cors-anywhere 解决跨域问题
- Transformer 架构入门:注意力机制是怎么工作的
- 上下文窗口与长文本:大模型能「记住」多少
- uniApp 新闻详情页语音播报,百度语音合成app端、H5端语音播报实例
- 主流开源大模型盘点:LLaMA、Qwen、DeepSeek 等
- RAG 检索增强生成入门:让大模型「开卷考试」
- 果子实用的开源免
- ThinkPHP3.2 新闻资讯网站源码,PC端+手机端,开源可二次开发
- element-ui 表格组件el-table操作toggleRowSelection事件会主动触发selection-change的坑
- Phpstorm之快捷键

