您的当前位置:首页>全部文章>文章详情

大模型是怎么训练的:预训练、微调与 RLHF

果子发表于:2026-10-03 15:00:51浏览:1次TAG:

一、训练三阶段总览

一个能聊天的模型,通常要经历三个阶段:

  1. 预训练(Pre-training):学语言和知识。
  2. 监督微调(SFT):学会「对话」这种格式。
  3. 人类反馈强化学习(RLHF):学会「符合人类偏好」。

二、预训练:疯狂读书的阶段

预训练让模型在海量文本上做「预测下一个词」的自监督学习:给定前面的词,猜下一个词,猜错就调整参数。这个过程不需要人工标注,数据来自公开网页、书籍、代码等。

经过预训练,模型成了「补全高手」——你给它半句话,它能接着写。但此时它还不一定听指令,可能只会「续写」而不是「回答」。

三、监督微调:学会对话

SFT 用「问题-答案」对(指令数据)进一步训练。这些数据通常由人工或更强的模型生成。模型从此学会了:看到问题,给出回答,而不是继续续写。

这一步让模型从「文字预测器」变成「助手」。

四、RLHF:符合人类偏好

RLHF 的核心思路:

  • 让模型对同一问题生成多个回答;
  • 人工对回答排序,训练一个「奖励模型」;
  • 用强化学习(如 PPO)优化模型,让它输出奖励更高的回答。

于是模型变得更礼貌、更有用、更安全,也更少胡说八道。

五、后续:对齐与安全

近年还发展出 DPO 等更简单高效的对齐方法,以及基于宪法 AI 的安全约束。这些都为了一个目标:让模型「能力强」的同时「可控、无害」。

六、小结

预训练给知识,SFT 给对话能力,RLHF 给「人味」。理解这条链路,你就知道为什么「微调」和「从头训练」成本天差地别,也为后续学习 LoRA 微调打下基础。