大模型知识点必备:SFT 是什么?把它当成给大模型做「岗前培训」
如果说:
预训练(Pretraining)是读完义务教育 📚
RLHF 是绩效考核 + 行为规范 📊
那 SFT 更像什么?
SFT 更像是给大模型做一次“岗前培训”。
它不是从零开始教模型认字,
也不是教它“怎么讨人喜欢”,
而是:
教它怎么在某个岗位上,好好说话、好好做事。
一、预训练解决的是“有没有常识”
大模型在预训练阶段学到的是:
语言结构
世界知识
基本推理能力
就像一个刚毕业的人:
什么都懂一点
但不知道公司具体怎么做事
这时候它有能力,但没方向。
二、SFT 解决的是“怎么按要求干活”
SFT 做的事情很直接:
给模型大量“输入 → 标准答案”的示例,让它学会模仿。
比如:
用户问什么
理想回答长什么样
格式怎么写
风格怎么控制
这就像:
公司给新员工一套“标准话术”和“范例文档”。
不是让你发明新语言,
而是:
按我们公司的风格来。
三、SFT 到底在训练什么?
本质上,SFT 还是做一件事:
用监督学习,让模型最大化“正确答案”的概率。
它并不改变模型的结构,
而是微调参数,让模型更倾向于:
给出更清晰的回答
更少胡言乱语
更符合人类习惯
一句话总结:
SFT 是把“会说话”变成“会按要求说话”。
四、为什么 SFT 这么关键?
很多人以为:
“模型已经预训练那么大了,还需要 SFT 吗?”
需要,而且非常需要。
没有 SFT 的模型:
回答风格混乱
不知道该不该拒绝
格式不稳定
有了 SFT 之后:
回答更像一个“产品”
更可控
更可上线
这就是从“研究模型”到“可用模型”的关键一步。
五、SFT 和 RLHF 的区别(简单讲)
你可以这样记:
SFT = 老师讲标准答案,让你模仿
RLHF = 老师不给标准答案,只告诉你好不好,让你自己调整
SFT 更直接,
RLHF 更偏“行为校正”。
六、一个更完整的比喻
如果把训练过程想象成培养一个人:
预训练:读书 18 年
SFT:入职培训
RLHF:绩效反馈与文化塑造
三者缺一不可。
七、最后一句话
SFT 不让模型更博学,但让模型更职业。
从“聪明的学生”,
到“能上岗的员工”,
中间差的就是这一步。
更多推荐
所有评论(0)