如果说:

预训练(Pretraining)是读完义务教育 📚

RLHF 是绩效考核 + 行为规范 📊

那 SFT 更像什么?

SFT 更像是给大模型做一次“岗前培训”。

 

它不是从零开始教模型认字,

也不是教它“怎么讨人喜欢”,

而是:

教它怎么在某个岗位上,好好说话、好好做事。

 

一、预训练解决的是“有没有常识”

大模型在预训练阶段学到的是:

语言结构

世界知识

基本推理能力

 

就像一个刚毕业的人:

什么都懂一点

但不知道公司具体怎么做事

这时候它有能力,但没方向。

 

二、SFT 解决的是“怎么按要求干活”

SFT 做的事情很直接:

给模型大量“输入 → 标准答案”的示例,让它学会模仿。

比如:

用户问什么

理想回答长什么样

格式怎么写

风格怎么控制

这就像:

公司给新员工一套“标准话术”和“范例文档”。

不是让你发明新语言,

而是:

按我们公司的风格来。

 

三、SFT 到底在训练什么?

本质上,SFT 还是做一件事:

用监督学习,让模型最大化“正确答案”的概率。

它并不改变模型的结构,

而是微调参数,让模型更倾向于:

给出更清晰的回答

更少胡言乱语

更符合人类习惯

一句话总结:

SFT 是把“会说话”变成“会按要求说话”。

 

四、为什么 SFT 这么关键?

很多人以为:

“模型已经预训练那么大了,还需要 SFT 吗?”

需要,而且非常需要。

没有 SFT 的模型:

回答风格混乱

不知道该不该拒绝

格式不稳定

有了 SFT 之后:

回答更像一个“产品”

更可控

更可上线

这就是从“研究模型”到“可用模型”的关键一步。

 

五、SFT 和 RLHF 的区别(简单讲)

你可以这样记:

SFT = 老师讲标准答案,让你模仿

RLHF = 老师不给标准答案,只告诉你好不好,让你自己调整

SFT 更直接,

RLHF 更偏“行为校正”。

 

六、一个更完整的比喻

如果把训练过程想象成培养一个人:

预训练:读书 18 年

SFT:入职培训

RLHF:绩效反馈与文化塑造

三者缺一不可。

 

七、最后一句话

SFT 不让模型更博学,但让模型更职业。

从“聪明的学生”,

到“能上岗的员工”,

中间差的就是这一步。

 

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐