预训练让大模型学会了语言规律,但后训练才让模型变得"有用、无害、诚实"。后训练是大模型从"能说话"到"会做事"的关键阶段。


后训练的主要技术路径

1. 监督微调(SFT, Supervised Fine-Tuning)

用高质量的指令-回答对数据对模型进行微调,教会模型按照人类期望的格式和风格回答问题。

  • 数据形式:{"instruction": "翻译这段话", "output": "..."}

  • 作用:让模型从"预测下一个词"转变为"遵循指令"

  • 代表工作:InstructGPT、Alpaca

2. 基于人类反馈的强化学习(RLHF)

这是目前最主流的对齐技术,分三步:

  1. 训练奖励模型(Reward Model):让人类对模型的多个回答进行排序,训练一个能打分的奖励模型

  2. 强化学习优化:用 PPO 算法让大模型不断生成回答,奖励模型打分,模型朝高分方向更新

  3. 效果:模型变得更有帮助、更安全、更符合人类偏好

3. 直接偏好优化(DPO, Direct Preference Optimization)

RLHF 的简化替代方案,无需单独训练奖励模型:

  • 直接用人类偏好数据(好回答 vs 差回答)训练

  • 更稳定、更简单、成本更低

  • 被 LLaMA 3、Qwen 等广泛采用

4. 拒绝采样微调(Rejection Sampling)

  • 让模型生成大量候选回答,用奖励模型筛选出高分的

  • 把筛选出的高质量回答再用于 SFT

  • 简单有效,尤其适合数学、代码等有明确对错的任务

5. 过程奖励模型(PRM, Process Reward Model)

  • 不只对最终答案打分,而是对推理的每一步打分

  • 引导模型学会正确的推理过程,而非只背答案

  • 是提升数学、逻辑推理能力的关键技术(o1、DeepSeek-R1 的核心)


后训练赋予了哪些新能力

能力

对应技术

遵循指令

SFT

安全无害

RLHF / DPO

逻辑推理

PRM + RL

代码生成

拒绝采样 + SFT

长链思考(CoT)

RL + 过程监督


近期趋势:强化学习的回归

DeepSeek-R1 为代表,最新研究发现:

仅用强化学习(几乎不依赖人工标注数据),模型可以自发涌现出复杂推理能力,包括自我反思、验证答案等行为。

这说明后训练的天花板远未到达,强化学习驱动的后训练是当前最热门的研究方向。


一句话总结

预训练给模型装上了"大脑",后训练则通过 SFT 教它规矩、通过 RLHF/DPO 对齐人类价值观、通过强化学习激发推理潜力——三者共同决定了模型的最终能力上限。