大模型后训练(Post-Training)如何增强能力
预训练让大模型学会了语言规律,但后训练才让模型变得"有用、无害、诚实"。后训练是大模型从"能说话"到"会做事"的关键阶段。
后训练的主要技术路径
1. 监督微调(SFT, Supervised Fine-Tuning)
用高质量的指令-回答对数据对模型进行微调,教会模型按照人类期望的格式和风格回答问题。
数据形式:
{"instruction": "翻译这段话", "output": "..."}作用:让模型从"预测下一个词"转变为"遵循指令"
代表工作:InstructGPT、Alpaca
2. 基于人类反馈的强化学习(RLHF)
这是目前最主流的对齐技术,分三步:
训练奖励模型(Reward Model):让人类对模型的多个回答进行排序,训练一个能打分的奖励模型
强化学习优化:用 PPO 算法让大模型不断生成回答,奖励模型打分,模型朝高分方向更新
效果:模型变得更有帮助、更安全、更符合人类偏好
3. 直接偏好优化(DPO, Direct Preference Optimization)
RLHF 的简化替代方案,无需单独训练奖励模型:
直接用人类偏好数据(好回答 vs 差回答)训练
更稳定、更简单、成本更低
被 LLaMA 3、Qwen 等广泛采用
4. 拒绝采样微调(Rejection Sampling)
让模型生成大量候选回答,用奖励模型筛选出高分的
把筛选出的高质量回答再用于 SFT
简单有效,尤其适合数学、代码等有明确对错的任务
5. 过程奖励模型(PRM, Process Reward Model)
不只对最终答案打分,而是对推理的每一步打分
引导模型学会正确的推理过程,而非只背答案
是提升数学、逻辑推理能力的关键技术(o1、DeepSeek-R1 的核心)
后训练赋予了哪些新能力
近期趋势:强化学习的回归
以 DeepSeek-R1 为代表,最新研究发现:
仅用强化学习(几乎不依赖人工标注数据),模型可以自发涌现出复杂推理能力,包括自我反思、验证答案等行为。
这说明后训练的天花板远未到达,强化学习驱动的后训练是当前最热门的研究方向。
一句话总结
预训练给模型装上了"大脑",后训练则通过 SFT 教它规矩、通过 RLHF/DPO 对齐人类价值观、通过强化学习激发推理潜力——三者共同决定了模型的最终能力上限。