LLM 后训练的统一视角:SFT 与 RL 的"终极和解"与 HPT 算法解析

LLM 后训练的统一视角:SFT 与 RL 的"终极和解"与 HPT 算法解析

Jerome Xiong

这是 AI Agent 学习系列的第一篇。想要构建真正可靠的 Agent,必须先理解底层模型是如何被"训练"出来的。本文解读清华与上海AI实验室的论文《Towards a Unified View of Large Language Model Post-Training》:一个统一理论(UPGE)把 SFT 与 RL 缝合成同一枚硬币的两面,一个实践算法(HPT)像智能家教一样动态切换"模仿教学"与"探索教学",在数学推理基准上全面超越现有方案。

为什么 Agent 开发者要懂后训练

大语言模型(LLM)的成长分为两个阶段:预训练(Pre-Training) 让模型拥有广博的知识,后训练(Post-Training) 让模型从"通才"走向"专才"。

🎯 定位:预训练好的 LLM 像一个知识渊博但行为散漫的大学生,后训练的目标就是把他培养成特定领域的专业人士。

对 Agent 开发者来说,后训练决定了模型能否可靠地遵循指令、调用工具、按格式输出——这些恰恰是 Agent 赖以工作的基础能力。

长期以来,后训练领域被两大范式主导:

范式 教学方式 核心思想
监督微调(SFT) 模仿型教学 给模型看标准答案,让它照着学
强化学习(RL) 探索型教学 让模型自己试错,用奖励信号引导

SFT 与 RL 两条培养路径

业界最常见的做法是 “SFT-then-RL” 序贯流程:先用 SFT 打好基础,再用 RL 提升能力。但这更像工程妥协——资源消耗巨大、流程繁琐,而且缺乏根本性理论指导我们如何在两种学习信号间取得最佳平衡。

论文核心贡献

这篇来自清华大学与上海AI实验室的论文《Towards a Unified View of Large Language Model Post-Training》提出了一个根本性问题:

🤔 核心之问:SFT 和 RL 真的是两种相互独立、甚至矛盾的训练范式吗?还是说,它们本质上是同一枚硬币的两面?

论文的答案分两层:

  1. 理论贡献:统一策略梯度估计器(Unified Policy Gradient Estimator, UPGE)
  2. 实践贡献:混合后训练算法(Hybrid Post-Training, HPT)

论文整体框架

UPGE:后训练领域的"罗塞塔石碑"

UPGE 是论文的理论基石。作者通过严谨的数学推导证明:SFT、PPO、GRPO 等多种看似迥异的后训练算法,其底层的梯度计算形式,都可以被统一到同一个数学表达式中

UPGE 统一公式

在这个统一视角下,SFT 和 RL 不再是两种不同的目标,而是对同一个优化目标、具有不同 偏见-方差权衡(bias-variance trade-offs) 的两种不同估计:

  • SFT:低方差、高偏见的稳定信号(求稳)
  • RL:高方差、低偏见的探索信号(求新)

💡 理解:SFT 与 RL 的关系,不再是"先模仿还是先探索",而是"在当前阶段,我们更需要哪种信号"。UPGE 就像后训练领域的"罗塞塔石碑",提供了一种通用语言来理解和比较不同算法的内在联系。

UPGE 模块化框架

UPGE 的最终形式可以被看作一个由四个可替换模块组成的"乐高"模型——不同的后训练算法,本质上只是为这几个模块选择了不同的"零件"而已。

HPT:一位智能家教的"教学四步法"

如果说 UPGE 是理论指导,那么 HPT 就是把理论付诸实践的"智能教学系统"。

HPT 的核心思想极其优雅:它像一位经验丰富的老师,根据学生在每个问题上的实时表现,动态地决定采用"模仿教学"还是"探索教学",从而在一个统一训练流程中自适应地平衡知识的利用(Exploitation)和策略的探索(Exploration)。

HPT 智能教学系统

对于数据集中的每一个问题,HPT 都会执行以下四步:

步骤一:随堂小测(Performance Evaluation)

老师不会直接讲题,而是先评估学生当前的水平——用模型在本题上的表现(能力分)作为动态决策的依据。

步骤二:动态决策(Dynamic Feedback and Mode Switching)

老师根据刚刚得到的能力分,决定下一步的教学策略:学生基础差就用 SFT 模仿教学,学生有潜力就切换 RL 探索教学。

步骤三:计算"后悔分数"(Calculating the Mixed Loss)

根据所选教学模式,计算一个"后悔分数"(损失函数),衡量模型当前状态与理想状态的差距。最终总后悔分数是两者的加权和;由于开关互斥,任何时刻只有一个损失项在起作用。

步骤四:纠正思路(Model Update)

最后一步也是最关键的一步——利用"后悔分数"对模型参数进行微小而有益的调整。

HPT 完整算法流程

📝 类比:整个训练循环就像一位家教辅导学生——先测试摸底,再决定讲题还是放手让学生试错,最后针对问题修正思路。HPT 在统一训练循环中对每个问题不断重复这"教学四步法",实现了 SFT 知识利用与 RL 策略探索的精妙平衡。

实验结果:HPT 真的有效吗

论文在多个极具挑战性的数学推理基准上对 HPT 进行了全面评估,使用 Qwen2.5-Math-7B 等模型。

1. 全面超越基线

在 6 个数学基准上的平均分达到 52.7,显著超过所有对比方法:

方法 平均分
HPT(本文) 52.7
LUFFY(混合策略) 49.8
SFT → GRPO(传统序贯) 46.5

实验结果对比

这一优势在不同模型上得到重现,验证了其普适性。

2. 不仅提升准确率,更增强探索能力

Pass@k 指标衡量模型在 k 次尝试中至少有一次成功的概率,能反映模型的探索能力和解题思路多样性。HPT 不仅在 Pass@1(单次尝试成功率)上领先,在 k 值增大时性能优势愈发明显。

Pass@k 探索能力分析

探索能力对比细节

💡 洞察:这表明 HPT 的动态机制并非简单地在模仿和探索之间取折中,而是通过 SFT 引入的外部知识极大拓宽了 RL 阶段的探索边界,实现了 1+1>2 的协同效应。

3. 动态机制的可视化验证

训练初期模型能力较弱,SFT 比例非常高;随着训练推进,模型逐渐掌握解题能力,SFT 贡献相应减少,RL 贡献逐渐增加,最终稳定在一个动态平衡状态——有力证明了"智能教学"机制确实在按预期工作。

HPT 动态调整过程

总结与展望

HPT 的成功揭示了 LLM 后训练更智能、更高效的方向。这篇论文通过统一的理论框架和优雅的实践算法,解决了困扰业界已久的 SFT 与 RL 的"割裂感"问题。

🎯 意义:HPT 所代表的自适应、细粒度的训练范式,为通往更强大、更可靠的通用人工智能模型铺设了一条坚实而富有前景的道路。

未来值得探索的方向:更细粒度的动态切换策略、与其他训练技术的结合、以及在更多任务类型(推理、工具调用、多模态)上的泛化能力。


📚 系列预告:本篇是 AI Agent 学习系列的开篇,从模型训练基础讲起。后续将逐步深入 Agent 的架构设计、工具调用、规划推理、记忆系统等主题。

参考SFT与RL的"终极和解":清华大学提出LLM Post-Training(后训练) 统一理论与HPT算法(腾讯云开发者社区,唐国梁Tommy)

  • 标题: LLM 后训练的统一视角:SFT 与 RL 的"终极和解"与 HPT 算法解析
  • 作者: Jerome Xiong
  • 创建于 : 2026-08-04 09:00:00
  • 更新于 : 2026-08-04 15:42:22
  • 链接: https://jeromexiong.github.io/2026/08/04/AI-Agent学习系列/LLM-后训练的统一视角-SFT与RL的终极和解与HPT算法解析/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
评论