AI 产品
新方法利用教师模型提供密集奖励并避免“分布外冲击”
一项新的技术讨论提出,在强化学习训练中,采用基于策略的蒸馏(On-policy distillation)方法,可以优雅地将教师模型用作过程奖励模型。这种方法能在生成过程中提供密集的奖励信号,同时避免类似监督微调(SFT)过程中可能出现的“分布外冲击”问题。目前该讨论主要源自社交媒体平台的技术交流,尚未获得官方确认。
多来源证据
事件时间线
- Twitter/X AI List基于策略的蒸馏提供了一种优雅的方式,将教师模型用作过程奖励模型,以提供密集奖励,同时避免监督微调式的“分布外冲击”