AI 产品
开源确定性训练-对齐堆栈以解决LLM训练数值不匹配问题
自从强化学习(RL)成为大型语言模型(LLM)训练的核心部分后,训练- rollout数值不匹配一直是RL基础设施中的常见问题。尽管已有多个开源努力致力于对齐,但生产规模支持往往在模型规模、性能或功能覆盖上存在权衡。今天,我们开源了用于GLM-5.2规模训练的确定性训练-对齐堆栈,涵盖FP8权重、FP8 KV rollout、DeepEP、DeepGEMM和稀疏注意力技术。这一发布旨在提供更全面的生产级支持,基于社交媒体宣布,非官方确认信息。
多来源证据
事件时间线
- Twitter/X AI List自从RL成为LLM训练的核心部分以来,训练- rollout数值不匹配一直是RL基础设施中的一个常见问题。 已经有一些