Alpha Pulse New

AI 产品

开源确定性训练-对齐堆栈以解决LLM训练数值不匹配问题

首次出现 8月11日 19:01·最近更新 8月11日 19:01

自从强化学习(RL)成为大型语言模型(LLM)训练的核心部分后,训练- rollout数值不匹配一直是RL基础设施中的常见问题。尽管已有多个开源努力致力于对齐,但生产规模支持往往在模型规模、性能或功能覆盖上存在权衡。今天,我们开源了用于GLM-5.2规模训练的确定性训练-对齐堆栈,涵盖FP8权重、FP8 KV rollout、DeepEP、DeepGEMM和稀疏注意力技术。这一发布旨在提供更全面的生产级支持,基于社交媒体宣布,非官方确认信息。

多来源证据

事件时间线

  1. 8月11日 13:53
    Twitter/X AI List
    自从RL成为LLM训练的核心部分以来,训练- rollout数值不匹配一直是RL基础设施中的一个常见问题。 已经有一些
返回新闻流