Alpha Pulse New

其他

港中文与恒生大学提出Libra系统,优化Agentic RL后训练资源分配,吞吐提升3倍

首次出现 8月12日 18:23·最近更新 8月12日 18:23

针对Agentic RL后训练中工作负载不稳定、轨迹长度差异大导致GPU资源分配效率低的问题,香港中文大学和恒生大学的研究团队提出Libra资源管理系统。该系统将训练与rollout视为耦合系统进行统一优化,通过异构推理集群、因果感知调度和弹性资源切换,实现GPU资源的动态分配。实验表明,在48张NVIDIA A800 GPU上,Libra在Search R1、DAPO Math 17K和R2E Gym三类任务中取得了最高吞吐,相比基线提升最高3倍,并将达到目标奖励所需时间最多缩短至1/2.5。论文与代码已公开。

多来源证据

事件时间线

  1. 8月12日 12:14
    微信公众号 WeWe-RSS
    Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍
返回新闻流