Alpha Pulse New

AI 产品

英伟达研究人员推出新型Transformer变体,解码速度提升1.7倍

首次出现 8月12日 23:30·最近更新 8月12日 23:30

英伟达研究人员开发了一种新的Transformer架构变体。通过在注意力层添加第四个投影,用于预测下一层所需信息,这一改进实现了1.7倍的解码速度提升和6.5点的长推理准确性改善。该研究旨在解决当前Transformer架构中KV缓存增长导致的内存和性能问题,属于已确认事实;讨论部分涉及sparse attention等当前技术的局限性,但摘要基于证据中的核心事实。

多来源证据

事件时间线

  1. 8月12日 20:40
    Twitter/X AI List
    英伟达研究人员构建新型Transformer变体。 对层的一个小改动带来了: - 解码速度提升1.7倍 - 长推理准确性提高6.5点 在
返回新闻流