AI 产品
英伟达研究人员推出新型Transformer变体,解码速度提升1.7倍
英伟达研究人员开发了一种新的Transformer架构变体。通过在注意力层添加第四个投影,用于预测下一层所需信息,这一改进实现了1.7倍的解码速度提升和6.5点的长推理准确性改善。该研究旨在解决当前Transformer架构中KV缓存增长导致的内存和性能问题,属于已确认事实;讨论部分涉及sparse attention等当前技术的局限性,但摘要基于证据中的核心事实。
多来源证据
事件时间线
- Twitter/X AI List英伟达研究人员构建新型Transformer变体。 对层的一个小改动带来了: - 解码速度提升1.7倍 - 长推理准确性提高6.5点 在