AI 产品
推测解码中利用拒绝token的免费训练信号以优化性能
推测解码是一种加速语言模型推理的技术,每一步中目标模型在被拒绝token上的 logits 计算后通常被丢弃,这提供了免费的在线训练信号。证据显示,推测解码的加速效果依赖于接受率(α)和前瞻性(K),α的微小下降(如0.10)会导致吞吐量损失约25%。核心问题是草稿模型在通用数据集(如ShareGPT或UltraChat)上训练,但实际流量特定(如语音代理、编码代理),导致分布不匹配,α随时间下降。解决方案是从实时流量中持续训练草稿模型,以匹配流量分布,从而维持加速效果。这涉及基于公式的事实描述和提出的实际部署讨论。
多来源证据
事件时间线
- Twitter/X AI List每个推测解码步骤计算目标模型在被拒绝token上的 logits,然后丢弃它们。这是一个免费的在线训练信号,位于