Alpha Pulse New

AI 产品

Red Hat AI Hugging Face发布三个新DSpark speculators以加速推理

首次出现 8月9日 22:31·最近更新 8月10日 08:01

Red Hat AI Hugging Face上发布了三个新的DSpark speculators:Qwen3.6-35B-A3B、gemma-4-31B和GLM-5.2。DSpark通过一次性草稿整个token块然后无损验证来工作,旨在通过并行草稿加速推理。在GLM-5.2上,解码速度提升4.0倍,单请求速度从137到551 tokens/sec,峰值吞吐量提升1.57倍(1,402到2,203 tokens/sec),在数学推理上的接受长度为5.47。这些模型可以通过@vllm_project服务。

多来源证据

事件时间线

  1. 8月8日 04:11
    Twitter/X AI List
    Red Hat AI Hugging Face上的三个新DSpark speculators,用于通过并行草稿加速推理:Qwen3.6-35B-A3B、gemma-4-31B、GLM-5.2(更新)
返回新闻流