AI 产品
vLLM 支持自适应投机验证,优化性能
vLLM 现在引入自适应验证功能,用户只需设置一次草稿长度,系统会根据每一步验证动态调整。在 DeepSeek-V4-Pro-0813 模型上,7 个 token 草稿的首个 token 验证通过率超过 70%,末尾 token 不足 10%。通过启用 enable_adaptive_verification 配置,从并发 1 到 256 在 8×B300 上均能保持帕累托前沿,实现低负载时使用长草稿、高负载时使用短草稿。此功能已发布在 main 分支,支持 DSpark 与 Flash Attention 或 DSV4 注意力。更多后端和模型正在开发中,感谢相关贡献者和 deepseek_ai 提供的工具。
多来源证据
事件时间线
- Twitter/X AI List六周前,在 vLLM 中服务 DSpark 意味着为流量选择一个草稿长度并一直使用。现在你只需设置一次该长度,vLLM 会决定验证多少