Alpha Pulse New

AI 产品

Qwen3.8-27B-FP8模型在NVIDIA GH200上展示高效流式处理性能

首次出现 8月15日 04:01·最近更新 8月15日 04:01

根据一条非官方来源的推文展示,阿里巴巴的Qwen3.8-27B-FP8模型在NVIDIA GH200硬件上通过Lambda API运行。该模型能够同时处理10个真实请求的流式传输,推理过程和最终答案都可见,每个请求的最大输出长度为16K tokens,上下文长度为262K tokens,使用vLLM框架。首次流事件在10毫秒内到达,所有请求均正常完成。这提供了该模型在高效推理和流式处理方面的性能参考,但基于非官方证据,需谨慎评估。

多来源证据

事件时间线

  1. 8月15日 00:40
    Twitter/X AI List
    好的,这很美丽。阿里巴巴Qwen Qwen3.8-27B-FP8在Lambda API的NVIDIA GH200上:10个真实请求同时流式传输,推理和最终答案可见
返回新闻流