AI 产品
Qwen3.8-27B-FP8模型在NVIDIA GH200上展示高效流式处理性能
根据一条非官方来源的推文展示,阿里巴巴的Qwen3.8-27B-FP8模型在NVIDIA GH200硬件上通过Lambda API运行。该模型能够同时处理10个真实请求的流式传输,推理过程和最终答案都可见,每个请求的最大输出长度为16K tokens,上下文长度为262K tokens,使用vLLM框架。首次流事件在10毫秒内到达,所有请求均正常完成。这提供了该模型在高效推理和流式处理方面的性能参考,但基于非官方证据,需谨慎评估。
多来源证据
事件时间线
- Twitter/X AI List好的,这很美丽。阿里巴巴Qwen Qwen3.8-27B-FP8在Lambda API的NVIDIA GH200上:10个真实请求同时流式传输,推理和最终答案可见