AI 产品
Muse-Glimmer 30B模型发布FP8-block量化版本
Muse-Glimmer 30B多模态模型推出新的FP8-block量化检查点,内存和磁盘占用约减少一半。量化细节:线性层采用块状FP8量化,视觉塔保持全精度,使用LLM Compressor工具进行量化,模型已部署在vllm_project上。相关评估结果即将发布。
多来源证据
事件时间线
- Twitter/X AI ListMuse-Glimmer 30B,现在支持FP8-block。我们的多模态模型量化检查点,内存和磁盘占用约减半。