开发工具
32G 显存 Qwen3.8-27B-GGUF 配置分享
本文使用 V100-SXM2-16GB 双卡运行: ## 起始配置 基础配置从 UD-IQ4_XS + 256k context + Q4 KV + mmproj 开始 这个配置是我感觉目前最理想的配置: - 能跑满 256k 上下文,真正可以用在编码/生产场景了 - prefill 速度在 300-400tok/s ,decode 速度在 30-60tok/s - 默认就是 4 并发,再往上调意义不大,4 并发的 decode 就只剩。当前摘要基于 1 条公开证据,并区分官方信息与社区讨论。
多来源证据
事件时间线
- V2EX AI 用户与重大信号32G 显存 Qwen3.8-27B-GGUF 配置分享