主要测试了2个模型:
lmstudio/Qwen3.8-27B-GGUF:Q6K
unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_S
2个软件:
LM studio (0.4.23 (Build 1) + llama v2.33.0)
unsloth
LM studio
由于不能开张量并行, 我这里开了会崩溃,另外 GPU 只能开到 65
lmstudio/Qwen3.8-27B-GGUF:Q6K
200k + kv q4 + ubatch-szie 256
- kv q8_0 量化
- 256k 上下文
- 开启 mtp ,draftx2
- Micro-batch Size 256
- slots x1
写2000字关于1>2的文章 ,开启 mtp 3.5 t/s
200k + kv q8 + ubatch-szie 256
- kv q8_0 量化
- 256k 上下文
- 开启 mtp ,draftx2
- Micro-batch Size 256
- slots x1
写2000字关于1>2的文章 ,开启 mtp 2.5 t/s
50k + kv q4 + ubatch-szie 256
- kv q4_0 量化
- 50k 上下文
- 开启 mtp ,draftx2
- Micro-batch Size 256
- slots x1
写2000字关于1>2的文章 ,开启 mtp 30 t/s
50k + kv q4 + ubatch-szie 512
- kv q4_0 量化
- 50k 上下文
- 开启 mtp ,draftx2
- Micro-batch Size 512
- slots x1
写2000字关于1>2的文章 ,开启 mtp 28 t/s
unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_Sa
256k + kv q4
- kv q4_0 量化
- 256k 上下文
- 开启 mtp ,draftx2
- Micro-batch Size 512
- slots x1
写2000字关于1>2的文章 ,能到 17t/s
unsloth 运行一下模型
lmstudio/Qwen3.8-27B-GGUF:Q6K
关闭视觉后,开张量
256k + kv q4 + ubatch-szie 256
- kv q4_0 量化
- 256k 上下文
- 开启 mtp ,draftx2
- Micro-batch Size 256
- slots x1
写2000字关于1>2的文章 ,
开启 mtp 能到 42 t/s
mtp+ ngram 只能到 22t/s ,可能有冲突,提示MTP无法开启, 有记录会崩
200k + kv q8 + ubatch-szie 256
- kv q8_0 量化
- 256k 上下文
- 开启 mtp ,draftx2
- Micro-batch Size 256
- slots x1
写2000字关于1>2的文章 ,
开启 mtp 能到 35 t/s
unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_S
关闭视觉后,开张量
256k + kv q4 (常用)
- kv q4_0 量化
- 256k 上下文
- 开启 mtp+ ngram ,draftx2
- Micro-batch Size 512
- slots x1 (够开到2)
写2000字关于1>2的文章 ,能到 45t/s
coding长上下文会掉到35t/s
关闭张量可以省 4g 显存。速度 35-44t/s,会崩溃,不知为啥
215k + kv q5
不知道为什么会加载到内存,速度只有 25t/s 。而且容易炸。可能模型不支持,回退到 fp16
210k + kv q8
- kv q8_0 量化
- 210k 上下文
- 开启 mtp+ ngram ,draftx2
- Micro-batch Size 512
- slots x1
写2000字关于1>2的文章 ,能到 55t/s
150k + kv f16
- kv q8_0 量化
- 150k 上下文
- 开启 mtp+ ngram ,draftx2
- Micro-batch Size 512
- slots x1
写2000字关于1>2的文章 ,能到 36t/s
但容易崩,极限能开到180k
整理成表(AI ):
| 软件环境 |
模型 |
上下文长度 |
KV 量化 |
Micro‑batch |
推测解码方式 |
速度 (t/s) |
备注 |
| LM Studio |
lmstudio/Qwen3.8-27B-GGUF:Q6K |
200k |
q4_0 |
256 |
MTP (draft×2) |
3.5 |
无张量并行,GPU 限制 65 |
| LM Studio |
lmstudio/Qwen3.8-27B-GGUF:Q6K |
200k |
q8_0 |
256 |
MTP (draft×2) |
2.5 |
同上 |
| LM Studio |
lmstudio/Qwen3.8-27B-GGUF:Q6K |
50k |
q4_0 |
256 |
MTP (draft×2) |
30 |
同上 |
| LM Studio |
lmstudio/Qwen3.8-27B-GGUF:Q6K |
50k |
q4_0 |
512 |
MTP (draft×2) |
28 |
同上 |
| LM Studio |
unsloth/Qwen3.8-27B-GGUF:UD‑Q5_K_Sa |
256k |
q4_0 |
512 |
MTP (draft×2) |
17 |
无张量并行 |
| Unsloth |
lmstudio/Qwen3.8-27B-GGUF:Q6K |
256k |
q4_0 |
256 |
MTP (draft×2) |
42 |
关闭视觉,开启张量并行 |
| Unsloth |
lmstudio/Qwen3.8-27B-GGUF:Q6K |
256k |
q4_0 |
256 |
MTP + ngram |
22 |
冲突,可能崩溃(MTP 无法开启) |
| Unsloth |
lmstudio/Qwen3.8-27B-GGUF:Q6K |
200k |
q8_0 |
256 |
MTP (draft×2) |
35 |
开启张量并行 |
| Unsloth |
unsloth/Qwen3.8-27B-GGUF:UD‑Q5_K_S |
256k |
q4_0 |
512 |
MTP + ngram |
45 |
常用配置;长上下文编码时降至 ~35 |
| Unsloth |
unsloth/Qwen3.8-27B-GGUF:UD‑Q5_K_S |
215k |
q5_0 |
— |
— |
25 |
可能模型不支持,回退 FP16,易崩溃 |
| Unsloth |
unsloth/Qwen3.8-27B-GGUF:UD‑Q5_K_S |
210k |
q8_0 |
512 |
MTP + ngram |
55 |
开启张量并行 |
| Unsloth |
unsloth/Qwen3.8-27B-GGUF:UD‑Q5_K_S |
150k |
f16 |
— |
— |
36 |
易崩溃,极限可开到 180k |
说明
- “推测解码方式”一栏中的
draft×2 表示设置 draftx2。
- 部分配置未明确给出 Micro‑batch 或具体解码方式(如 215k、150k 项),以“—”表示。
- “开启张量并行”仅针对 Unsloth 软件,LM Studio 中无法开启(开启会崩溃)。
- 数据摘自原文,个别不一致处(如标题与描述不符)已按标题取值。
简单总结如下(AI ):
软件性能差异明显:Unsloth 支持张量并行,速度远高于 LM Studio(例如同一模型 256k 上下文,LM Studio 仅 3.5 t/s,Unsloth 可达 42 t/s)。
最佳配置(速度优先):Unsloth + unsloth/Qwen3.8-27B-GGUF:UD‑Q5_K_S + 210k 上下文 + kv q8 + MTP+ngram + batch512,达到 55 t/s(但长代码会降至 35 t/s)。
常用稳定配置:256k + kv q4 + MTP+ngram + batch512,约 45 t/s,适合日常使用。
推测解码技巧:单纯 MTP 效果较好,与 ngram 同时启用可能冲突(速度降至 22 t/s 甚至崩溃)。
上下文长度影响巨大:50k 上下文在 LM Studio 可达 30 t/s,而 200k 仅 3 t/s,说明长上下文显著拖慢速度。
稳定性问题:部分高配(如 215k、150k f16)容易崩溃,极限需谨慎调整。
总体而言,推荐使用 Unsloth + unsloth 模型,开启张量并行,选择 256k kv q4 和 MTP(不加 ngram),在速度与稳定性之间取得较好平衡。
针对测试数据,我给出直接、可操作的选择建议(AI ):
1. 模型选 Q6 还是 Q5?
结论:日常首选 unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_S(Q5),追求极致质量选 Q6。
- 选 Q5(推荐):你的实测中,Q5 在 Unsloth 下 256k 上下文达 45 t/s,210k 甚至飙到 55 t/s,速度优势极其明显。虽然理论精度比 Q6 低一点,但 27B 模型用 Q5_K_S 量化损失很小,日常写作、编程几乎无感知。速度换质量,这笔交易非常划算。
- 选 Q6:仅在你非常在意模型输出的细微质量(如复杂逻辑推理、严肃学术写作),且对速度不敏感(能接受 42 t/s 左右)时选用。另外,Q6 在 256k 下比 Q5 更稳定(Q5 在 215k 会崩,Q6 在 200k 实测没崩)。
一句话:无脑先试 Q5,跑不顺或觉得质量不够再切 Q6。
2. KV 量化怎么选(Q4 / Q8 / F16)?
结论:日常无脑选 q4_0(速度最快、显存最省);追求长文本稳定性和精度选 q8_0;绝对避开 f16 和该模型上的 q5(实测会崩)。
| KV 量化 |
速度对比(参考你的数据) |
稳定性与精度 |
适用场景 |
| q4_0 |
最快(256k 达 42~45 t/s,50k 达 30 t/s) |
精度够用,显存占用最低 |
默认首选。尤其适合 200k~256k 长上下文,速度和显存平衡最好。 |
| q8_0 |
中等偏慢(200k 下 35 t/s,比 q4 慢约 15%~20%) |
精度更高,接近无损,稳定性好 |
当 q4 出现明显幻觉、重复、逻辑混乱时,换 q8 能改善。你的 210k+q8 甚至跑出 55 t/s(因上下文稍短),说明 q8 在非极限长度下表现极佳。 |
| f16 |
慢(150k 仅 36 t/s) |
精度最高,但极易崩溃,极限仅 180k |
强烈不推荐。除非你只跑极短上下文(<50k)且显存极大,否则别碰。 |
| q5(你测的 215k) |
25 t/s(慢) |
加载到内存 + 崩溃,模型疑似不支持 |
直接弃用,不要选这个量化级别。 |
???? 最终懒人配置包(直接抄作业)
- 模型:
unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_S
- KV 量化:
q4_0(先跑,若质量不满意换 q8_0)
- 上下文:256k(日常)/ 210k(追求极限速度 55 t/s)
- 其他:Unsloth 软件 + 开启张量并行 + MTP(别加 ngram,会冲突降速) + Micro-batch 512
这套组合在速度(45 t/s)、上下文长度(256k)和显存占用之间取得了最优平衡,也是你实测数据中最稳定亮眼的一组。
坑
有提示升级,不要自动升级unsloth 桌面,很坑。
升级不成功后面通过图标再也无法正常启动。
现在只能用管理员先进入虚拟环境,启动,然后再启动。