sd.cpp 用 ggml 分块量化把 FP16 权重压进小显存。选一个权重分布,切到不同量化格式,看直方图被「掰弯」多少——误差就是画质损失的上游来源。
| 格式 | 每 32 值存储 |
|---|---|
| Q8_0 | FP16 scale + 32×int8 |
| Q5_1 | FP16 scale + FP16 min + 32×5bit |
| Q4_0 | FP16 scale + 32×4bit |
模拟 4096 个权重、每 32 个一块(与 ggml 块大小一致)。反量化值 = 量化值 × 块 scale。数据为合成分布,用于演示量化误差行为,非真实模型权重。