GGUF 量化实验台

stable-diffusion.cpp 省显存的核心代价公式 · ← 返回项目详情

sd.cpp 用 ggml 分块量化把 FP16 权重压进小显存。选一个权重分布,切到不同量化格式,看直方图被「掰弯」多少——误差就是画质损失的上游来源。

权重分布

seed: 42

量化格式(可叠加)

格式每 32 值存储
Q8_0FP16 scale + 32×int8
Q5_1FP16 scale + FP16 min + 32×5bit
Q4_0FP16 scale + 32×4bit
误差条(对数尺度):

模拟 4096 个权重、每 32 个一块(与 ggml 块大小一致)。反量化值 = 量化值 × 块 scale。数据为合成分布,用于演示量化误差行为,非真实模型权重。