LLM 参数解剖器

「64M 参数怎么构成?」——拖动结构配置(d_model / 层数 / 注意力头 / MoE 专家),实时看 embedding、注意力(GQA QKVO)、FFN(SwiGLU)的参数分解与总量、激活参数、fp16 显存。预置 minimind 全系官方配置一键对照(公式已与 64M/26M/104M/198M-A64M 四个官方数字对拍命中)。

结构配置台

公式(Qwen3 风格):注意力每层 = Wq(d×d) + Wk/Wv(d×2·kv_head_dim) + Wo(d×d);FFN 每专家 = 3·d·h(SwiGLU gate/up/down);embedding = vocab×d(tie 权重);MoE 激活参数 = 每层只算 top-k 个专家。

768
8
8
4
3.17×
1 (Dense)

—
总参数
—
激活参数
—
fp16 权重显存
参数分解
Embedding Attention (GQA) FFN / Experts MoE Router