「64M 参数怎么构成?」——拖动结构配置(d_model / 层数 / 注意力头 / MoE 专家),实时看 embedding、注意力(GQA QKVO)、FFN(SwiGLU)的参数分解与总量、激活参数、fp16 显存。预置 minimind 全系官方配置一键对照(公式已与 64M/26M/104M/198M-A64M 四个官方数字对拍命中)。
公式(Qwen3 风格):注意力每层 = Wq(d×d) + Wk/Wv(d×2·kv_head_dim) + Wo(d×d);FFN 每专家 = 3·d·h(SwiGLU gate/up/down);embedding = vocab×d(tie 权重);MoE 激活参数 = 每层只算 top-k 个专家。