MoE 专家分层放置模拟器

colibrì · VRAM / RAM / NVMe 单一层级 + LRU + 学习钉住 + 预取 ← 返回项目详情

工作负载(100 token)

VRAM 容量(专家数)128
RAM 容量(专家数)2048

常驻占用

VRAM 层–
RAM 层–

真实模型对照:GLM-5.2 的稠密部分 ~9.9 GB 常驻 RAM;19,456 个路由专家 int4 共 ~370 GB 住 NVMe,按需流式。

–
VRAM 命中
–
RAM 命中
–
磁盘访问占比
–
估算 tok/s

逐 token 访问层级图(100 token × 8 层)

VRAM 命中 RAM 命中 预取吸收 NVMe 冷读
选工作负载、拉容量滑杆,点「运行」。

专家热度图(256 专家 × 使用次数,log 标度)

左端 0–23 是跨主题共享专家,右侧块状亮区是各主题专属热集——「路由有可测结构,结构可缓存」的直观呈现。真实项目的 Brain/Atlas 页面把 19,456 个专家做成了实时皮层与 3-D 星系。

机制对齐 colibrì:VRAM/RAM/NVMe 视为同一权重的三个放置层(inclusive LRU),容量只影响速度不影响语义;学习钉住对应 .coli_usage 自动 pin 热专家;预取对应 PILOT 层前路由预测(论文口径 71.6% 可预测)。成本模型(ms/访问)为教学简化,非实测。规模对照:模拟 8 层 × 256 专家,真实 GLM-5.2 为 75 层 × 256 + MTP 头。