真实模型对照:GLM-5.2 的稠密部分 ~9.9 GB 常驻 RAM;19,456 个路由专家 int4 共 ~370 GB 住 NVMe,按需流式。
左端 0–23 是跨主题共享专家,右侧块状亮区是各主题专属热集——「路由有可测结构,结构可缓存」的直观呈现。真实项目的 Brain/Atlas 页面把 19,456 个专家做成了实时皮层与 3-D 星系。