上下文压缩实验室

复刻 Headroom 的 ContentRouter 分治语义:粘贴任意工具输出/日志/JSON,看引擎判型分流到对应压缩器——JSON 列式化(对象数组 → 表头+行值,键值全保留)、日志相邻重复折叠(×N)、代码/散文紧凑化。token 数为 len/4 近似(真实项目用 tokenizer + 自研 Kompress 模型)。

压缩流水线

真实流水线还有 CacheAligner(缓存对齐警告)与 CCR(原文缓存 + headroom_retrieve 按需取回)——这里聚焦「路由 + 分治压缩」的核心语义。

ContentRouter → — → 压缩器
—
tokens · 压缩前
—
tokens · 压缩后
—
节省
before
—
after
—
压缩后发给 LLM 的内容