原始数据到自进化智能,实时:没有向量库的 agentic 搜索引擎
更新于 2026-09-17 · GitHub 数据采集同日 · 论文 arXiv:2608.16185
← 返回汇总丢掉向量库,让 LLM 拿着预算直接在原始文件上做 agentic 检索,搜索结果沉淀为可复用的知识簇
ModelScope(阿里)出品的实时搜索引擎:ripgrep-all 无索引扫原始文件,LENS 框架在 token 预算内做证据探索,每次搜索产出 KnowledgeCluster 并随使用自进化(复用 / 合并 / meta-cluster)。适合本地海量文档问答、给 Agent 装搜索能力(MCP)、数据频繁变化无法建静态索引的场景。
2025-12-30 建仓 · v0.1.0(2026-08-25)· 143 forks · 32 open issues · 最后 push 2026-09-05 · 30 MB 仓库 · Trendshift 榜单项目
把富文本压进固定维向量需要重型预处理与小时级索引流水线——建索引本身就是成本中心。
数据是流不是快照;向量库在数据变更那一刻就过时,只能整批重灌。
向量近似匹配返回的是「相似方向」,不是可追溯的原文证据区;信息有损。
Sirchmunk 的答案:不预处理、不建静态索引——文件即索引,检索时才决定读什么。
| 维度 | 传统 RAG | Sirchmunk |
|---|---|---|
| 搭建成本 | VectorDB + GraphDB + 复杂解析器 | 零基础设施:直接对数据检索,无向量孤岛 |
| 数据新鲜度 | 过时(批次重索引) | 即时动态:自进化索引反映实时变化 |
| 可扩展性 | 线性成本增长 | 极低 RAM/CPU(Docker 示例限 2G 内存) |
| 准确性 | 近似向量匹配 | 确定性 + 上下文:混合逻辑保语义精度 |
| 工作流 | 复杂 ETL 管道 | 丢进去就搜(drop-and-search)零配置 |
注意:此表来自官方 README,带有营销立场;真实取舍见「风险」页——每次 DEEP 搜索的 LLM 调用成本是隐藏变量。
论文把 in-context search 重构为「潜在证据空间上的预算化探索」:证据是潜在的、随查询变化的——先形成低成本先验,再把昂贵的 LLM 调用只花在最值得观测的地方。
贪心搜索:两级关键词级联 + 上下文窗口采样。2 次 LLM 调用,2–5 秒。日常问答默认档。
文件级去重 + 动态分数剪枝;作用域感知的簇复用。
完整 LENS:10–30 秒,预算化证据探索 + 富 Markdown 报告(含引用与模式提炼)。
默认搜索 token 预算 128K;SSE 流式日志可观测全过程。
纯文件名定位,不读内容——最快的「我的文件在哪」。
另有 sirchmunk compile(Beta):离线预编译层级树索引 + 知识簇,FAST/DEEP 精度加成,--lint 体检 --fix 自修。
# 初始化时自动检查并安装 ripgrep-all / ripgrep result = await searcher.search(query="How does transformer attention work?", paths=["/path/to/docs"], mode="DEEP")
| 字段 | 含义 |
|---|---|
Evidences | 溯源证据区:文件路径 + 摘要 + 原文 |
Content | LLM 综合的 Markdown(含引用) |
Patterns | 从证据提炼的 3–5 条设计原则/机制 |
Confidence | 共识可靠度 [0,1] |
Queries | 贡献/复用过此簇的历史查询(FIFO ≤5) |
Hotness | 查询频度 + 新近度的活跃分 |
Embedding | 384 维向量——由查询累计派生 |
每次搜索不白做:结果变成结构化、可复用、会成长的知识单元。
C{sha256},可增量恢复meta-cluster 的意义:把散点知识图整流为局部连通的语义图,LLM 用子簇查询集合成更高层抽象,降低后续搜索复杂度。
| 方式 | 说明 |
|---|---|
| Python SDK | AgenticSearch(llm=OpenAIChat(...)).search(query, paths, mode),异步原生 |
| CLI | sirchmunk init / serve / search / compile / mcp / web 六组命令 |
| MCP Server | stdio / Streamable HTTP 双传输,Claude Desktop、Cursor、MCP Inspector 开箱即用 |
| Web UI | Next.js 14 + Tailwind:聊天(流式日志)、知识图谱可视化(簇 + 生命周期)、系统监控三视图 |
| HTTP API | POST /api/v1/search(JSON)与 /search/stream(SSE 实时日志);并发由 SIRCHMUNK_MAX_CONCURRENT_SEARCHES 控制 |
| Docker | 阿里云镜像(北京/美西),amd64 + arm64;示例配置 4 核 / 2G 内存即可跑 |
| OpenClaw skill | 上架 ClawHub,任何 OpenClaw 兼容 agent 可用自然语言搜本地文件 |
run_sampling.py create 生成固定分层样本 ID + 校验和——论文面结果必须用冻结 ID + 确定性设置,跨系统同样本bm25、bm25_rag(定长分块)、hybrid_rag(BM25+dense RRF 融合)、react(工具调用 agent)、lightrag_v136 全模式、graphrag(预计算导入)lens_no_prior / lens_no_seq / lens_no_reuse——分别拆掉先验、顺序推理、簇复用,验证各层贡献| 版本 | 时间 | 里程碑 |
|---|---|---|
| v0.0.1 | 2026-01 | 首发:核心搜索 + Web UI |
| v0.0.2 | 02-05 | MCP 集成、CLI、KnowledgeCluster DuckDB 持久化 + 复用 |
| v0.0.3 | 02-12 | glob 过滤、SHA256 确定性簇 ID、「预算证据探索」文档 |
| v0.0.4 | 02-27 | Docker 一等公民、FAST 模式(2 LLM 调用)、Windows 兼容 |
| v0.0.5–6 | 03 | 统一 Search API、多轮对话 + 查询重写、跨语言检索、SSE 流式、OpenClaw skill |
| v0.0.7 | 04 | C/S 加固:allowed_paths + 符号链接检测、IP 限流、审计日志、远程上传 |
| v0.0.8 | 06 | sirchmunk compile(Beta):离线树索引 + 知识簇预编译 |
| v0.0.9 | 07 | KnowledgeEvolver:四阶段运行时演化 + Leiden meta-cluster + 知识图谱可视化 |
| v0.1.0 | 08-25 | 里程碑版本:体系成熟 |
亲手复现 KnowledgeCluster 生命周期——输入查询,看 Phase 0 复用判定(cos ≥ 0.85 零 LLM 成本)、簇的诞生与语义边、周期演化的同化合并与 meta-cluster 包络。三个阈值滑块可调,日志实时解释每一步决策;观察「缓存命中 vs 全搜索」的成本分野。