项目详情
Semantica
给 AI 决策建审计轨迹的图原生基础设施层
GitHub 地址
MIT
Python 3.8+pip install semantica
更新于 2026-08-12
← 返回汇总
项目速览
一句话定位
开源版 Palantir:让 AI 的每个决策都能回答「为什么」
位于 LLM / 向量库 / Agent 框架之下的确定性基础设施层:摄取企业数据,抽取要点,构建 Context Graph 与知识图谱,在图上跑图分析与因果推理,全程内置决策溯源(W3C PROV-O)。图构建、推理、溯源均不依赖 LLM——为受监管的高风险场景(金融、医疗、法律、政府)设计的可问责 AI 底座。
项目速览
核心数据
技术栈
纯 Python 库 · 8 图后端(RDF×4 + LPG×4)· 8 向量后端 · W3C 标准(PROV-O / SHACL / OWL / SKOS)· React 19 + Sigma.js 可视化
当前版本
v0.6.5 安全发布:修复 5 个外部上报漏洞 + 1 个 CodeQL 标记的 ReDoS,强烈建议升级
定位边界
不是向量库也不是 Agent 框架——补上 RAG 缺失的「意义层」:决策记录、因果推理、溯源、治理
为什么存在
它解决的真实痛点
| 现状(Vector DB + RAG / LLM Memory) | Semantica 的做法 |
| 存的是 embeddings 不是意义——无法解释、无法审计 | 存图:实体、关系、决策都是一等公民,可遍历可查询 |
| 决策历史不存储,监管问「为什么批了这笔贷款」答不上 | 每条决策是带生命周期的图节点,可溯源到 W3C PROV-O |
| 多源矛盾事实被静默覆盖,知识库悄悄被污染 | 冲突检测:值/类型/关系/时间/逻辑冲突全部标记,再解决 |
| 推理是黑盒,无法向审计员展示推理路径 | 确定性推理引擎:Rete / Datalog / SPARQL,路径完全可解释 |
| 合规导出要自己造轮子 | 开箱导出 PROV-O / SHACL / OWL / RDF / Parquet / Cypher / JSON-LD |
为什么是 Semantica
对比:向量库 vs LLM 记忆 vs Semantica
| 维度 | Vector DB + RAG | Plain LLM Memory | Semantica |
| 回忆方式 | Embedding 相似度 | Token 窗口 | 图遍历 + 语义搜索 |
| 决策历史 | 不存储 | 不存储 | 一等公民可查询对象 |
| 溯源 | 无 | 无 | W3C PROV-O,源链接 |
| 推理 | 无 | 黑盒 | 前向链 / Rete / Datalog / SPARQL |
| 冲突检测 | 静默覆盖 | 静默覆盖 | 检测、标记、解决 |
| 时间旅行 | 无 | 无 | 点时间图快照 |
| 合规导出 | 无 | 无 | PROV-O / SHACL / OWL / RDF |
| 策略执行 | 无 | 无 | 内置规则引擎 + SHACL |
| 实体解析 | 无 | 无 | 阻塞 + 语义去重 |
| 多 Agent 上下文 | 各自独立 | 各自独立 | 单一共享智能层 |
🔥 架构
端到端知识管线
确定性管线=质量门禁=智能层
每个阶段都是独立可导入的模块;从摄取到导出全程确定性,无需 LLM。
🔥 核心机制
决策智能:决策不是日志行,是图节点
受监管域中,每条 AI 决策必须可溯源到来源、能向审计员自证——record_decision() 生成的就是这种永久的结构化记录。
核心机制
确定性推理,不是黑盒
四个推理引擎
- Forward chaining:前向链接,规则逐步推导
- Rete 网络:AML 规则引擎式高效模式匹配
- Datalog:递归逻辑查询(ancestor 递归)
- SPARQL:RDF 图查询
可解释输出
engine.add_rule("ancestor(X, Z) :- parent(X, Y), ancestor(Y, Z).")
engine.query("ancestor(tom, ?X)")
# → [{"X": "bob"}, {"X": "ann"}, {"X": "pat"}]
explainer.generate_explanation(result)
# → Explanation(conclusion, steps=[ReasoningStep...], justification)
AML 场景→amount > $10k+country ∈ 制裁名单→flag_for_compliance_review
核心机制
冲突检测:矛盾事实被标记,而非覆盖
五类冲突
- 值冲突:同字段不同值(role: CTO vs VP Eng)
- 类型冲突:同实体不同类型(Person vs Org)
- 关系冲突:同一对实体两种关系
- 时间冲突:时间重叠但事实矛盾
- 逻辑冲突:结论互相否定
解决策略
- credibility_weighted:按源可信度加权(SourceTracker 跟踪)
- most_recent:偏好最新事实
- voting:多数一致胜出
- 去重用 blocking + 语义聚类,合并保留溯源与合并历史
README 自认局限
ReteEngine 的 alpha 节点条件匹配器当前实现刻意从简——接入生产合规门禁前必须用真实规则集验证 match_patterns() 输出,更精细的条件求值在路线图上。
架构
存储:多语言图后端,可换不伤代码
RDF 三元组库
W3C 标准轨道
Oxigraph(内嵌,零依赖起步)· Blazegraph · Apache Jena · Eclipse RDF4J——统一 TripletStore 接口,SPARQL 查询与批量加载。
LPG 属性图
Cypher 轨道
Neo4j · FalkorDB · Apache AGE · AWS Neptune——原生标签属性图,生产部署首选持久后端。
向量后端 ×8
混合检索
FAISS · Qdrant · Weaviate · Milvus · Pinecone · PgVector · SQLite · inmemory——HybridSearch 一次召回融合 dense + sparse(RRF)。
企业数据平台
Databricks + Snowflake
Databricks:Unity Catalog + Delta Lake,PAT/OAuth M2M,表/查询摄取 + 血缘自省。Snowflake:warehouse/schema,密码/密钥对/OAuth。湖仓里的表直接变图节点,带溯源,不再导出 CSV。
性能
118,000 节点生产图上的实测
| 操作 | 优化前 | 优化后 | 提升 |
| 节点搜索(118k 节点) | 24 ms | 0.004 ms | 6,000× |
| Embedding 缓存命中 | 冷加载 | 基于修订的缓存 | 10× 吞吐 |
| 语义去重 | 基线 | 优化候选生成 | 6.98× |
| 候选生成 | 基线 | 阻塞策略 | 63.6% 更快 |
AMD EPYC / 64 GB RAM 实测;去重与候选生成的数字来自 CHANGELOG 历史测量而非自动断言。可用 pytest tests/vector_store/test_performance_benchmarks.py -s 自测。
快速上手
5 秒验证,5 分钟跑通核心
pip install semantica
semantica doctor
# Python 3.11.9 pass
# semantica 0.6.5 pass
# faiss vector store pass
# Config file pass ~/.semantica/config.yaml
python
from semantica.context import ContextGraph
graph = ContextGraph(advanced_analytics=True)
# 每条 Agent 决策变成可查询、可审计的知识节点
decision_id = graph.record_decision(
category="vendor_selection",
scenario="Choose cloud provider for HIPAA workload",
reasoning="AWS offers BAA, mature HIPAA tooling, and existing team expertise",
outcome="selected_aws", confidence=0.93,
)
chain = graph.trace_decision_chain(decision_id) # 因果谱系
similar = graph.find_similar_decisions("cloud vendor", max_results=5) # 先例
impact = graph.analyze_decision_impact(decision_id) # 影响图
生态
接入面:从编辑器到 Agent 框架
开发者接口
- MCP server:30 秒接入,11 个工具(extract_entities / record_decision / find_precedents / get_causal_chain / run_reasoning / get_graph_analytics / export_graph…)
- REST API:enrich / graph / decisions / reasoning / provenance / ontology / search…
- CLI:22 个命令组(ingest · kg · reason · decision · provenance · explorer…)+
semantica 启动仪表盘
集成矩阵
- 编辑器插件:Claude Code / Cursor / Codex / Windsurf / Cline / Continue / VS Code / OpenClaw
- Agent 框架:Agno 原生共享上下文——多 Agent 读写同一张图,零拷贝零同步
- LLM provider:20+(OpenAI / Anthropic / Gemini / Mistral / Llama / Groq / Bedrock / Ollama / DeepSeek…)经 semantica.llms + LiteLLM
适用场景
为高风险领域而生
金融
贷款承销审计轨迹、欺诈检测、AML 合规、监管风险知识图
医疗
临床决策支持、药物相互作用图、患者安全审计轨迹
政府与国防
政策决策记录、机密信息治理、全自托管不出内网
执法
案件关联、证据溯源链、经受法律质询的调查知识图
网络安全
威胁归因、事件响应时间线、IOC 溯源追踪
风险提示
需要警惕
- v0.6.5 刚修 6 个安全漏洞:Explorer API 全路由此前缺认证(Critical,现要求 SEMANTICA_API_KEY 且无配置时 503 失败关闭)、Cypher/SPARQL 注入(Critical)、SSRF 重定向绕过(High)、WebSocket Origin 校验缺失。自托管务必升级到 ≥0.6.5 并配好密钥
- Rete 条件匹配器自认不成熟:README 明确提示接入生产合规门禁前需自行验证 match_patterns() 输出
- 「开源 Palantir」叙事 vs 现状:5.3k stars 距 Palantir 级别的企业信任还有距离,赛道对手(Graphiti、Neo4j+LLM 栈)也在抢同一生态位
- 模块多、依赖面宽:12+ 模块 × 8 图后端 × 8 向量后端 × 20+ provider,[all] 安装体积与攻击面都大,按需 extras 安装是必修课
- 推理确定性是卖点也是局限:规则引擎完全确定,意味着复杂业务规则要自己建模;LLM 抽取质量仍影响图质量
路线图
能力全景
知识层
- Context Graphs 上下文图
- 时间智能:双时态事实 + Allen 区间代数(13 关系)+ 点时间快照
- 距离智能:N×N 语义距离矩阵 + ego 模式
推理与治理
- Rete / Datalog / SPARQL / 前向链接
- 本体 Hub:SHACL Studio + 可视化编辑器 + OWL 生成 + SKOS 词汇
- 图分析:中心性 / 社区 / 链接预测 / 最短路
管线与输出
- Pipeline DSL:声明式并行管线
- 导出:RDF / OWL / Parquet / Cypher / JSON-LD / HTML 报告
- 可视化:力导向图 / 社区图 / 时间线(React 19 + Sigma.js)
在线体验
Playground:Semantica Lab
把两个旗舰确定性机制做成可玩实验室——冲突检测(输入两条矛盾记录,实时跑值/类型/时间/逻辑冲突规则,试四种解决策略)与 AML 规则引擎(交易流水过 Rete 规则,命中即标记)。零 LLM,纯确定性逻辑。
Conflict Lab
矛盾事实 → 标记 → 解决策略对比
潜力评估
未来空间
「AI 可问责性」是 LLM 进企业的必经关:监管要求 AI 决策可解释、可审计,且数据不能出内网——Semantica 精准卡在这个交叉点,且全部用 W3C 开放标准(PROV-O / SHACL / OWL)构建,天然对标企业合规采购。6,000× 的性能提升说明工程细节已到位。若能在安全基线(v0.6.5 修复后)之上建立企业信任,并持续打磨 Rete 等推理引擎,它有机会成为受监管行业 AI 落地的事实标准底座。风险在于叙事宏大而 5.3k stars 尚属早期,需看企业市场验证。