项目详情

Semantica

给 AI 决策建审计轨迹的图原生基础设施层

GitHub 地址 MIT Python 3.8+pip install semantica

更新于 2026-08-12

← 返回汇总
项目速览

一句话定位

开源版 Palantir:让 AI 的每个决策都能回答「为什么」

位于 LLM / 向量库 / Agent 框架之下的确定性基础设施层:摄取企业数据,抽取要点,构建 Context Graph 与知识图谱,在图上跑图分析与因果推理,全程内置决策溯源(W3C PROV-O)。图构建、推理、溯源均不依赖 LLM——为受监管的高风险场景(金融、医疗、法律、政府)设计的可问责 AI 底座。

项目速览

核心数据

5.3k
GitHub Stars
2,301
Commits
6,000×
节点搜索加速
12+
独立模块
技术栈

纯 Python 库 · 8 图后端(RDF×4 + LPG×4)· 8 向量后端 · W3C 标准(PROV-O / SHACL / OWL / SKOS)· React 19 + Sigma.js 可视化

当前版本

v0.6.5 安全发布:修复 5 个外部上报漏洞 + 1 个 CodeQL 标记的 ReDoS,强烈建议升级

定位边界

不是向量库也不是 Agent 框架——补上 RAG 缺失的「意义层」:决策记录、因果推理、溯源、治理

为什么存在

它解决的真实痛点

现状(Vector DB + RAG / LLM Memory)Semantica 的做法
存的是 embeddings 不是意义——无法解释、无法审计存图:实体、关系、决策都是一等公民,可遍历可查询
决策历史不存储,监管问「为什么批了这笔贷款」答不上每条决策是带生命周期的图节点,可溯源到 W3C PROV-O
多源矛盾事实被静默覆盖,知识库悄悄被污染冲突检测:值/类型/关系/时间/逻辑冲突全部标记,再解决
推理是黑盒,无法向审计员展示推理路径确定性推理引擎:Rete / Datalog / SPARQL,路径完全可解释
合规导出要自己造轮子开箱导出 PROV-O / SHACL / OWL / RDF / Parquet / Cypher / JSON-LD
为什么是 Semantica

对比:向量库 vs LLM 记忆 vs Semantica

维度Vector DB + RAGPlain LLM MemorySemantica
回忆方式Embedding 相似度Token 窗口图遍历 + 语义搜索
决策历史不存储不存储一等公民可查询对象
溯源无无W3C PROV-O,源链接
推理无黑盒前向链 / Rete / Datalog / SPARQL
冲突检测静默覆盖静默覆盖检测、标记、解决
时间旅行无无点时间图快照
合规导出无无PROV-O / SHACL / OWL / RDF
策略执行无无内置规则引擎 + SHACL
实体解析无无阻塞 + 语义去重
多 Agent 上下文各自独立各自独立单一共享智能层
🔥 架构

端到端知识管线

Ingest 摄取文件·Web·DB·流·Git·邮件 Parse·Normalize·Split实体感知 GraphRAG 分块 Extract 抽取NER·关系·事件·三元组 冲突检测 · 去重标记矛盾 · 语义合并 Knowledge Graph双时态事实 · 图分析 智能层:Ontology 本体 · Reasoning 推理 · Provenance 溯源 · Decisions 决策 SHACL/OWL 治理 · Rete/Datalog/SPARQL 推断 · W3C PROV-O 谱系 · 一等公民决策记录 多语言存储:RDF×4 + LPG×4 + 向量 输出:REST · MCP · CLI · 可视化 导出:RDF·OWL·Parquet·Cypher·JSON-LD
确定性管线=质量门禁=智能层
每个阶段都是独立可导入的模块;从摄取到导出全程确定性,无需 LLM。
🔥 核心机制

决策智能:决策不是日志行,是图节点

record_decision() 场景·理由·结果·置信度 add_causal_relationship() CAUSED · INFLUENCED · PRECEDENT_FOR trace_decision_chain() 完整因果谱系 → 根因 analyze_decision_impact() 下游影响图 find_similar_decisions() 审计输出(监管可接受格式) W3C PROV-O · CSV · JSON 示例:贷款审批链 credit_application → loan_underwriting → interest_rate CAUSED → INFLUENCED,置信度 0.88/0.94/0.99 check_decision_rules() 做策略门禁

受监管域中,每条 AI 决策必须可溯源到来源、能向审计员自证——record_decision() 生成的就是这种永久的结构化记录。

核心机制

确定性推理,不是黑盒

四个推理引擎
  • Forward chaining:前向链接,规则逐步推导
  • Rete 网络:AML 规则引擎式高效模式匹配
  • Datalog:递归逻辑查询(ancestor 递归)
  • SPARQL:RDF 图查询
可解释输出
engine.add_rule("ancestor(X, Z) :- parent(X, Y), ancestor(Y, Z).")
engine.query("ancestor(tom, ?X)")
# → [{"X": "bob"}, {"X": "ann"}, {"X": "pat"}]
explainer.generate_explanation(result)
# → Explanation(conclusion, steps=[ReasoningStep...], justification)
AML 场景→amount > $10k+country ∈ 制裁名单→flag_for_compliance_review
核心机制

冲突检测:矛盾事实被标记,而非覆盖

五类冲突
  • 值冲突:同字段不同值(role: CTO vs VP Eng)
  • 类型冲突:同实体不同类型(Person vs Org)
  • 关系冲突:同一对实体两种关系
  • 时间冲突:时间重叠但事实矛盾
  • 逻辑冲突:结论互相否定
解决策略
  • credibility_weighted:按源可信度加权(SourceTracker 跟踪)
  • most_recent:偏好最新事实
  • voting:多数一致胜出
  • 去重用 blocking + 语义聚类,合并保留溯源与合并历史
README 自认局限

ReteEngine 的 alpha 节点条件匹配器当前实现刻意从简——接入生产合规门禁前必须用真实规则集验证 match_patterns() 输出,更精细的条件求值在路线图上。

架构

存储:多语言图后端,可换不伤代码

RDF 三元组库
W3C 标准轨道
Oxigraph(内嵌,零依赖起步)· Blazegraph · Apache Jena · Eclipse RDF4J——统一 TripletStore 接口,SPARQL 查询与批量加载。
LPG 属性图
Cypher 轨道
Neo4j · FalkorDB · Apache AGE · AWS Neptune——原生标签属性图,生产部署首选持久后端。
向量后端 ×8
混合检索
FAISS · Qdrant · Weaviate · Milvus · Pinecone · PgVector · SQLite · inmemory——HybridSearch 一次召回融合 dense + sparse(RRF)。
企业数据平台
Databricks + Snowflake
Databricks:Unity Catalog + Delta Lake,PAT/OAuth M2M,表/查询摄取 + 血缘自省。Snowflake:warehouse/schema,密码/密钥对/OAuth。湖仓里的表直接变图节点,带溯源,不再导出 CSV。
性能

118,000 节点生产图上的实测

操作优化前优化后提升
节点搜索(118k 节点)24 ms0.004 ms6,000×
Embedding 缓存命中冷加载基于修订的缓存10× 吞吐
语义去重基线优化候选生成6.98×
候选生成基线阻塞策略63.6% 更快

AMD EPYC / 64 GB RAM 实测;去重与候选生成的数字来自 CHANGELOG 历史测量而非自动断言。可用 pytest tests/vector_store/test_performance_benchmarks.py -s 自测。

快速上手

5 秒验证,5 分钟跑通核心

pip install semantica
semantica doctor
# Python 3.11.9         pass
# semantica 0.6.5       pass
# faiss vector store    pass
# Config file           pass    ~/.semantica/config.yaml

python
from semantica.context import ContextGraph
graph = ContextGraph(advanced_analytics=True)
# 每条 Agent 决策变成可查询、可审计的知识节点
decision_id = graph.record_decision(
    category="vendor_selection",
    scenario="Choose cloud provider for HIPAA workload",
    reasoning="AWS offers BAA, mature HIPAA tooling, and existing team expertise",
    outcome="selected_aws", confidence=0.93,
)
chain   = graph.trace_decision_chain(decision_id)  # 因果谱系
similar = graph.find_similar_decisions("cloud vendor", max_results=5)  # 先例
impact  = graph.analyze_decision_impact(decision_id)  # 影响图
生态

接入面:从编辑器到 Agent 框架

开发者接口
  • MCP server:30 秒接入,11 个工具(extract_entities / record_decision / find_precedents / get_causal_chain / run_reasoning / get_graph_analytics / export_graph…)
  • REST API:enrich / graph / decisions / reasoning / provenance / ontology / search…
  • CLI:22 个命令组(ingest · kg · reason · decision · provenance · explorer…)+ semantica 启动仪表盘
集成矩阵
  • 编辑器插件:Claude Code / Cursor / Codex / Windsurf / Cline / Continue / VS Code / OpenClaw
  • Agent 框架:Agno 原生共享上下文——多 Agent 读写同一张图,零拷贝零同步
  • LLM provider:20+(OpenAI / Anthropic / Gemini / Mistral / Llama / Groq / Bedrock / Ollama / DeepSeek…)经 semantica.llms + LiteLLM
适用场景

为高风险领域而生

金融

贷款承销审计轨迹、欺诈检测、AML 合规、监管风险知识图

医疗

临床决策支持、药物相互作用图、患者安全审计轨迹

法律

证据支撑研究、合同分析、判例推理、特权追踪

政府与国防

政策决策记录、机密信息治理、全自托管不出内网

执法

案件关联、证据溯源链、经受法律质询的调查知识图

网络安全

威胁归因、事件响应时间线、IOC 溯源追踪

风险提示

需要警惕

路线图

能力全景

知识层
  • Context Graphs 上下文图
  • 时间智能:双时态事实 + Allen 区间代数(13 关系)+ 点时间快照
  • 距离智能:N×N 语义距离矩阵 + ego 模式
推理与治理
  • Rete / Datalog / SPARQL / 前向链接
  • 本体 Hub:SHACL Studio + 可视化编辑器 + OWL 生成 + SKOS 词汇
  • 图分析:中心性 / 社区 / 链接预测 / 最短路
管线与输出
  • Pipeline DSL:声明式并行管线
  • 导出:RDF / OWL / Parquet / Cypher / JSON-LD / HTML 报告
  • 可视化:力导向图 / 社区图 / 时间线(React 19 + Sigma.js)
在线体验

Playground:Semantica Lab

把两个旗舰确定性机制做成可玩实验室——冲突检测(输入两条矛盾记录,实时跑值/类型/时间/逻辑冲突规则,试四种解决策略)与 AML 规则引擎(交易流水过 Rete 规则,命中即标记)。零 LLM,纯确定性逻辑。

⚡ 打开 Playground
Conflict Lab

矛盾事实 → 标记 → 解决策略对比

AML 规则引擎

交易过规则 → 命中即标记

PROV-O 溯源

每个事实可追溯来源

潜力评估

未来空间

「AI 可问责性」是 LLM 进企业的必经关:监管要求 AI 决策可解释、可审计,且数据不能出内网——Semantica 精准卡在这个交叉点,且全部用 W3C 开放标准(PROV-O / SHACL / OWL)构建,天然对标企业合规采购。6,000× 的性能提升说明工程细节已到位。若能在安全基线(v0.6.5 修复后)之上建立企业信任,并持续打磨 Rete 等推理引擎,它有机会成为受监管行业 AI 落地的事实标准底座。风险在于叙事宏大而 5.3k stars 尚属早期,需看企业市场验证。


上一个
Paperclip
下一个
DSA 股票智能分析
1 / 18