项目详情

Laya

Jev 的开源反击战:33ms 非自回归 System 1 决策引擎,100+ 语言,Apache-2.0

NandhaKishorM/laya Apache-2.0 Python · ModernBERT 1.49k stars / 2 天 2026-09-18 建仓

分类:AI 模型 · System One · 开源平替 · ← 返回汇总

项目速览

一句话定位

别人把你的论文变成产品,你就把产品变回开源

多语言非自回归决策引擎:对任意状态(文本/邮件/工单/JSON)在单次前向传播里回答类型化问题(choice / score / noul),带校准置信度,T4 上 33ms 一题、7.2ms 批量。三个检查点 + Router 自动按语言分发。它是对 TypeSafe Jev(闭源 API)的完整开源回应——论文、权重、数据、微调 notebook 全部开放。适合需要把「快判断」嵌进代码路径又不想被 API 锁定的团队。

不生成文本 → 无幻觉无解析 pip install laya 即用 HF 权重 + Demo Space
项目速览

核心数据

1.49k
Stars(2 天)
33ms
单题延迟(T4 实测)
7.2ms
批量每题延迟
421M
最大检查点参数(ModernBERT-large)
100+
多语言检查点语言数
2
前置 arXiv 论文(2503.23303 / 2510.01237)

GitHub API 采集于 2026-09-20 · 2026-09-18 建仓 · Convai Innovations 开发 · dev.to 长文记录完整来龙去脉

起源故事

十八个月的「既视感」

2025.03 · 先造出来

Nandha Kishor 发表 arXiv:2503.23303:非自回归 + RL 输出转化概率,开源权重、数据集、PyPI 包——垂直场景(销售对话),无人问津。

2025.09 · 铺好理论

第二篇 arXiv:2510.01237 给出 schema 化决策 + 强化学习的完整框架——比 Jev 发布早整整一年。

2026.09 · 正名之战

TypeSafe Jev 以「突破」姿态发布同概念(无论文/无权重/无数据)。作者发文《I Built Non-Autoregressive Decision Models a Year Ago…》,三天后 laya 上线。

时间线本身就是故事:09-15 Jev 发布 → 09-17 awesome-jev → 09-18 laya 开源反击。不是蹭热度——是把提前一年半的工作重新对齐到新坐标系,然后全部开源。

🔥 核心页

三检查点 + Router:一次调用,自动选脑

任意状态 + 类型化问题 文本 / 邮件 / 工单 / JSON choice · score · noul Router 亚毫秒脚本/语言检测 每次调用附路由元数据与理由 .route() 可零前向预检 laya(英语) ModernBERT-large · 421M · 512ctx 英语最强:MASSIVE-en 0.783 / XNLI-en 0.860 英语外塌陷:51 语言仅 23 个过 3×随机线 laya-multilingual mmBERT-base · 322M · 1024ctx 100+ 语言 · 51 语言 45 个可用 · 快 2× 英语略弱(0.657)——所以需要 Router laya-typed-decisions ModernBERT-large · 1024ctx 在 typed-decisions 基准上微调 基准 0.766 · 超过 Jev 公布的 0.727 路由理由(原样来自 API 返回) 'reason': 'non-Latin script (devanagari, 100% of letters); the English checkpoint cannot read it'
三个 HF 检查点 Router(语言分诊) 支持 model="typed-decisions" 显式覆盖
使用范式

三原语:把「判断」做成类型系统

  • choice:从 criteria 字典里选一个(部门路由/意图分类),返回选项 + 概率分布
  • score:在有序量表上打分(紧急度 0-3),返回期望分值 + 各档概率
  • noul:布尔问题(是否钓鱼/是否威胁退订),返回校准的 P(true)
  • 单次前向全答完:一封邮件同时问 4 个问题,一个 forward pass,无 token 生成
# pip install laya
from laya import Router
router = Router(preload=True)

questions = {
  "department": {"type": "choice",
    "criteria": {"billing": "...", "technical": "..."}},
  "churn_risk":  {"type": "noul",
    "instructions": "威胁退订吗?"}}

res = router.predict(email_state, questions)
# -> billing (confidence: 0.94)
# -> routing: {'model': 'english', ...}
🔥 核心页

诚实基准:赢在微调,输在裸奔

laya-typed-decisions(微调) 0.766 —— 全场最佳,超 teacher 上限 teacher 自一致上限 0.735 Jev 1.13.0(公布值) 0.727 多数类基线 0.461 laya 基座(零样本) 0.362 —— 低于多数类基线! laya-multilingual 基座 0.342 随机 0.318
微调后(README 主推) 对照(teacher/Jev/多数类) 基座零样本(接近随机) 400 案例 · 2000 决策 · 4 工作流 · T4

微调版同时拿下:Brier 好 2.4×、score MAE 好 1.6×、四工作流全胜;仍输两项——soft accuracy 0.471 vs 0.580、ECE 0.213 vs 0.144。

工程细节

README 里的「Honest Limits」:少见的自曝清单

这份自曝比大多数论文的 limitation 章节诚实——每条边界都配了解法,把「什么时候不该用我」写成了文档。

核心机制

微调才是主菜:Kaggle 白嫖级训练闭环

  • 一条 notebook 全流程:建数据 → RLCD 训练(proper scoring rule 奖励 + GRPO 风格策略梯度)→ 配温度 → 评测 → 推 HF Hub
  • 免费算力可跑:Kaggle 2×T4,~3 万问题 4 epoch 约 4–5 小时
  • 收益巨大:同一基准 0.36 → 0.766,一举超过 teacher 上限与 Jev 公布值
  • 对比闭源:Jev 无公开微调路径——laya 的差异化恰恰是「把它变成你的模型」的权利
RLCD 在做什么

用严格proper scoring rule当奖励:概率分布报得诚实(说 70% 就真 70% 准)才能拿最高分——校准不是后处理,是训练目标本身。

呼应 Jev 的 RLCD 叙事:TypeSafe 未公开细节,laya 把论文+代码+数据一起摆了出来。

在线体验

亲手玩一玩 Router 分诊

粘贴任意语言的文本(或点预设:英语邮件、印地语退订、德语投诉、高棉语……),看 Router 如何在前向传播之前决定派哪个检查点、给出什么理由——以及 Khmer 惨案为什么要靠路由而不是置信度来兜底。

▶ 打开 Router 分诊台

脚本检测 + 语言启发式规则 1:1 复刻 README 文档化语义,全真值表验证 + node 对拍通过。

生态位

vs Jev:同一天平的两端

维度TypeSafe Jevlaya
形态闭源 API(early access)Apache-2.0 权重 + pip 包 + 自托管
延迟公布 ~150msT4 实测 33ms(约 4×)
成本$0.042/MTok 输入自己的 GPU,批量 7.2ms/题
基准公布 0.727微调后 0.766(基座近随机,需自训)
透明度无论文/无权重/无数据2 篇 arXiv + HF 三检查点 + 微调 notebook + 数据集
成熟度公司化运营、官网文档齐2 天仓库、README 极诚实但基建年轻

读法:Jev 卖「开箱即用的闭源决策」;laya 卖「变成你自己的决策模型的权利」——为垂直域微调后才是完全体。

适用场景 / 风险提示

谁该用,需要警惕什么

适合
  • 高频决策路径:邮件分诊、工单路由、护栏检测——毫秒级 + 免 API 账单
  • 多语言产品:100+ 语言覆盖 + Router 自动分诊
  • 想微调自有模型的人:领域数据 + 免费 Kaggle 算力即可拥有专用决策引擎
  • System One 研究者:论文、RLCD 实现、基准全开源,可复现可改进
警惕
  • 别零样本上生产:基座低于多数类基线,不微调就是随机器
  • 校准自理:出厂过自信,multilingual 连温度都没配
  • 2 天仓库:16 个 open issue,API 稳定性未经过时间检验
  • 单人 + 小公司:Convai Innovations 主导,长期投入取决于社区 uptake
  • 长上下文/高基数:77 选项场景需手调预算,别拿默认配置硬冲
潜力评估

未来空间

两天 1.49k stars 证明「Jev 开源平替」的叙事有真实需求。它的护城河不是模型本身(421M encoder 谁都能造),而是论文+权重+数据+微调链路的全开,以及那篇把学术优先权说清楚的故事文。若 System One 品类成立,laya 就是它的 Llama 时刻雏形。评分 8:概念验证扎实、基准诚实,扣分在基座裸奔与项目年龄。


上一个
Awesome Jev
下一个
MemPalace
1 / 13