项目详情
Laya
Jev 的开源反击战:33ms 非自回归 System 1 决策引擎,100+ 语言,Apache-2.0
分类:AI 模型 · System One · 开源平替 · ← 返回汇总
项目速览
一句话定位
别人把你的论文变成产品,你就把产品变回开源
多语言非自回归决策引擎:对任意状态(文本/邮件/工单/JSON)在单次前向传播里回答类型化问题(choice / score / noul),带校准置信度,T4 上 33ms 一题、7.2ms 批量。三个检查点 + Router 自动按语言分发。它是对 TypeSafe Jev(闭源 API)的完整开源回应——论文、权重、数据、微调 notebook 全部开放。适合需要把「快判断」嵌进代码路径又不想被 API 锁定的团队。
不生成文本 → 无幻觉无解析
pip install laya 即用
HF 权重 + Demo Space
项目速览
核心数据
421M
最大检查点参数(ModernBERT-large)
2
前置 arXiv 论文(2503.23303 / 2510.01237)
GitHub API 采集于 2026-09-20 · 2026-09-18 建仓 · Convai Innovations 开发 · dev.to 长文记录完整来龙去脉
起源故事
十八个月的「既视感」
2025.03 · 先造出来
Nandha Kishor 发表 arXiv:2503.23303:非自回归 + RL 输出转化概率,开源权重、数据集、PyPI 包——垂直场景(销售对话),无人问津。
2025.09 · 铺好理论
第二篇 arXiv:2510.01237 给出 schema 化决策 + 强化学习的完整框架——比 Jev 发布早整整一年。
2026.09 · 正名之战
TypeSafe Jev 以「突破」姿态发布同概念(无论文/无权重/无数据)。作者发文《I Built Non-Autoregressive Decision Models a Year Ago…》,三天后 laya 上线。
时间线本身就是故事:09-15 Jev 发布 → 09-17 awesome-jev → 09-18 laya 开源反击。不是蹭热度——是把提前一年半的工作重新对齐到新坐标系,然后全部开源。
🔥 核心页
三检查点 + Router:一次调用,自动选脑
三个 HF 检查点
Router(语言分诊)
支持 model="typed-decisions" 显式覆盖
使用范式
三原语:把「判断」做成类型系统
- choice:从 criteria 字典里选一个(部门路由/意图分类),返回选项 + 概率分布
- score:在有序量表上打分(紧急度 0-3),返回期望分值 + 各档概率
- noul:布尔问题(是否钓鱼/是否威胁退订),返回校准的 P(true)
- 单次前向全答完:一封邮件同时问 4 个问题,一个 forward pass,无 token 生成
# pip install laya
from laya import Router
router = Router(preload=True)
questions = {
"department": {"type": "choice",
"criteria": {"billing": "...", "technical": "..."}},
"churn_risk": {"type": "noul",
"instructions": "威胁退订吗?"}}
res = router.predict(email_state, questions)
# -> billing (confidence: 0.94)
# -> routing: {'model': 'english', ...}
🔥 核心页
诚实基准:赢在微调,输在裸奔
微调后(README 主推)
对照(teacher/Jev/多数类)
基座零样本(接近随机)
400 案例 · 2000 决策 · 4 工作流 · T4
微调版同时拿下:Brier 好 2.4×、score MAE 好 1.6×、四工作流全胜;仍输两项——soft accuracy 0.471 vs 0.580、ECE 0.213 vs 0.144。
工程细节
README 里的「Honest Limits」:少见的自曝清单
- 基座近随机:「Laya 是待特化的快底座,不是零样本决策引擎」——0.362/0.342 连多数类基线(0.461)都不到,全部能力来自微调
- Khmer 惊魂:高棉语 0.000 准确率 @ 95.2% 置信度——模型自己的置信度不会报警,所以路由必须发生在前向传播之前(Router 存在的根因)
- 高基数塌陷:77 选项的 Banking77 每选项只分到 3–4 token,0.425 vs Jev 0.870——要么调大 head_max_len,要么粗到细分层
- 序数评分最弱:SST-5 仅 0.372
- 出厂过自信:ECE 0.466 → 温度重配后 0.081;multilingual 版干脆没配温度,「依赖概率前先自己 fit」
这份自曝比大多数论文的 limitation 章节诚实——每条边界都配了解法,把「什么时候不该用我」写成了文档。
核心机制
微调才是主菜:Kaggle 白嫖级训练闭环
- 一条 notebook 全流程:建数据 → RLCD 训练(proper scoring rule 奖励 + GRPO 风格策略梯度)→ 配温度 → 评测 → 推 HF Hub
- 免费算力可跑:Kaggle 2×T4,~3 万问题 4 epoch 约 4–5 小时
- 收益巨大:同一基准 0.36 → 0.766,一举超过 teacher 上限与 Jev 公布值
- 对比闭源:Jev 无公开微调路径——laya 的差异化恰恰是「把它变成你的模型」的权利
RLCD 在做什么
用严格proper scoring rule当奖励:概率分布报得诚实(说 70% 就真 70% 准)才能拿最高分——校准不是后处理,是训练目标本身。
呼应 Jev 的 RLCD 叙事:TypeSafe 未公开细节,laya 把论文+代码+数据一起摆了出来。
在线体验
亲手玩一玩 Router 分诊
粘贴任意语言的文本(或点预设:英语邮件、印地语退订、德语投诉、高棉语……),看 Router 如何在前向传播之前决定派哪个检查点、给出什么理由——以及 Khmer 惨案为什么要靠路由而不是置信度来兜底。
▶ 打开 Router 分诊台
脚本检测 + 语言启发式规则 1:1 复刻 README 文档化语义,全真值表验证 + node 对拍通过。
生态位
vs Jev:同一天平的两端
| 维度 | TypeSafe Jev | laya |
| 形态 | 闭源 API(early access) | Apache-2.0 权重 + pip 包 + 自托管 |
| 延迟 | 公布 ~150ms | T4 实测 33ms(约 4×) |
| 成本 | $0.042/MTok 输入 | 自己的 GPU,批量 7.2ms/题 |
| 基准 | 公布 0.727 | 微调后 0.766(基座近随机,需自训) |
| 透明度 | 无论文/无权重/无数据 | 2 篇 arXiv + HF 三检查点 + 微调 notebook + 数据集 |
| 成熟度 | 公司化运营、官网文档齐 | 2 天仓库、README 极诚实但基建年轻 |
读法:Jev 卖「开箱即用的闭源决策」;laya 卖「变成你自己的决策模型的权利」——为垂直域微调后才是完全体。
适用场景 / 风险提示
谁该用,需要警惕什么
适合
- 高频决策路径:邮件分诊、工单路由、护栏检测——毫秒级 + 免 API 账单
- 多语言产品:100+ 语言覆盖 + Router 自动分诊
- 想微调自有模型的人:领域数据 + 免费 Kaggle 算力即可拥有专用决策引擎
- System One 研究者:论文、RLCD 实现、基准全开源,可复现可改进
警惕
- 别零样本上生产:基座低于多数类基线,不微调就是随机器
- 校准自理:出厂过自信,multilingual 连温度都没配
- 2 天仓库:16 个 open issue,API 稳定性未经过时间检验
- 单人 + 小公司:Convai Innovations 主导,长期投入取决于社区 uptake
- 长上下文/高基数:77 选项场景需手调预算,别拿默认配置硬冲
潜力评估
未来空间
两天 1.49k stars 证明「Jev 开源平替」的叙事有真实需求。它的护城河不是模型本身(421M encoder 谁都能造),而是论文+权重+数据+微调链路的全开,以及那篇把学术优先权说清楚的故事文。若 System One 品类成立,laya 就是它的 Llama 时刻雏形。评分 8:概念验证扎实、基准诚实,扣分在基座裸奔与项目年龄。