接口相似,模型并不相同
两者都针对状态回答 choice、score 和 noul 问题,并返回概率,供应用代码设置阈值、组合判断或升级处理。它们都不是用于撰写文章的模型。
Jev 是 TypeSafe AI 闭源托管的 System One 模型。Laya 是采用 Apache 2.0 许可的模型家族,以 ModernBERT-large 或 mmBERT-base 编码器及决策头为基础。Jev 的参数量和架构未公开,因此“Laya 复现了 Jev 架构”的说法超出了现有证据。
功能对比
| 维度 | Laya | Jev |
|---|---|---|
| 获取方式 | 可下载权重与 Python 软件包 | 早期访问阶段的托管 API |
| 许可 | Apache 2.0 | 商业服务条款 |
| 已知架构 | 322M mmBERT-base 或 421M ModernBERT-large,加决策头 | 未公开 |
| 部署 | 本地、私有云或自有服务器 | TypeSafe 托管的端点 |
| 定制 | 提供权重与微调流程 | 不公开权重 |
| 输入价格 | 无 API 费用,但仍需支付算力和运维成本 | 据 TypeSafe:每百万输入 token 为 0.042 美元 |
| 最多可选标签 | 默认决策头预算在大标签集上表现下降 | 最多 255 个选项,大规模选项可使用两阶段路径 |
| 语言能力证据 | 专用多语言检查点;公开评测 51 种语言 | 未找到可比的公开多语言基准 |
| 冷启动与网络 | 加载检查点可能耗时数秒;热推理在本地完成 | 无需本地加载,但每次调用都有网络和服务延迟 |
上表 Jev 的公开输入价格和 255 选项上限来自 TypeSafe 的 System One 与 Jev 公告,核对日期为 2026 年 9 月 25 日。采购前请向 TypeSafe 确认当前价格和限制。
准确率:标题数字不是全部
Laya 仓库报告称,工作流程专项检查点在 2,000 个 typed-decisions 样本上的准确率为 0.766,而 Jev 已发表结果为 0.727;在 AG News 和 DAIR Emotion 上也有领先。这些是有用信号,但不是通用排行榜。
同一报告显示,两个 Laya 基础检查点在 typed-decisions 上约为 0.34–0.36,低于 0.461 的多数类基线。0.766 来自在该基准训练集上微调的检查点。因此,证据更支持将 Laya 作为专项优化基础,而非普遍强大的零样本判断器。
Jev 在 Banking77 上有明确的已发表领先优势:0.870,对比 Laya 在默认决策头预算下的 0.425。Laya 的选项共享固定提示预算;当选项有几十个时,每个标签只剩少量 token。增加预算、先筛选候选项或采用层级结构可能有所帮助,但都需要额外工程工作。
延迟:本地推理与 API 耗时的测量方式不同
Laya 仓库报告在 Tesla T4 上回答单个问题约需 33–40ms,批量处理时平均每题更快。独立 Apple Silicon 测试测得预热的 MLX 调用约 7.6ms。Jev 的测量通常包含网络往返:Laya 项目收集的资料约为 236–276ms,一项小规模中文支持工单测试则为 588ms。
这让 Laya 对实时本地任务很有吸引力,但并非只比较模型架构的速度。公平的运维比较还应计入 Laya 模型加载、GPU 或设备成本、并发能力,以及你与 Jev 端点之间的实际网络距离。
校准:自动处理前先验证
Laya 使用适当评分规则作为训练奖励,但训练目标并不能保证模型在每个新领域都经过良好校准。项目报告指出,已发布的基础检查点会过度自信,在留出数据上拟合温度参数可明显降低预期校准误差。
一项独立的 40 例中文工单测试发现,Laya 有时即使选错标签仍保持很高置信度。样本太小,不足以得出广泛结论;但它再次说明部署时应先用自身标注流量绘制可靠性曲线,再设定自动处理阈值。
应该选择哪一个?
这些情况优先考虑 Laya
- 输入不能离开自己的环境;
- 可以收集领域标注样本;
- 低热推理延迟很重要;
- 希望检查、调整或重新分发运行环境;
- 选项集通常不大。
这些情况优先考虑 Jev
- 希望使用 API,而非管理模型基础设施;
- 需要开箱即用地处理大量选项;
- 在获得微调数据前任务就必须可用;
- 更喜欢托管的版本管理;
- 可以将状态发送到托管服务。
第三种实用方案:级联处理
对于高流量任务,可以先运行 Laya,再将低置信度或超出范围的案例交给 Jev、更大的 LLM 或人工。这让明确的决策留在本地,同时保留更强的后备处理。阈值必须从固定验证集中学习,而不是因为 0.8 “听起来很有把握”就直接采用。
在本地运行 Laya
无需网络调用即可返回类型化概率分布。
检查验证过的门槛
只接受在自身标注数据上表现可靠的任务类型和置信度区间。
升级处理其余案例
将模糊或不受支持的案例交给 Jev、LLM 或人工审核者。
主要资料:Laya 仓库、Laya 基准测试报告、TypeSafe 的 Jev 公告。独立小样本证据:laya-jev-lab。本站是独立指南,与两个项目均无隶属或背书关系。
