项目报告的主要结果
| 数据集 | Laya 结果 | Jev 已发表结果 | 重要背景 |
|---|---|---|---|
| typed-decisions | 0.766 | 0.727 | Laya 针对工作流程微调的检查点 |
| AG News | 0.953 | 0.910 | laya-typed-decisions;属于 Laya 的训练数据组合 |
| DAIR Emotion | 0.600 | 0.480 | laya-typed-decisions;对 Laya 而言是留出数据 |
| Banking77 | 77 个标签时为 0.425 | 0.870(已发表) | 基础 laya 检查点;默认预算下的大选项集弱项 |
上述各检查点数字来自 Laya 基准测试报告,并非一次受控的同场对比。Laya 项目明确表示未获得 TypeSafe API 访问权限,提示词和样本量也可能不同。因此只能把比较当作方向性参考。
具体检查点比品牌名称更重要
| typed-decisions 上的模型 | 准确率 | 软准确率 | Brier ↓ | ECE ↓ |
|---|---|---|---|---|
laya-typed-decisions | 0.766 | 0.471 | 0.061 | 0.213 |
laya | 0.361 | 0.332 | 0.316 | 0.175 |
laya-multilingual | 0.352 | 0.328 | 0.463 | 0.314 |
| Jev 1.13.0(已发表) | 0.727 | 0.580 | 0.148 | 0.144 |
| 多数类基线 | 0.461 | — | — | — |
这些数值来自 Laya 报告中的 typed-decisions 表。两个基础 Laya 检查点均低于此处的多数类基线。亮眼结果属于专项微调。Jev 在这张表中更接近教师模型的完整概率分布,未经额外校准的 ECE 也更好。
Tesla T4 上的延迟
| 一次调用的问题数 | 英语 Laya | 多语言 Laya |
|---|---|---|
| 1 | 39.5ms | 32.8ms |
| 5 | 84.5ms | 40.1ms |
| 10 | 158.6ms | 72.3ms |
| 50 | 771.3ms | 337.4ms |
这是模型已加载、GPU 已预热时的本地耗时。仓库指出,生产环境的路由器若需切换检查点,可能花费约 7–10 秒。因此,处理多种语言的服务器应预加载所需模型。
多语言证据
在包含 20 个选项的 MASSIVE 意图分类中,多语言检查点在 51 种语言上的宏平均准确率为 0.366,其中 45 种达到项目设定的“随机水平三倍”可用门槛。英语模型的宏平均准确率为 0.227,达到该门槛的语言为 23 种。
“支持 100 多种语言”描述的是编码器的预期覆盖范围,不代表已在 100 种生产环境中验证表现。公开评测涵盖 51 种语言,结果差异很大。选择正确的检查点是产品流程的一部分。
应用主题
| 主题 | 报告中的最佳检查点结果 | 训练状态与注意事项 |
|---|---|---|
| 垃圾邮件 | 0.993 | 包含于训练数据组合 |
| 钓鱼邮件 | 0.993 | 包含于训练数据组合 |
| LLM 防护规则 | 0.762 | 留出数据 |
| 内容审核 | 0.530 | 留出数据;宏平均 F1 偏弱 |
| RAG 相关性 | 0.657 | 包含于训练数据组合 |
| 支持工单分流(10 类) | 0.522 | 包含于训练数据组合 |
| 模型路由 | 0.659 | 留出数据;英语检查点 |
精美演示可能让内容审核看起来已经解决,但留出数据结果显示并非如此。生产评估应包含自然的类别不平衡、模糊案例与对抗输入,而不只是清晰样本。
校准改进
仓库报告称,按问题类型和选项数量拟合温度参数后,英语检查点的平均 ECE 从 0.466 降至 0.081,多语言检查点从 0.314 降至 0.106。这些结果令人鼓舞,但在一种数据分布上完成的校准,迁移到另一种分布时仍可能失效。
独立证据:有参考价值,但样本很小
一项独立的 M4 Max 测试,在 40 个中文支持工单案例上比较了多语言 Laya-MLX 和 Jev 1.13。Jev 答对 31/40,Laya 答对 23/40。Laya 的本地热推理延迟为 7.6ms,Jev API 调用为 588ms。在选定的级联阈值下,55% 的案例交由 Jev 处理,整体准确率达到与 Jev 相同的水平。
作者清楚指出限制:只有一种任务、一台机器、一个小测试集,部分标签也存在争议。这项测试适合提出假设,不适合当作普遍结论。
负责任的评估清单
- 在调整提示词、标准或阈值之前,固定带标签的验证集。
- 报告准确的检查点、软件包版本、硬件和上下文限制。
- 除总体准确率外,还要测量宏平均 F1 和各类别召回率。
- 按置信度区间绘制可靠性曲线,并检查高置信度错误。
- 打乱选项顺序,测试问题的不同表达。
- 纳入模糊、空白和超出范围的输入。
- 区分热推理、模型加载与端到端服务延迟。
主要数据来源:Laya BENCHMARKS.md 及其链接的原始结果文件。独立小样本测试:laya-jev-lab。数值核对于 2026 年 9 月 25 日的项目报告,之后可能变化。
