← 返回概览

证据核查 · 约 11 分钟阅读

阅读 Laya 基准测试,也要读附带的限制。

关键问题不是哪个模型“赢了”,而是测了哪个检查点、使用什么数据分布、如何校准,以及比较是否真的在相同条件下完成。

来源说明。“项目报告”表示数字来自 Laya 自身可复现的结果文件;“Jev 已发表结果”表示引用外部 Jev 数字,而非 Laya 重新测试;“独立测试”表示来自单独仓库,并注明样本量限制。

项目报告的主要结果

数据集Laya 结果Jev 已发表结果重要背景
typed-decisions0.7660.727Laya 针对工作流程微调的检查点
AG News0.9530.910laya-typed-decisions;属于 Laya 的训练数据组合
DAIR Emotion0.6000.480laya-typed-decisions;对 Laya 而言是留出数据
Banking7777 个标签时为 0.4250.870(已发表)基础 laya 检查点;默认预算下的大选项集弱项

上述各检查点数字来自 Laya 基准测试报告,并非一次受控的同场对比。Laya 项目明确表示未获得 TypeSafe API 访问权限,提示词和样本量也可能不同。因此只能把比较当作方向性参考。

具体检查点比品牌名称更重要

typed-decisions 上的模型准确率软准确率Brier ↓ECE ↓
laya-typed-decisions0.7660.4710.0610.213
laya0.3610.3320.3160.175
laya-multilingual0.3520.3280.4630.314
Jev 1.13.0(已发表)0.7270.5800.1480.144
多数类基线0.461———

这些数值来自 Laya 报告中的 typed-decisions 表。两个基础 Laya 检查点均低于此处的多数类基线。亮眼结果属于专项微调。Jev 在这张表中更接近教师模型的完整概率分布,未经额外校准的 ECE 也更好。

Tesla T4 上的延迟

一次调用的问题数英语 Laya多语言 Laya
139.5ms32.8ms
584.5ms40.1ms
10158.6ms72.3ms
50771.3ms337.4ms

这是模型已加载、GPU 已预热时的本地耗时。仓库指出,生产环境的路由器若需切换检查点,可能花费约 7–10 秒。因此,处理多种语言的服务器应预加载所需模型。

多语言证据

在包含 20 个选项的 MASSIVE 意图分类中,多语言检查点在 51 种语言上的宏平均准确率为 0.366,其中 45 种达到项目设定的“随机水平三倍”可用门槛。英语模型的宏平均准确率为 0.227,达到该门槛的语言为 23 种。

“支持 100 多种语言”描述的是编码器的预期覆盖范围,不代表已在 100 种生产环境中验证表现。公开评测涵盖 51 种语言,结果差异很大。选择正确的检查点是产品流程的一部分。

应用主题

主题报告中的最佳检查点结果训练状态与注意事项
垃圾邮件0.993包含于训练数据组合
钓鱼邮件0.993包含于训练数据组合
LLM 防护规则0.762留出数据
内容审核0.530留出数据;宏平均 F1 偏弱
RAG 相关性0.657包含于训练数据组合
支持工单分流(10 类)0.522包含于训练数据组合
模型路由0.659留出数据;英语检查点

精美演示可能让内容审核看起来已经解决,但留出数据结果显示并非如此。生产评估应包含自然的类别不平衡、模糊案例与对抗输入,而不只是清晰样本。

校准改进

仓库报告称,按问题类型和选项数量拟合温度参数后,英语检查点的平均 ECE 从 0.466 降至 0.081,多语言检查点从 0.314 降至 0.106。这些结果令人鼓舞,但在一种数据分布上完成的校准,迁移到另一种分布时仍可能失效。

独立证据:有参考价值,但样本很小

一项独立的 M4 Max 测试,在 40 个中文支持工单案例上比较了多语言 Laya-MLX 和 Jev 1.13。Jev 答对 31/40,Laya 答对 23/40。Laya 的本地热推理延迟为 7.6ms,Jev API 调用为 588ms。在选定的级联阈值下,55% 的案例交由 Jev 处理,整体准确率达到与 Jev 相同的水平。

作者清楚指出限制:只有一种任务、一台机器、一个小测试集,部分标签也存在争议。这项测试适合提出假设,不适合当作普遍结论。

负责任的评估清单

  1. 在调整提示词、标准或阈值之前,固定带标签的验证集。
  2. 报告准确的检查点、软件包版本、硬件和上下文限制。
  3. 除总体准确率外,还要测量宏平均 F1 和各类别召回率。
  4. 按置信度区间绘制可靠性曲线,并检查高置信度错误。
  5. 打乱选项顺序,测试问题的不同表达。
  6. 纳入模糊、空白和超出范围的输入。
  7. 区分热推理、模型加载与端到端服务延迟。

主要数据来源:Laya BENCHMARKS.md 及其链接的原始结果文件。独立小样本测试:laya-jev-lab。数值核对于 2026 年 9 月 25 日的项目报告,之后可能变化。