プロジェクトが報告する主な結果
| データセット | Laya の結果 | Jev の公開結果 | 重要な背景 |
|---|---|---|---|
| typed-decisions | 0.766 | 0.727 | Laya のワークフロー専用ファインチューニング済みチェックポイント |
| AG News | 0.953 | 0.910 | laya-typed-decisions。Laya の学習データに含まれる |
| DAIR Emotion | 0.600 | 0.480 | laya-typed-decisions。Laya の学習には使われていない |
| Banking77 | 77 ラベルで 0.425 | 0.870(公開値) | 基本 laya チェックポイント。既定予算では多選択肢に明確な弱点 |
これらのチェックポイント別数値の出典は Laya のベンチマーク報告です。一つの統制された直接比較ではありません。Laya プロジェクトは TypeSafe API にアクセスできず、プロンプトやサンプル数が異なる可能性を明記しています。傾向を示す比較として扱ってください。
ブランド名よりチェックポイントが重要
| typed-decisions 上のモデル | 正確度 | ソフト正確度 | Brier ↓ | ECE ↓ |
|---|---|---|---|---|
laya-typed-decisions | 0.766 | 0.471 | 0.061 | 0.213 |
laya | 0.361 | 0.332 | 0.316 | 0.175 |
laya-multilingual | 0.352 | 0.328 | 0.463 | 0.314 |
| Jev 1.13.0、公開結果 | 0.727 | 0.580 | 0.148 | 0.144 |
| 多数派クラスのベースライン | 0.461 | — | — | — |
これらの値は Laya 報告の typed-decisions 表から引用しています。ここでは基本 Laya チェックポイントは多数派ベースラインを下回ります。優れた結果は特化によるものです。この表では Jev が教師の確率分布全体によりよく一致し、調整前 ECE も低くなっています。
Tesla T4 上の遅延
| 1 回の呼び出しの質問数 | 英語版 Laya | 多言語版 Laya |
|---|---|---|
| 1 | 39.5ms | 32.8ms |
| 5 | 84.5ms | 40.1ms |
| 10 | 158.6ms | 72.3ms |
| 50 | 771.3ms | 337.4ms |
これらはウォーム状態のローカル GPU 計測です。リポジトリによれば、本番ルーターがチェックポイントを切り替えると約 7〜10 秒かかる場合があります。複数言語を扱うサーバーは、提供するモデルを事前に読み込むべきです。
多言語の根拠
20 選択肢の MASSIVE 意図分類で、多言語チェックポイントは 51 言語のマクロ正確度 0.366 を達成し、45 言語でプロジェクトの「偶然の 3 倍」という実用基準を上回ります。英語モデルは 0.227 で、基準を上回るのは 23 言語です。
「100 言語以上に対応」は、エンコーダーが意図する対象範囲であり、100 の本番環境で検証済みという意味ではありません。公開評価は 51 言語を対象とし、結果の差は大きいです。振り分けは任意の最適化ではなく、製品の一部です。
用途別の評価
| 用途 | 報告された最良のチェックポイント結果 | 学習状況/注意点 |
|---|---|---|
| 迷惑メール | 0.993 | 学習データに含まれる |
| フィッシング | 0.993 | 学習データに含まれる |
| LLM ガードレール | 0.762 | 学習から除外 |
| モデレーション | 0.530 | 学習から除外。マクロ F1 は低い |
| RAG の関連性 | 0.657 | 学習データに含まれる |
| 10 分類のサポート振り分け | 0.522 | 学習データに含まれる |
| モデルの振り分け | 0.659 | 学習から除外。英語チェックポイント |
整ったデモはモデレーションが解決済みに見せますが、未使用データの結果は異なります。本番評価には、明確な例だけでなく、自然なクラス不均衡、曖昧な事例、敵対的な入力を含めてください。
校正の改善
質問型と選択肢数ごとに温度を適合させると、平均 ECE が英語チェックポイントで 0.466 から 0.081、多言語で 0.314 から 0.106 に変わったと報告されています。改善は有望ですが、ある分布で適合した校正は別の分布でずれる可能性があります。
独立評価:有用だが小規模
別の M4 Max 評価は、40 件の中国語サポートチケットで多言語 Laya-MLX と Jev 1.13 を比較しました。Jev は 31/40、Laya は 23/40。Laya のウォームなローカル遅延は 7.6ms、Jev API は 588ms でした。選んだカスケードしきい値では、55% の事例を Jev に送り、Jev と同じ正確度を得ました。
著者は制約を明記しています。一つのタスク、一台の機械、小規模なテスト集合、議論の余地があるラベルです。大きな宣伝文句ではなく、仮説を得る材料として使うべきです。
責任ある評価のチェックリスト
- プロンプト・基準・しきい値を調整する前に、ラベル付き集合を固定する。
- 正確なチェックポイント、パッケージ版、ハードウェア、コンテキスト制限を報告する。
- 全体正確度に加え、マクロ F1 とクラス別再現率を測る。
- 確信度帯別の信頼性を描き、高確信の誤りを調べる。
- 選択肢の順序を変え、言い換えを試す。
- 曖昧・空・対象外の入力を含める。
- ウォーム推論、モデル読み込み、サービス全体の遅延を分ける。
主なデータ出典: Laya の BENCHMARKS.md とリンク先の生データ。独立したサンプル評価: laya-jev-lab。値は 2026年9月25日にプロジェクト報告と照合しました。今後変わる可能性があります。
