← 概要に戻る

根拠の検討 · 読了約 11 分

注意点も含めて読む Laya ベンチマーク。

重要なのは、どのモデルが「勝つ」かではありません。どのチェックポイントを、どの分布で、どの校正を用いて評価し、実際に同じ条件で比較したのかです。

出典の方針。 「プロジェクト報告」は Laya 自身の再現可能な結果ファイル、「公開 Jev 結果」は Laya が再実行せず外部の Jev 結果から引用した数値、「独立評価」は別リポジトリの評価を意味します。独立評価にはサンプル数の制約も示します。

プロジェクトが報告する主な結果

データセットLaya の結果Jev の公開結果重要な背景
typed-decisions0.7660.727Laya のワークフロー専用ファインチューニング済みチェックポイント
AG News0.9530.910laya-typed-decisions。Laya の学習データに含まれる
DAIR Emotion0.6000.480laya-typed-decisions。Laya の学習には使われていない
Banking7777 ラベルで 0.4250.870(公開値)基本 laya チェックポイント。既定予算では多選択肢に明確な弱点

これらのチェックポイント別数値の出典は Laya のベンチマーク報告です。一つの統制された直接比較ではありません。Laya プロジェクトは TypeSafe API にアクセスできず、プロンプトやサンプル数が異なる可能性を明記しています。傾向を示す比較として扱ってください。

ブランド名よりチェックポイントが重要

typed-decisions 上のモデル正確度ソフト正確度Brier ↓ECE ↓
laya-typed-decisions0.7660.4710.0610.213
laya0.3610.3320.3160.175
laya-multilingual0.3520.3280.4630.314
Jev 1.13.0、公開結果0.7270.5800.1480.144
多数派クラスのベースライン0.461———

これらの値は Laya 報告の typed-decisions 表から引用しています。ここでは基本 Laya チェックポイントは多数派ベースラインを下回ります。優れた結果は特化によるものです。この表では Jev が教師の確率分布全体によりよく一致し、調整前 ECE も低くなっています。

Tesla T4 上の遅延

1 回の呼び出しの質問数英語版 Laya多言語版 Laya
139.5ms32.8ms
584.5ms40.1ms
10158.6ms72.3ms
50771.3ms337.4ms

これらはウォーム状態のローカル GPU 計測です。リポジトリによれば、本番ルーターがチェックポイントを切り替えると約 7〜10 秒かかる場合があります。複数言語を扱うサーバーは、提供するモデルを事前に読み込むべきです。

多言語の根拠

20 選択肢の MASSIVE 意図分類で、多言語チェックポイントは 51 言語のマクロ正確度 0.366 を達成し、45 言語でプロジェクトの「偶然の 3 倍」という実用基準を上回ります。英語モデルは 0.227 で、基準を上回るのは 23 言語です。

「100 言語以上に対応」は、エンコーダーが意図する対象範囲であり、100 の本番環境で検証済みという意味ではありません。公開評価は 51 言語を対象とし、結果の差は大きいです。振り分けは任意の最適化ではなく、製品の一部です。

用途別の評価

用途報告された最良のチェックポイント結果学習状況/注意点
迷惑メール0.993学習データに含まれる
フィッシング0.993学習データに含まれる
LLM ガードレール0.762学習から除外
モデレーション0.530学習から除外。マクロ F1 は低い
RAG の関連性0.657学習データに含まれる
10 分類のサポート振り分け0.522学習データに含まれる
モデルの振り分け0.659学習から除外。英語チェックポイント

整ったデモはモデレーションが解決済みに見せますが、未使用データの結果は異なります。本番評価には、明確な例だけでなく、自然なクラス不均衡、曖昧な事例、敵対的な入力を含めてください。

校正の改善

質問型と選択肢数ごとに温度を適合させると、平均 ECE が英語チェックポイントで 0.466 から 0.081、多言語で 0.314 から 0.106 に変わったと報告されています。改善は有望ですが、ある分布で適合した校正は別の分布でずれる可能性があります。

独立評価:有用だが小規模

別の M4 Max 評価は、40 件の中国語サポートチケットで多言語 Laya-MLX と Jev 1.13 を比較しました。Jev は 31/40、Laya は 23/40。Laya のウォームなローカル遅延は 7.6ms、Jev API は 588ms でした。選んだカスケードしきい値では、55% の事例を Jev に送り、Jev と同じ正確度を得ました。

著者は制約を明記しています。一つのタスク、一台の機械、小規模なテスト集合、議論の余地があるラベルです。大きな宣伝文句ではなく、仮説を得る材料として使うべきです。

責任ある評価のチェックリスト

  1. プロンプト・基準・しきい値を調整する前に、ラベル付き集合を固定する。
  2. 正確なチェックポイント、パッケージ版、ハードウェア、コンテキスト制限を報告する。
  3. 全体正確度に加え、マクロ F1 とクラス別再現率を測る。
  4. 確信度帯別の信頼性を描き、高確信の誤りを調べる。
  5. 選択肢の順序を変え、言い換えを試す。
  6. 曖昧・空・対象外の入力を含める。
  7. ウォーム推論、モデル読み込み、サービス全体の遅延を分ける。

主なデータ出典: Laya の BENCHMARKS.md とリンク先の生データ。独立したサンプル評価: laya-jev-lab。値は 2026年9月25日にプロジェクト報告と照合しました。今後変わる可能性があります。