← Retour à la présentation

Examen des preuves · lecture de 11 minutes

Les benchmarks Laya, avec leurs réserves.

La bonne question n’est pas de savoir quel modèle « gagne », mais quel checkpoint a été testé, sur quelle distribution, avec quelle calibration et si les deux ont réellement été exécutés côte à côte.

Politique de sources. « Rapporté par le projet » signifie que le chiffre vient des fichiers de résultats reproductibles de Laya. « Jev publié » signifie qu’il est importé d’un résultat externe Jev, sans réexécution par Laya. « Indépendant » désigne un dépôt distinct, avec les limites de taille d’échantillon indiquées.

Principaux résultats rapportés par le projet

Jeu de donnéesRésultat LayaRésultat Jev publiéContexte important
typed-decisions0.7660.727Checkpoint Laya affiné pour des workflows spécifiques
AG News0.9530.910laya-typed-decisions; présent dans l’entraînement de Laya
DAIR Emotion0.6000.480laya-typed-decisions; réservé à l’évaluation de Laya
Banking770.425 sur 77 étiquettes0.870 (publié)Base laya checkpoint ; faiblesse nette avec beaucoup d’étiquettes au budget par défaut

Ces chiffres propres aux checkpoints viennent de l’étude de benchmarks de Laya. Il ne s’agit pas d’une comparaison contrôlée unique. Le projet Laya précise ne pas avoir eu accès à l’API TypeSafe ; prompts et tailles d’échantillon peuvent différer. La comparaison est indicative.

Le checkpoint importe davantage que la marque

Modèle sur typed-decisionsPrécisionPrécision soupleBrier ↓ECE ↓
laya-typed-decisions0.7660.4710.0610.213
laya0.3610.3320.3160.175
laya-multilingual0.3520.3280.4630.314
Jev 1.13.0, publié0.7270.5800.1480.144
Référence de classe majoritaire0.461———

Ces valeurs viennent de la table typed-decisions du rapport Laya. Les checkpoints de base Laya sont ici sous la référence de classe majoritaire. Le résultat remarquable appartient à la spécialisation. Jev reproduit mieux la distribution complète du modèle enseignant et présente un meilleur ECE non ajusté dans cette table.

Latence sur une Tesla T4

Questions par appelLaya anglaisLaya multilingue
139.5ms32.8ms
584.5ms40.1ms
10158.6ms72.3ms
50771.3ms337.4ms

Ces temps correspondent à un GPU local avec modèle chargé. Selon le dépôt, un routeur de production peut prendre environ 7–10 secondes pour changer de checkpoint ; les serveurs multilingues devraient précharger les modèles servis.

Preuves multilingues

Sur la classification d’intentions MASSIVE avec 20 options, le checkpoint multilingue atteint 0.366 de précision macro sur 51 langues et dépasse le seuil d’utilité « trois fois le hasard » dans 45 langues. Le modèle anglais atteint 0.227 et dépasse ce seuil dans 23 langues.

« Prend en charge plus de 100 langues » décrit la couverture prévue de l’encodeur, pas une performance vérifiée dans 100 environnements de production. L’évaluation publique couvre 51 langues et les résultats varient beaucoup. Le routage fait partie du produit, ce n’est pas une optimisation facultative.

Thèmes d’application

ThèmeMeilleur résultat de checkpoint rapportéStatut d’entraînement / réserve
Spam par e-mail0.993Présent dans l’entraînement
Hameçonnage0.993Présent dans l’entraînement
Garde-fous LLM0.762Réservé à l’évaluation
Modération0.530Réservé ; F1 macro faible
Pertinence RAG0.657Présent dans l’entraînement
Tri de support, 10 catégories0.522Présent dans l’entraînement
Routage de modèles0.659Réservé ; checkpoint anglais

Une démo soignée peut donner l’impression que la modération est résolue, alors que le résultat sur données réservées dit le contraire. L’évaluation de production doit inclure le déséquilibre naturel des classes, les cas ambigus et les entrées adversariales, pas seulement des exemples clairs.

Correction de calibration

Le dépôt rapporte un ECE moyen passant de 0.466 à 0.081 pour l’anglais et de 0.314 à 0.106 pour le multilingue après ajustement des températures par type de question et nombre d’options. C’est encourageant, mais une calibration ajustée sur une distribution peut dériver sur une autre.

Preuves indépendantes : utiles, mais limitées

Un test distinct sur M4 Max a comparé Laya-MLX multilingue à Jev 1.13 sur 40 tickets de support chinois. Jev obtient 31/40 ; Laya, 23/40. La latence locale de Laya chargé est de 7.6ms contre un appel API Jev de 588ms. À un seuil de cascade choisi, le test atteint la précision de Jev en lui envoyant 55 % des cas.

L’auteur indique les limites : une tâche, une machine, un petit ensemble de test et des étiquettes discutables. Cela doit produire des hypothèses, pas des affirmations générales.

Liste de vérification pour une évaluation responsable

  1. Figez un ensemble étiqueté avant d’ajuster prompts, critères ou seuils.
  2. Indiquez le checkpoint exact, la version du paquet, le matériel et les limites de contexte.
  3. Mesurez le F1 macro et le rappel par classe en plus de la précision globale.
  4. Tracez la fiabilité par tranche de confiance et examinez les erreurs confiantes.
  5. Mélangez l’ordre des options et testez des paraphrases.
  6. Incluez des entrées ambiguës, vides et hors périmètre.
  7. Séparez inférence à chaud, chargement du modèle et latence totale du service.

Source principale : BENCHMARKS.md de Laya et fichiers de résultats associés. Échantillon indépendant : laya-jev-lab. Valeurs vérifiées dans le rapport du projet le 25 septembre 2026 et susceptibles de changer.