Principaux résultats rapportés par le projet
| Jeu de données | Résultat Laya | Résultat Jev publié | Contexte important |
|---|---|---|---|
| typed-decisions | 0.766 | 0.727 | Checkpoint Laya affiné pour des workflows spécifiques |
| AG News | 0.953 | 0.910 | laya-typed-decisions; présent dans l’entraînement de Laya |
| DAIR Emotion | 0.600 | 0.480 | laya-typed-decisions; réservé à l’évaluation de Laya |
| Banking77 | 0.425 sur 77 étiquettes | 0.870 (publié) | Base laya checkpoint ; faiblesse nette avec beaucoup d’étiquettes au budget par défaut |
Ces chiffres propres aux checkpoints viennent de l’étude de benchmarks de Laya. Il ne s’agit pas d’une comparaison contrôlée unique. Le projet Laya précise ne pas avoir eu accès à l’API TypeSafe ; prompts et tailles d’échantillon peuvent différer. La comparaison est indicative.
Le checkpoint importe davantage que la marque
| Modèle sur typed-decisions | Précision | Précision souple | Brier ↓ | ECE ↓ |
|---|---|---|---|---|
laya-typed-decisions | 0.766 | 0.471 | 0.061 | 0.213 |
laya | 0.361 | 0.332 | 0.316 | 0.175 |
laya-multilingual | 0.352 | 0.328 | 0.463 | 0.314 |
| Jev 1.13.0, publié | 0.727 | 0.580 | 0.148 | 0.144 |
| Référence de classe majoritaire | 0.461 | — | — | — |
Ces valeurs viennent de la table typed-decisions du rapport Laya. Les checkpoints de base Laya sont ici sous la référence de classe majoritaire. Le résultat remarquable appartient à la spécialisation. Jev reproduit mieux la distribution complète du modèle enseignant et présente un meilleur ECE non ajusté dans cette table.
Latence sur une Tesla T4
| Questions par appel | Laya anglais | Laya multilingue |
|---|---|---|
| 1 | 39.5ms | 32.8ms |
| 5 | 84.5ms | 40.1ms |
| 10 | 158.6ms | 72.3ms |
| 50 | 771.3ms | 337.4ms |
Ces temps correspondent à un GPU local avec modèle chargé. Selon le dépôt, un routeur de production peut prendre environ 7–10 secondes pour changer de checkpoint ; les serveurs multilingues devraient précharger les modèles servis.
Preuves multilingues
Sur la classification d’intentions MASSIVE avec 20 options, le checkpoint multilingue atteint 0.366 de précision macro sur 51 langues et dépasse le seuil d’utilité « trois fois le hasard » dans 45 langues. Le modèle anglais atteint 0.227 et dépasse ce seuil dans 23 langues.
« Prend en charge plus de 100 langues » décrit la couverture prévue de l’encodeur, pas une performance vérifiée dans 100 environnements de production. L’évaluation publique couvre 51 langues et les résultats varient beaucoup. Le routage fait partie du produit, ce n’est pas une optimisation facultative.
Thèmes d’application
| Thème | Meilleur résultat de checkpoint rapporté | Statut d’entraînement / réserve |
|---|---|---|
| Spam par e-mail | 0.993 | Présent dans l’entraînement |
| Hameçonnage | 0.993 | Présent dans l’entraînement |
| Garde-fous LLM | 0.762 | Réservé à l’évaluation |
| Modération | 0.530 | Réservé ; F1 macro faible |
| Pertinence RAG | 0.657 | Présent dans l’entraînement |
| Tri de support, 10 catégories | 0.522 | Présent dans l’entraînement |
| Routage de modèles | 0.659 | Réservé ; checkpoint anglais |
Une démo soignée peut donner l’impression que la modération est résolue, alors que le résultat sur données réservées dit le contraire. L’évaluation de production doit inclure le déséquilibre naturel des classes, les cas ambigus et les entrées adversariales, pas seulement des exemples clairs.
Correction de calibration
Le dépôt rapporte un ECE moyen passant de 0.466 à 0.081 pour l’anglais et de 0.314 à 0.106 pour le multilingue après ajustement des températures par type de question et nombre d’options. C’est encourageant, mais une calibration ajustée sur une distribution peut dériver sur une autre.
Preuves indépendantes : utiles, mais limitées
Un test distinct sur M4 Max a comparé Laya-MLX multilingue à Jev 1.13 sur 40 tickets de support chinois. Jev obtient 31/40 ; Laya, 23/40. La latence locale de Laya chargé est de 7.6ms contre un appel API Jev de 588ms. À un seuil de cascade choisi, le test atteint la précision de Jev en lui envoyant 55 % des cas.
L’auteur indique les limites : une tâche, une machine, un petit ensemble de test et des étiquettes discutables. Cela doit produire des hypothèses, pas des affirmations générales.
Liste de vérification pour une évaluation responsable
- Figez un ensemble étiqueté avant d’ajuster prompts, critères ou seuils.
- Indiquez le checkpoint exact, la version du paquet, le matériel et les limites de contexte.
- Mesurez le F1 macro et le rappel par classe en plus de la précision globale.
- Tracez la fiabilité par tranche de confiance et examinez les erreurs confiantes.
- Mélangez l’ordre des options et testez des paraphrases.
- Incluez des entrées ambiguës, vides et hors périmètre.
- Séparez inférence à chaud, chargement du modèle et latence totale du service.
Source principale : BENCHMARKS.md de Laya et fichiers de résultats associés. Échantillon indépendant : laya-jev-lab. Valeurs vérifiées dans le rapport du projet le 25 septembre 2026 et susceptibles de changer.
