Même interface, modèles différents
Les deux systèmes répondent à des questions choice, score et noul sur un état. Ils renvoient des probabilités que le code peut comparer à des seuils, combiner ou escalader. Aucun n’est conçu pour rédiger du texte.
Jev est le modèle System One fermé et hébergé de TypeSafe AI. Laya est une famille Apache-2.0 associant encodeurs ModernBERT-large ou mmBERT-base et tête de décision. Le nombre de paramètres et l’architecture de Jev ne sont pas publics : affirmer que Laya « reproduit l’architecture Jev » dépasse les preuves disponibles.
Comparaison des fonctionnalités
| Dimension | Laya | Jev |
|---|---|---|
| Accès | Poids téléchargeables et paquet Python | API hébergée en accès anticipé |
| Licence | Apache 2.0 | Conditions de service commerciales |
| Architecture connue | 322M mmBERT-base ou 421M ModernBERT-large avec tête de décision | Non divulguée publiquement |
| Déploiement | Local, cloud privé ou serveur propre | Endpoint géré par TypeSafe |
| Personnalisation | Poids et procédure d’affinage disponibles | Pas d’accès public aux poids |
| Prix des entrées | Pas de frais d’API ; calcul et exploitation restent payants | 0,042 $ par million de tokens d’entrée, selon TypeSafe |
| Nombre maximal d’options choice | Le budget par défaut se dégrade avec de grands jeux d’étiquettes | Jusqu’à 255 options, avec parcours en deux étapes pour les grands jeux |
| Langues | Checkpoint multilingue dédié ; évaluation publique sur 51 langues | Aucun benchmark multilingue public comparable trouvé |
| Démarrage à froid / réseau | Le chargement peut prendre des secondes ; l’inférence à chaud est locale | Pas de chargement local ; chaque appel ajoute latence réseau et service |
Prix publié des entrées Jev et limite de 255 options : annonce System One et Jev de TypeSafe, vérifiée le 25 septembre 2026. Confirmez prix et limites actuels auprès de TypeSafe avant tout achat.
Précision : le titre ne dit pas tout
Le dépôt Laya rapporte que son checkpoint spécialisé atteint 0.766 de précision sur 2 000 décisions typées, contre un résultat Jev publié de 0.727. Il rapporte aussi des avantages sur AG News et DAIR Emotion. Ce sont des signaux utiles, pas un classement universel.
Le même rapport indique environ 0.34–0.36 pour les deux checkpoints de base Laya sur typed-decisions, sous la référence de classe majoritaire de 0.461. Le 0.766 vient d’un checkpoint affiné sur la partition d’entraînement du benchmark. Les preuves favorisent donc Laya comme base à spécialiser, pas comme juge universel sans exemples.
Jev présente une nette avance publiée sur Banking77 : 0.870 contre 0.425 pour Laya au budget par défaut. Les options de Laya partagent un budget fixe de prompt, laissant peu de tokens par étiquette lorsqu’elles sont nombreuses. Augmenter le budget, présélectionner ou utiliser une hiérarchie peut aider, mais exige des choix d’ingénierie supplémentaires.
Latence : inférence locale et API sont des mesures différentes
Le dépôt Laya rapporte environ 33–40ms par question sur Tesla T4, avec un meilleur débit par question en lots. Un test indépendant Apple Silicon mesure un appel MLX à chaud autour de 7.6ms. Les mesures Jev incluent souvent l’aller-retour réseau : environ 236–276ms dans les références réunies par Laya, et 588ms dans un petit test de tickets chinois.
Cela rend Laya attractif pour des tâches locales en temps réel, sans constituer une comparaison de vitesse fondée uniquement sur l’architecture. Une comparaison opérationnelle juste doit inclure chargement Laya, coût GPU ou appareil, concurrence et distance réelle de votre infrastructure à l’endpoint Jev.
Calibration : valider avant d’automatiser
Laya est entraîné avec des récompenses fondées sur des règles de score appropriées, mais l’objectif d’entraînement ne garantit pas la calibration sur chaque nouveau domaine. Le projet indique un excès de confiance des checkpoints de base et une forte baisse de l’erreur de calibration attendue après ajustement des températures sur des données réservées.
Un test indépendant de 40 tickets chinois observe des cas où Laya reste très confiant malgré une mauvaise étiquette. L’échantillon est bien trop petit pour généraliser, mais confirme la bonne pratique : mesurer les courbes de fiabilité sur votre trafic étiqueté avant de fixer des seuils d’automatisation.
Lequel choisir ?
Préférez Laya quand
- les entrées ne peuvent pas quitter votre environnement ;
- vous pouvez recueillir des exemples métier étiquetés ;
- une faible latence à chaud est importante ;
- vous voulez examiner, adapter ou redistribuer l’environnement d’exécution ;
- vos jeux d’options restent généralement modestes.
Préférez Jev quand
- vous voulez une API plutôt qu’une infrastructure de modèles ;
- vous avez besoin de grands jeux d’options immédiatement ;
- la tâche doit fonctionner avant d’avoir des données d’affinage ;
- vous préférez une gestion des versions par le fournisseur ;
- envoyer l’état à un service hébergé est acceptable.
Une troisième option pratique : une cascade
Pour un fort volume, exécutez d’abord Laya et envoyez les cas peu confiants ou hors périmètre à Jev ou un LLM plus grand. Les décisions évidentes restent locales avec un recours plus puissant. Apprenez le seuil sur un ensemble de validation figé ; ne le choisissez pas parce que 0.8 « semble sûr ».
Exécuter Laya localement
Renvoyer une distribution typée sans appel réseau.
Vérifier un critère validé
Accepter uniquement les tâches et plages de confiance fiables sur vos données étiquetées.
Escalader le reste
Envoyer les cas ambigus ou non pris en charge à Jev, un LLM ou une personne.
Sources principales : dépôt Laya, rapport de benchmarks Laya, annonce Jev de TypeSafe. Preuve indépendante sur petit échantillon : laya-jev-lab. Ce guide indépendant n’est affilié à aucun des deux projets et n’est approuvé par aucun.
