← Retour à la présentation

Architecture · lecture de 10 minutes

Comment fonctionne Laya

Un encodeur bidirectionnel lit l’état complet et le texte des options. Une tête de décision évalue des marqueurs dédiés à chaque réponse, puis renvoie des distributions de probabilité typées sans décoder une phrase token par token.

La requête comporte deux parties

L’état est le contenu évalué : ticket, e-mail, conversation, prompt, journal ou document JSON. Les questions définissent les décisions acceptées par le logiciel, avec instructions et critères. Laya les transforme avec l’état en une seule entrée du modèle.

ENTRÉE

L’état

Les éléments à examiner. Ils peuvent inclure des champs structurés et du langage naturel.

SCHÉMA

Questions typées

Chaque question déclare un type de sortie et les critères servant à l’interpréter.

MODÈLE

Encodeur + tête de décision

L’état et tous les marqueurs de questions sont évalués en une seule passe.

SORTIE

Probabilités et confiance

La réponse respecte le type déclaré et peut être utilisée directement en code.

Pourquoi le caractère non autorégressif compte

Un modèle de chat produit normalement les tokens l’un après l’autre. Pour une classification bornée, cela implique de payer la génération, valider le JSON et gérer les réponses hors schéma. Laya ne génère pas une chaîne de texte. Il évalue des marqueurs de réponse prédéfinis et normalise leurs scores en probabilités.

Plusieurs questions précises peuvent ainsi être évaluées ensemble, sans étiquette inconnue dans la sortie. Le compromis compte tout autant : Laya ne peut pas expliquer son raisonnement, rédiger une réponse ou inventer une action. Votre code garde le contrôle du flux et des effets de bord.

Choice : sélectionner une option fournie

Une question choice fournit des étiquettes et leurs descriptions. Laya renvoie la probabilité de chaque étiquette et choisit la plus élevée. Cela convient au routage et à la catégorisation quand les étiquettes sont concrètes et compréhensibles les unes par rapport aux autres.

Une bonne structure de question

Which team should handle this request?

facturation : factures et remboursements · technique : bugs et pannes · ventes : prix et contrats

Choice ne passe pas indéfiniment à l’échelle. Les critères partagent un budget fixe de tokens d’options. Avec des dizaines d’étiquettes longues, les descriptions sont tronquées jusqu’à devenir difficiles à distinguer. Le résultat de Laya sur Banking77 illustre clairement cette limite.

Score : répartir la probabilité sur des niveaux ordonnés

Une question score définit une grille ordonnée, comme une urgence faible, moyenne ou élevée. Le modèle renvoie les probabilités des niveaux et un score attendu pondéré, qui peut se situer entre les niveaux discrets.

Utiliser une grille comportementale

Décrivez des critères observables — « le service est indisponible et le travail est bloqué » — plutôt que des adjectifs vagues comme « très urgent ». Le score ordonné est actuellement la primitive la plus faible de Laya ; la validation métier est donc essentielle.

Noul : estimer P(true)

Une question noul demande une probabilité oui/non. Traitez-la comme un détecteur de fait précis et observable : demande explicite de remboursement, instruction de révéler des secrets dans un prompt ou menace d’annulation dans un message.

Des jugements larges comme « est-ce approprié ? » combinent des normes implicites et donnent souvent des résultats instables. Décomposez-les en questions factuelles précises avant de les combiner en code.

Les trois checkpoints

CheckpointArchitecture de baseContexteMeilleur usage
laya421M ModernBERT-large512 tokensTâches en anglais et préréglages fournis
laya-multilingual322M mmBERT-base1 024 par défaut ; l’encodeur en accepte davantageÉtat non anglophone ou multilingue
laya-typed-decisions421M ModernBERT-large1 024 tokensLes quatre familles de workflows utilisées pour l’entraînement typed-decisions

Le projet inclut un routeur qui choisit principalement entre les checkpoints anglais et multilingue selon l’écriture et les signaux linguistiques. C’est important : le checkpoint anglais peut rester très confiant tout en échouant sur des écritures qu’il maîtrise mal.

Ce que « calibré » devrait signifier

Pour un modèle calibré, les prédictions émises avec environ 80 % de confiance doivent être correctes dans environ 80 % de cas comparables. Cela permet d’automatiser au-dessus d’un seuil et d’escalader en dessous.

L’entraînement RLCD de Laya récompense la qualité des probabilités selon des règles de score appropriées, mais la calibration varie selon le domaine et le nombre d’étiquettes. Le dépôt recommande d’ajuster des températures sur des données réservées. Tracez toujours la précision par tranche de confiance et examinez les erreurs confiantes avant d’automatiser des décisions à conséquences.

Ce que Laya ne peut pas faire

  • Il ne peut pas rédiger, résumer ou expliquer.
  • Il ne peut pas choisir une étiquette non fournie.
  • Il ne peut pas rendre un schéma incorrect valide en raisonnant plus longtemps.
  • Il ne peut pas transformer la confiance en vérité ; les probabilités doivent être validées.
  • Une interface générale ne le rend pas automatiquement compétent dans un nouveau domaine.

Source : README et code de Laya, fiche du modèle Hugging Face, et rapport de benchmarks du projet. Ces explications sont des reformulations indépendantes.