La requête comporte deux parties
L’état est le contenu évalué : ticket, e-mail, conversation, prompt, journal ou document JSON. Les questions définissent les décisions acceptées par le logiciel, avec instructions et critères. Laya les transforme avec l’état en une seule entrée du modèle.
L’état
Les éléments à examiner. Ils peuvent inclure des champs structurés et du langage naturel.
Questions typées
Chaque question déclare un type de sortie et les critères servant à l’interpréter.
Encodeur + tête de décision
L’état et tous les marqueurs de questions sont évalués en une seule passe.
Probabilités et confiance
La réponse respecte le type déclaré et peut être utilisée directement en code.
Pourquoi le caractère non autorégressif compte
Un modèle de chat produit normalement les tokens l’un après l’autre. Pour une classification bornée, cela implique de payer la génération, valider le JSON et gérer les réponses hors schéma. Laya ne génère pas une chaîne de texte. Il évalue des marqueurs de réponse prédéfinis et normalise leurs scores en probabilités.
Plusieurs questions précises peuvent ainsi être évaluées ensemble, sans étiquette inconnue dans la sortie. Le compromis compte tout autant : Laya ne peut pas expliquer son raisonnement, rédiger une réponse ou inventer une action. Votre code garde le contrôle du flux et des effets de bord.
Choice : sélectionner une option fournie
Une question choice fournit des étiquettes et leurs descriptions. Laya renvoie la probabilité de chaque étiquette et choisit la plus élevée. Cela convient au routage et à la catégorisation quand les étiquettes sont concrètes et compréhensibles les unes par rapport aux autres.
Une bonne structure de question
Which team should handle this request?
facturation : factures et remboursements · technique : bugs et pannes · ventes : prix et contrats
Choice ne passe pas indéfiniment à l’échelle. Les critères partagent un budget fixe de tokens d’options. Avec des dizaines d’étiquettes longues, les descriptions sont tronquées jusqu’à devenir difficiles à distinguer. Le résultat de Laya sur Banking77 illustre clairement cette limite.
Score : répartir la probabilité sur des niveaux ordonnés
Une question score définit une grille ordonnée, comme une urgence faible, moyenne ou élevée. Le modèle renvoie les probabilités des niveaux et un score attendu pondéré, qui peut se situer entre les niveaux discrets.
Utiliser une grille comportementale
Décrivez des critères observables — « le service est indisponible et le travail est bloqué » — plutôt que des adjectifs vagues comme « très urgent ». Le score ordonné est actuellement la primitive la plus faible de Laya ; la validation métier est donc essentielle.
Noul : estimer P(true)
Une question noul demande une probabilité oui/non. Traitez-la comme un détecteur de fait précis et observable : demande explicite de remboursement, instruction de révéler des secrets dans un prompt ou menace d’annulation dans un message.
Des jugements larges comme « est-ce approprié ? » combinent des normes implicites et donnent souvent des résultats instables. Décomposez-les en questions factuelles précises avant de les combiner en code.
Les trois checkpoints
| Checkpoint | Architecture de base | Contexte | Meilleur usage |
|---|---|---|---|
laya | 421M ModernBERT-large | 512 tokens | Tâches en anglais et préréglages fournis |
laya-multilingual | 322M mmBERT-base | 1 024 par défaut ; l’encodeur en accepte davantage | État non anglophone ou multilingue |
laya-typed-decisions | 421M ModernBERT-large | 1 024 tokens | Les quatre familles de workflows utilisées pour l’entraînement typed-decisions |
Le projet inclut un routeur qui choisit principalement entre les checkpoints anglais et multilingue selon l’écriture et les signaux linguistiques. C’est important : le checkpoint anglais peut rester très confiant tout en échouant sur des écritures qu’il maîtrise mal.
Ce que « calibré » devrait signifier
Pour un modèle calibré, les prédictions émises avec environ 80 % de confiance doivent être correctes dans environ 80 % de cas comparables. Cela permet d’automatiser au-dessus d’un seuil et d’escalader en dessous.
L’entraînement RLCD de Laya récompense la qualité des probabilités selon des règles de score appropriées, mais la calibration varie selon le domaine et le nombre d’étiquettes. Le dépôt recommande d’ajuster des températures sur des données réservées. Tracez toujours la précision par tranche de confiance et examinez les erreurs confiantes avant d’automatiser des décisions à conséquences.
Ce que Laya ne peut pas faire
- Il ne peut pas rédiger, résumer ou expliquer.
- Il ne peut pas choisir une étiquette non fournie.
- Il ne peut pas rendre un schéma incorrect valide en raisonnant plus longtemps.
- Il ne peut pas transformer la confiance en vérité ; les probabilités doivent être validées.
- Une interface générale ne le rend pas automatiquement compétent dans un nouveau domaine.
Source : README et code de Laya, fiche du modèle Hugging Face, et rapport de benchmarks du projet. Ces explications sont des reformulations indépendantes.
