A solicitação tem duas partes
Estado é o material avaliado: chamado, e-mail, conversa, prompt, log ou documento JSON. Perguntas definem as decisões aceitas pelo software, incluindo instruções e critérios. Laya transforma ambos em uma única entrada do modelo.
Estado
As evidências a examinar. Podem incluir campos estruturados e linguagem natural.
Perguntas tipadas
Cada pergunta declara um tipo de saída e os critérios para interpretá-lo.
Codificador + cabeça de decisão
O estado e todos os marcadores de pergunta são avaliados em uma única passagem.
Probabilidades e confiança
A resposta segue o tipo declarado e está pronta para uso no código.
Por que não ser autorregressivo importa
Um modelo de chat normalmente produz um token após o outro. Para uma classificação delimitada, isso exige pagar pela geração, validar JSON e lidar com respostas fora do esquema. Laya não gera uma string. Ele pontua marcadores de resposta predefinidos e normaliza as pontuações em probabilidades.
Por isso, várias perguntas específicas podem ser avaliadas juntas e a saída não pode conter um rótulo desconhecido. A contrapartida também importa: Laya não explica seu raciocínio, não redige respostas nem inventa ações. Seu código continua controlando o fluxo e os efeitos colaterais.
Choice: selecionar uma opção fornecida
Uma pergunta choice fornece rótulos e descrições. Laya retorna a probabilidade de cada rótulo e seleciona a maior. Funciona bem para roteamento e categorização quando os rótulos são concretos e compreensíveis entre si.
Uma boa estrutura de pergunta
Which team should handle this request?
cobrança: faturas e reembolsos · técnico: bugs e indisponibilidade · vendas: preços e contratos
Choice não escala indefinidamente. Os critérios compartilham um limite fixo de tokens para opções. Com dezenas de rótulos longos, as descrições são truncadas até ficar difíceis de distinguir. O resultado de Laya em Banking77 demonstra esse limite.
Score: distribuir probabilidade entre níveis ordenados
Uma pergunta score define uma rubrica ordenada, como urgência baixa, média e alta. O modelo retorna probabilidades dos níveis e uma pontuação esperada ponderada, que pode ficar entre níveis discretos.
Use uma rubrica comportamental
Escreva critérios observáveis — “o serviço está indisponível e o trabalho está bloqueado” — em vez de adjetivos vagos como “muito urgente”. A pontuação ordenada é atualmente a primitiva mais fraca do Laya, tornando essencial a validação no domínio.
Noul: estimar P(true)
Uma pergunta noul pede uma probabilidade de sim/não. Trate-a como detector de um fato específico e observável: pedido explícito de reembolso, instrução para revelar segredos em um prompt ou ameaça de cancelamento em uma mensagem.
Julgamentos amplos como “isso é apropriado?” combinam normas não declaradas e frequentemente produzem resultados instáveis. Separe-os em perguntas factuais mais específicas antes de combinar os resultados no código.
Os três checkpoints
| Checkpoint | Arquitetura base | Contexto | Melhor uso |
|---|---|---|---|
laya | 421M ModernBERT-large | 512 tokens | Tarefas em inglês e configurações predefinidas incluídas |
laya-multilingual | 322M mmBERT-base | 1.024 por padrão; o codificador aceita mais | Estado não inglês ou com vários idiomas |
laya-typed-decisions | 421M ModernBERT-large | 1.024 tokens | As quatro famílias de fluxos usadas no treinamento typed-decisions |
O projeto inclui um roteador que escolhe entre checkpoints inglês e multilíngue principalmente pelo sistema de escrita e sinais de idioma. Isso importa porque o checkpoint inglês pode manter alta confiança mesmo falhando em escritas que não domina.
O que “calibrado” deveria significar
Em um modelo calibrado, previsões com cerca de 80% de confiança devem estar corretas em cerca de 80% dos casos comparáveis. Isso permite automatizar acima de um limite e encaminhar abaixo dele.
O treinamento RLCD do Laya recompensa a qualidade das probabilidades com regras de pontuação adequadas, mas a calibração pode mudar por domínio e número de rótulos. O repositório recomenda ajustar temperaturas com dados reservados. Sempre trace a precisão por faixa de confiança e examine erros confiantes antes de automatizar decisões importantes.
O que Laya não consegue fazer
- Não consegue redigir, resumir ou explicar.
- Não consegue escolher um rótulo que você não forneceu.
- Não consegue tornar válido um esquema incorreto ao raciocinar por mais tempo.
- Não transforma confiança em verdade; as probabilidades devem ser validadas.
- Uma interface geral não o torna automaticamente bom em um novo domínio.
Fonte: README e código do Laya, ficha do modelo no Hugging Face, e relatório de benchmarks do projeto. Estas explicações são paráfrases independentes.
