Principais resultados informados pelo projeto
| Conjunto de dados | Resultado do Laya | Resultado publicado do Jev | Contexto importante |
|---|---|---|---|
| typed-decisions | 0.766 | 0.727 | Checkpoint do Laya ajustado para fluxos específicos |
| AG News | 0.953 | 0.910 | laya-typed-decisions; incluído nos dados de treinamento do Laya |
| DAIR Emotion | 0.600 | 0.480 | laya-typed-decisions; reservado para avaliar Laya |
| Banking77 | 0.425 com 77 rótulos | 0.870 (publicado) | Base laya checkpoint; fraqueza clara com muitos rótulos no limite padrão |
Estas métricas específicas de cada checkpoint vêm de o relatório de benchmarks do Laya. Não são uma única comparação controlada. O projeto declara explicitamente que não teve acesso à API TypeSafe e que prompts e tamanhos de amostra podem diferir. A comparação é indicativa.
O checkpoint importa mais que a marca
| Modelo em typed-decisions | Precisão | Precisão suave | Brier ↓ | ECE ↓ |
|---|---|---|---|---|
laya-typed-decisions | 0.766 | 0.471 | 0.061 | 0.213 |
laya | 0.361 | 0.332 | 0.316 | 0.175 |
laya-multilingual | 0.352 | 0.328 | 0.463 | 0.314 |
| Jev 1.13.0, publicado | 0.727 | 0.580 | 0.148 | 0.144 |
| Referência da classe majoritária | 0.461 | — | — | — |
Esses valores vêm de a tabela typed-decisions no relatório do Laya. Os checkpoints base do Laya ficam abaixo da referência da classe majoritária. O resultado destacado pertence à especialização. Jev corresponde melhor à distribuição completa do modelo professor e tem ECE não ajustado melhor nessa tabela.
Latência em uma Tesla T4
| Perguntas em uma chamada | Laya inglês | Laya multilíngue |
|---|---|---|
| 1 | 39.5ms | 32.8ms |
| 5 | 84.5ms | 40.1ms |
| 10 | 158.6ms | 72.3ms |
| 50 | 771.3ms | 337.4ms |
Esses são tempos de GPU local com modelo carregado. Segundo o repositório, um roteador em produção pode levar cerca de 7–10 segundos ao trocar de checkpoint; servidores multilíngues devem pré-carregar os modelos que oferecem.
Evidência multilíngue
Na classificação de intenções MASSIVE com 20 opções, o checkpoint multilíngue atinge precisão macro de 0.366 em 51 idiomas e supera o limite de utilidade de “três vezes o acaso” em 45. O modelo inglês atinge 0.227 e supera esse limite em 23.
“Suporta mais de 100 idiomas” descreve a cobertura prevista do codificador, não desempenho verificado em 100 ambientes de produção. A avaliação pública cobre 51 idiomas, com resultados muito variados. O roteamento faz parte do produto, não é uma otimização opcional.
Temas de aplicação
| Tema | Melhor resultado informado por checkpoint | Situação do treinamento / ressalva |
|---|---|---|
| Spam por e-mail | 0.993 | Incluído no treinamento |
| Phishing | 0.993 | Incluído no treinamento |
| Proteções para LLM | 0.762 | Reservado para avaliação |
| Moderação | 0.530 | Reservado; F1 macro fraco |
| Relevância RAG | 0.657 | Incluído no treinamento |
| Triagem de suporte, 10 categorias | 0.522 | Incluído no treinamento |
| Roteamento de modelos | 0.659 | Reservado; checkpoint inglês |
Uma demonstração bem produzida pode dar a impressão de que a moderação está resolvida, embora o resultado reservado diga o contrário. A avaliação em produção deve incluir desequilíbrio natural de classes, casos ambíguos e entradas adversariais, não só exemplos claros.
Correção de calibração
O repositório relata ECE médio mudando de 0.466 para 0.081 no checkpoint inglês e de 0.314 para 0.106 no multilíngue após ajustar temperaturas por tipo de pergunta e número de opções. São resultados promissores, mas uma calibração ajustada em uma distribuição pode desviar em outra.
Evidência independente: útil, mas pequena
Um teste separado em M4 Max comparou Laya-MLX multilíngue com Jev 1.13 em 40 chamados chineses. Jev acertou 31/40; Laya, 23/40. A latência local do Laya carregado foi 7.6ms, contra uma chamada API Jev de 588ms. Com um limite de cascata selecionado, o teste igualou a precisão do Jev encaminhando 55% dos casos a ele.
O autor deixa claros os limites: uma tarefa, uma máquina, uma pequena amostra e rótulos discutíveis. Isso deve gerar hipóteses, não afirmações amplas.
Lista de avaliação responsável
- Congele um conjunto rotulado antes de ajustar prompts, critérios ou limites.
- Informe o checkpoint exato, versão do pacote, hardware e limites de contexto.
- Meça F1 macro e revocação por classe junto com a precisão agregada.
- Trace a confiabilidade por faixa de confiança e examine erros confiantes.
- Embaralhe as opções e teste paráfrases.
- Inclua entradas ambíguas, vazias e fora do escopo.
- Separe inferência com modelo carregado, carregamento e latência completa do serviço.
Fonte principal: BENCHMARKS.md do Laya e arquivos de resultados vinculados. Amostra independente: laya-jev-lab. Valores verificados no relatório do projeto em 25 de setembro de 2026 e sujeitos a mudanças.
