← Voltar à visão geral

Revisão de evidências · leitura de 11 minutos

Benchmarks do Laya, com as ressalvas.

A pergunta útil não é qual modelo “vence”, mas qual checkpoint foi testado, em qual distribuição, com qual calibração e se a comparação foi realmente executada lado a lado.

Política de fontes. “Informado pelo projeto” indica dados dos arquivos de resultados reproduzíveis do Laya. “Jev publicado” indica importação de um resultado externo de Jev, sem nova execução pelo Laya. “Independente” indica outro repositório, com os limites do tamanho da amostra apresentados.

Principais resultados informados pelo projeto

Conjunto de dadosResultado do LayaResultado publicado do JevContexto importante
typed-decisions0.7660.727Checkpoint do Laya ajustado para fluxos específicos
AG News0.9530.910laya-typed-decisions; incluído nos dados de treinamento do Laya
DAIR Emotion0.6000.480laya-typed-decisions; reservado para avaliar Laya
Banking770.425 com 77 rótulos0.870 (publicado)Base laya checkpoint; fraqueza clara com muitos rótulos no limite padrão

Estas métricas específicas de cada checkpoint vêm de o relatório de benchmarks do Laya. Não são uma única comparação controlada. O projeto declara explicitamente que não teve acesso à API TypeSafe e que prompts e tamanhos de amostra podem diferir. A comparação é indicativa.

O checkpoint importa mais que a marca

Modelo em typed-decisionsPrecisãoPrecisão suaveBrier ↓ECE ↓
laya-typed-decisions0.7660.4710.0610.213
laya0.3610.3320.3160.175
laya-multilingual0.3520.3280.4630.314
Jev 1.13.0, publicado0.7270.5800.1480.144
Referência da classe majoritária0.461———

Esses valores vêm de a tabela typed-decisions no relatório do Laya. Os checkpoints base do Laya ficam abaixo da referência da classe majoritária. O resultado destacado pertence à especialização. Jev corresponde melhor à distribuição completa do modelo professor e tem ECE não ajustado melhor nessa tabela.

Latência em uma Tesla T4

Perguntas em uma chamadaLaya inglêsLaya multilíngue
139.5ms32.8ms
584.5ms40.1ms
10158.6ms72.3ms
50771.3ms337.4ms

Esses são tempos de GPU local com modelo carregado. Segundo o repositório, um roteador em produção pode levar cerca de 7–10 segundos ao trocar de checkpoint; servidores multilíngues devem pré-carregar os modelos que oferecem.

Evidência multilíngue

Na classificação de intenções MASSIVE com 20 opções, o checkpoint multilíngue atinge precisão macro de 0.366 em 51 idiomas e supera o limite de utilidade de “três vezes o acaso” em 45. O modelo inglês atinge 0.227 e supera esse limite em 23.

“Suporta mais de 100 idiomas” descreve a cobertura prevista do codificador, não desempenho verificado em 100 ambientes de produção. A avaliação pública cobre 51 idiomas, com resultados muito variados. O roteamento faz parte do produto, não é uma otimização opcional.

Temas de aplicação

TemaMelhor resultado informado por checkpointSituação do treinamento / ressalva
Spam por e-mail0.993Incluído no treinamento
Phishing0.993Incluído no treinamento
Proteções para LLM0.762Reservado para avaliação
Moderação0.530Reservado; F1 macro fraco
Relevância RAG0.657Incluído no treinamento
Triagem de suporte, 10 categorias0.522Incluído no treinamento
Roteamento de modelos0.659Reservado; checkpoint inglês

Uma demonstração bem produzida pode dar a impressão de que a moderação está resolvida, embora o resultado reservado diga o contrário. A avaliação em produção deve incluir desequilíbrio natural de classes, casos ambíguos e entradas adversariais, não só exemplos claros.

Correção de calibração

O repositório relata ECE médio mudando de 0.466 para 0.081 no checkpoint inglês e de 0.314 para 0.106 no multilíngue após ajustar temperaturas por tipo de pergunta e número de opções. São resultados promissores, mas uma calibração ajustada em uma distribuição pode desviar em outra.

Evidência independente: útil, mas pequena

Um teste separado em M4 Max comparou Laya-MLX multilíngue com Jev 1.13 em 40 chamados chineses. Jev acertou 31/40; Laya, 23/40. A latência local do Laya carregado foi 7.6ms, contra uma chamada API Jev de 588ms. Com um limite de cascata selecionado, o teste igualou a precisão do Jev encaminhando 55% dos casos a ele.

O autor deixa claros os limites: uma tarefa, uma máquina, uma pequena amostra e rótulos discutíveis. Isso deve gerar hipóteses, não afirmações amplas.

Lista de avaliação responsável

  1. Congele um conjunto rotulado antes de ajustar prompts, critérios ou limites.
  2. Informe o checkpoint exato, versão do pacote, hardware e limites de contexto.
  3. Meça F1 macro e revocação por classe junto com a precisão agregada.
  4. Trace a confiabilidade por faixa de confiança e examine erros confiantes.
  5. Embaralhe as opções e teste paráfrases.
  6. Inclua entradas ambíguas, vazias e fora do escopo.
  7. Separe inferência com modelo carregado, carregamento e latência completa do serviço.

Fonte principal: BENCHMARKS.md do Laya e arquivos de resultados vinculados. Amostra independente: laya-jev-lab. Valores verificados no relatório do projeto em 25 de setembro de 2026 e sujeitos a mudanças.