A mesma interface, modelos diferentes
Ambos respondem a perguntas choice, score e noul sobre um estado. Retornam probabilidades que o código pode comparar a limites, combinar ou encaminhar. Nenhum foi projetado para redigir texto.
Jev é o modelo System One fechado e hospedado da TypeSafe AI. Laya é uma família Apache-2.0 baseada em codificadores ModernBERT-large e mmBERT-base com cabeça de decisão. O número de parâmetros e a arquitetura do Jev não são públicos; afirmar que Laya “reproduz a arquitetura do Jev” excede as evidências disponíveis.
Comparação de recursos
| Dimensão | Laya | Jev |
|---|---|---|
| Acesso | Pesos para download e pacote Python | API hospedada em acesso antecipado |
| Licença | Apache 2.0 | Termos do serviço comercial |
| Arquitetura conhecida | 322M mmBERT-base ou 421M ModernBERT-large mais cabeça de decisão | Não divulgada publicamente |
| Implantação | Local, nuvem privada ou servidor próprio | Endpoint gerenciado pela TypeSafe |
| Personalização | Pesos e processo de ajuste fino disponíveis | Sem acesso público aos pesos |
| Preço de entrada | Sem tarifa de API; computação e operação ainda custam dinheiro | US$ 0,042 por milhão de tokens de entrada, segundo a TypeSafe |
| Número máximo de opções choice | O limite padrão da cabeça piora em grandes conjuntos de rótulos | Até 255 opções, com processo em duas etapas para conjuntos grandes |
| Idiomas | Checkpoint multilíngue dedicado; avaliação pública em 51 idiomas | Nenhum benchmark multilíngue público comparável encontrado |
| Inicialização a frio / rede | Carregar checkpoints pode levar segundos; a inferência carregada é local | Sem carga local; cada chamada inclui latência de rede e serviço |
Preço de entrada publicado e limite de 255 opções do Jev: anúncio de System One e Jev da TypeSafe, verificado em 25 de setembro de 2026. Confirme preços e limites atuais com a TypeSafe antes de contratar.
Precisão: o destaque não conta toda a história
O repositório do Laya relata precisão de 0.766 em 2.000 decisões tipadas para seu checkpoint específico de fluxos, contra um resultado publicado de Jev de 0.727. Também relata vantagens em AG News e DAIR Emotion. São sinais úteis, não um ranking universal.
O mesmo relatório informa cerca de 0.34–0.36 para os dois checkpoints base em typed-decisions, abaixo da referência de classe majoritária de 0.461. O resultado de 0.766 vem de ajuste na divisão de treinamento do benchmark. A evidência favorece Laya como base para especialização, não como avaliador universal sem exemplos.
Jev tem vantagem publicada clara em Banking77: 0.870 contra 0.425 do Laya no limite padrão. As opções de Laya compartilham um orçamento fixo de prompt, restando poucos tokens por rótulo quando há dezenas. Aumentar o orçamento, pré-selecionar ou usar hierarquia pode ajudar, mas exige engenharia adicional.
Latência: inferência local e API são medidas diferentes
O repositório Laya informa cerca de 33–40ms para uma pergunta em Tesla T4 e maior vazão por pergunta em lotes. Testes independentes em Apple Silicon mediram uma chamada MLX com modelo carregado em cerca de 7.6ms. Jev normalmente inclui a ida e volta da rede: cerca de 236–276ms nas referências reunidas pelo Laya e 588ms em um pequeno teste de chamados chineses.
Isso torna Laya atraente para trabalho local em tempo real, mas não compara velocidade apenas por arquitetura. Uma comparação operacional justa inclui carregamento do Laya, custo de GPU ou dispositivo, concorrência e sua distância real ao endpoint do Jev.
Calibração: valide antes de automatizar
Laya é treinado com recompensas baseadas em regras de pontuação adequadas, mas o objetivo não garante calibração em todo domínio novo. O projeto relata excesso de confiança nos checkpoints base distribuídos e redução substancial do erro de calibração esperado após ajuste de temperaturas com dados reservados.
Um teste independente de 40 chamados chineses encontrou casos em que Laya mantinha alta confiança ao escolher o rótulo errado. A amostra é pequena demais para generalizações, mas reforça a prática correta: medir curvas de confiabilidade no seu tráfego rotulado antes de definir limites de automação.
Qual escolher?
Prefira Laya quando
- as entradas não podem sair do seu ambiente;
- você pode coletar exemplos rotulados do domínio;
- baixa latência com modelo carregado importa;
- você quer inspecionar, adaptar ou redistribuir o ambiente de execução;
- seus conjuntos de opções costumam ser pequenos.
Prefira Jev quando
- você quer uma API em vez de infraestrutura de modelos;
- precisa de grandes conjuntos de opções desde o início;
- a tarefa deve funcionar antes de você ter dados de ajuste fino;
- prefere versões gerenciadas;
- é aceitável enviar o estado a um serviço hospedado.
Uma terceira opção prática: cascata
Para alto volume, execute Laya primeiro e envie casos de baixa confiança ou fora do escopo para Jev ou um LLM maior. Isso mantém decisões óbvias locais com uma alternativa mais forte. Aprenda o limite com um conjunto de validação congelado; não o escolha porque 0.8 “parece confiável”.
Executar Laya localmente
Retornar uma distribuição tipada sem chamada de rede.
Verificar um critério validado
Aceitar somente tarefas e faixas de confiança confiáveis nos dados rotulados.
Encaminhar o restante
Enviar casos ambíguos ou não suportados para Jev, um LLM ou uma pessoa revisora.
Fontes principais: repositório Laya, relatório de benchmarks Laya, anúncio Jev da TypeSafe. Evidência independente com amostra pequena: laya-jev-lab. Este guia independente não é afiliado nem endossado por nenhum dos projetos.
