La misma interfaz, distinto modelo
Ambos sistemas responden preguntas choice, score y noul sobre un estado. Devuelven probabilidades que el código puede comparar con umbrales, combinar o escalar. Ninguno está diseñado para redactar prosa.
Jev es el modelo System One cerrado y alojado de TypeSafe AI. Laya es una familia Apache-2.0 basada en codificadores ModernBERT-large y mmBERT-base con cabeza de decisión. El número de parámetros y la arquitectura de Jev no son públicos; afirmar que Laya «reproduce la arquitectura de Jev» excede la evidencia disponible.
Comparación de funciones
| Dimensión | Laya | Jev |
|---|---|---|
| Acceso | Pesos descargables y paquete Python | API alojada en acceso anticipado |
| Licencia | Apache 2.0 | Condiciones del servicio comercial |
| Arquitectura conocida | 322M mmBERT-base o 421M ModernBERT-large más cabeza de decisión | No publicada |
| Despliegue | Local, nube privada o servidor propio | Endpoint gestionado por TypeSafe |
| Personalización | Pesos y flujo de ajuste fino disponibles | Sin acceso público a los pesos |
| Precio de entrada | Sin tarifa de API; el cómputo y las operaciones siguen costando dinero | 0,042 USD por millón de tokens de entrada, según TypeSafe |
| Máximo número de opciones choice | El presupuesto predeterminado de la cabeza empeora con muchas etiquetas | Hasta 255 opciones, con una ruta en dos etapas para conjuntos grandes |
| Idiomas | Punto de control multilingüe específico; evaluación pública de 51 idiomas | No se encontró una prueba multilingüe pública comparable |
| Arranque en frío / red | Cargar el punto de control puede tardar segundos; la inferencia cargada es local | Sin carga local; cada llamada añade latencia de red y servicio |
Precio de entrada publicado y límite de 255 opciones de Jev: anuncio de System One y Jev de TypeSafe, verificado el 25 de septiembre de 2026. Confirma precios y límites actuales con TypeSafe antes de contratar.
Precisión: el titular no cuenta toda la historia
El repositorio de Laya informa que su punto de control específico para flujos alcanza 0.766 de precisión en 2.000 decisiones tipadas, frente a un resultado publicado de Jev de 0.727. También informa ventajas en AG News y DAIR Emotion. Son señales útiles, no una clasificación universal.
El mismo informe indica que los dos puntos de control base de Laya obtienen alrededor de 0.34–0.36 en typed-decisions, por debajo de la referencia de clase mayoritaria de 0.461. El resultado de 0.766 procede de un punto de control ajustado en la partición de entrenamiento de la prueba. La evidencia favorece a Laya como base para especializar, no como evaluador universal sin ejemplos.
Jev tiene una clara ventaja publicada en Banking77: 0.870 frente a 0.425 de Laya con su presupuesto predeterminado. Las opciones de Laya comparten un presupuesto fijo de prompt y, con decenas de etiquetas, quedan pocos tokens por etiqueta. Aumentar el presupuesto, preseleccionar o usar una jerarquía puede ayudar, pero requiere decisiones de ingeniería adicionales.
Latencia: la inferencia local y la latencia de API son medidas distintas
El repositorio de Laya informa unos 33–40ms para una pregunta en Tesla T4 y mayor rendimiento por pregunta al agrupar. Pruebas independientes en Apple Silicon midieron una llamada MLX con el modelo cargado de unos 7.6ms. Las medidas de Jev suelen incluir la ida y vuelta de red: unos 236–276ms en referencias reunidas por Laya y 588ms en una pequeña prueba de tickets chinos.
Esto hace atractivo a Laya para trabajo local en tiempo real, pero no es una comparación de velocidad solo por arquitectura. Una comparación operativa justa debe incluir carga del modelo, coste de GPU o dispositivo, concurrencia y distancia real al endpoint de Jev.
Calibración: validar antes de automatizar
Laya se entrena con recompensas basadas en reglas de puntuación adecuadas, pero el objetivo de entrenamiento no garantiza calibración en cada dominio nuevo. El proyecto informa que los puntos de control base distribuidos tienen exceso de confianza y que ajustar temperaturas con datos reservados reduce considerablemente el error de calibración esperado.
Una prueba independiente de 40 tickets chinos encontró casos en los que Laya mantenía gran confianza al elegir la etiqueta equivocada. La muestra es demasiado pequeña para generalizar, pero refuerza la práctica correcta: medir curvas de fiabilidad con tu tráfico etiquetado antes de establecer umbrales de automatización.
¿Cuál elegir?
Prefiere Laya cuando
- las entradas no pueden salir de tu entorno;
- puedes recopilar ejemplos etiquetados de tu dominio;
- importa la baja latencia con el modelo cargado;
- quieres examinar, adaptar o redistribuir el entorno de ejecución;
- tus conjuntos de opciones suelen ser pequeños.
Prefiere Jev cuando
- quieres una API en lugar de infraestructura de modelos;
- necesitas grandes conjuntos de opciones desde el principio;
- la tarea debe funcionar antes de tener datos de ajuste fino;
- prefieres versiones gestionadas;
- es aceptable enviar el estado a un servicio alojado.
Una tercera opción práctica: una cascada
Para alto volumen, ejecuta Laya primero y envía los casos de baja confianza o fuera de alcance a Jev o un LLM mayor. Así puedes mantener las decisiones evidentes en local y conservar una alternativa más fuerte. Aprende el umbral con un conjunto de validación fijo; no lo elijas porque 0.8 «parezca seguro».
Ejecutar Laya localmente
Devolver una distribución tipada sin llamada de red.
Comprobar un criterio validado
Aceptar solo tipos de tarea y rangos de confianza fiables en tus datos etiquetados.
Escalar el resto
Enviar los casos ambiguos o no admitidos a Jev, un LLM o una persona revisora.
Fuentes principales: repositorio de Laya, informe de pruebas de Laya, anuncio de Jev de TypeSafe. Evidencia independiente con muestra pequeña: laya-jev-lab. Esta guía independiente no está afiliada ni respaldada por ninguno de los proyectos.
