Resultados destacados informados por el proyecto
| Conjunto de datos | Resultado de Laya | Resultado publicado de Jev | Contexto importante |
|---|---|---|---|
| typed-decisions | 0.766 | 0.727 | Punto de control de Laya ajustado para flujos concretos |
| AG News | 0.953 | 0.910 | laya-typed-decisions; incluido en los datos de entrenamiento de Laya |
| DAIR Emotion | 0.600 | 0.480 | laya-typed-decisions; reservado para evaluar Laya |
| Banking77 | 0.425 con 77 etiquetas | 0.870 (publicado) | Base laya punto de control; debilidad clara con muchas etiquetas usando el presupuesto predeterminado |
Estas cifras específicas de cada punto de control proceden de el informe de pruebas de Laya. No corresponden a una única prueba comparativa controlada. Laya indica explícitamente que no tuvo acceso a la API de TypeSafe y que los prompts y tamaños de muestra pueden diferir. La comparación es orientativa.
El punto de control importa más que la marca
| Modelo en typed-decisions | Precisión | Precisión suave | Brier ↓ | ECE ↓ |
|---|---|---|---|---|
laya-typed-decisions | 0.766 | 0.471 | 0.061 | 0.213 |
laya | 0.361 | 0.332 | 0.316 | 0.175 |
laya-multilingual | 0.352 | 0.328 | 0.463 | 0.314 |
| Jev 1.13.0, publicado | 0.727 | 0.580 | 0.148 | 0.144 |
| Referencia de la clase mayoritaria | 0.461 | — | — | — |
Estos valores proceden de la tabla typed-decisions del informe de Laya. Los puntos de control base de Laya están por debajo de la referencia de clase mayoritaria. El resultado destacado corresponde a la especialización. Jev reproduce mejor la distribución completa del profesor y tiene mejor ECE sin ajustar en esta tabla.
Latencia en una Tesla T4
| Preguntas en una llamada | Laya inglés | Laya multilingüe |
|---|---|---|
| 1 | 39.5ms | 32.8ms |
| 5 | 84.5ms | 40.1ms |
| 10 | 158.6ms | 72.3ms |
| 50 | 771.3ms | 337.4ms |
Son tiempos de GPU local con el modelo ya cargado. Según el repositorio, un enrutador de producción puede tardar unos 7–10 segundos al cambiar de punto de control; los servidores multilingües deberían precargar los modelos que ofrecen.
Evidencia multilingüe
En clasificación de intenciones MASSIVE con 20 opciones, el punto de control multilingüe alcanza 0.366 de precisión macro en 51 idiomas y supera el umbral del proyecto de «tres veces el azar» en 45. El modelo inglés alcanza 0.227 de precisión macro y supera ese umbral en 23.
«Compatible con más de 100 idiomas» describe la cobertura prevista del codificador, no rendimiento verificado en 100 entornos de producción. La evaluación pública abarca 51 idiomas y los resultados varían mucho. El enrutamiento forma parte del producto y no es una optimización opcional.
Temas de aplicación
| Tema | Mejor resultado informado por punto de control | Situación del entrenamiento / advertencia |
|---|---|---|
| Correo no deseado | 0.993 | Incluido en el entrenamiento |
| Suplantación de identidad | 0.993 | Incluido en el entrenamiento |
| Protecciones para LLM | 0.762 | Reservado para evaluación |
| Moderación | 0.530 | Reservado; F1 macro débil |
| Relevancia para RAG | 0.657 | Incluido en el entrenamiento |
| Clasificación de soporte, 10 opciones | 0.522 | Incluido en el entrenamiento |
| Enrutamiento de modelos | 0.659 | Reservado; punto de control inglés |
Una demostración cuidada puede hacer parecer resuelta la moderación, aunque el resultado reservado indica lo contrario. La evaluación de producción debe incluir desequilibrios naturales de clases, casos ambiguos y entradas adversarias, no solo ejemplos claros.
Corrección de calibración
El repositorio informa que el ECE medio pasa de 0.466 a 0.081 en el punto de control inglés y de 0.314 a 0.106 en el multilingüe tras ajustar temperaturas por tipo de pregunta y número de opciones. Son resultados alentadores, pero una calibración ajustada en una distribución puede desviarse en otra.
Evidencia independiente: útil, pero pequeña
Una prueba independiente en M4 Max comparó Laya-MLX multilingüe y Jev 1.13 con 40 tickets de soporte chinos. Jev acertó 31/40; Laya, 23/40. La latencia local de Laya cargado fue de 7.6ms frente a una llamada API de Jev de 588ms. Con un umbral de cascada seleccionado, la prueba igualó la precisión de Jev enviándole el 55% de los casos.
El autor señala los límites: una tarea, una máquina, una muestra pequeña y etiquetas discutibles. Debe servir para formular hipótesis, no grandes titulares.
Lista de evaluación responsable
- Fija un conjunto etiquetado antes de ajustar prompts, criterios o umbrales.
- Informa del punto de control exacto, versión del paquete, hardware y límites de contexto.
- Mide F1 macro y sensibilidad por clase además de la precisión global.
- Representa la fiabilidad por intervalos de confianza y examina los errores de alta confianza.
- Cambia el orden de las opciones y prueba paráfrasis.
- Incluye entradas ambiguas, vacías y fuera de alcance.
- Separa la inferencia con el modelo cargado de su carga y de la latencia total del servicio.
Fuente principal de datos: BENCHMARKS.md de Laya y archivos de resultados enlazados. Muestra independiente: laya-jev-lab. Valores verificados con el informe del proyecto el 25 de septiembre de 2026; pueden cambiar.
