← Volver al resumen

Revisión de evidencia · lectura de 11 minutos

Pruebas de Laya, con sus advertencias.

La pregunta útil no es qué modelo «gana», sino qué punto de control se probó, con qué distribución y calibración, y si la comparación se ejecutó realmente en paralelo.

Política de fuentes. «Informado por el proyecto» significa que la cifra procede de los archivos de resultados reproducibles de Laya. «Jev publicado» significa que se importó de un resultado externo de Jev y Laya no lo volvió a ejecutar. «Independiente» significa que procede de otro repositorio, indicando sus límites de tamaño de muestra.

Resultados destacados informados por el proyecto

Conjunto de datosResultado de LayaResultado publicado de JevContexto importante
typed-decisions0.7660.727Punto de control de Laya ajustado para flujos concretos
AG News0.9530.910laya-typed-decisions; incluido en los datos de entrenamiento de Laya
DAIR Emotion0.6000.480laya-typed-decisions; reservado para evaluar Laya
Banking770.425 con 77 etiquetas0.870 (publicado)Base laya punto de control; debilidad clara con muchas etiquetas usando el presupuesto predeterminado

Estas cifras específicas de cada punto de control proceden de el informe de pruebas de Laya. No corresponden a una única prueba comparativa controlada. Laya indica explícitamente que no tuvo acceso a la API de TypeSafe y que los prompts y tamaños de muestra pueden diferir. La comparación es orientativa.

El punto de control importa más que la marca

Modelo en typed-decisionsPrecisiónPrecisión suaveBrier ↓ECE ↓
laya-typed-decisions0.7660.4710.0610.213
laya0.3610.3320.3160.175
laya-multilingual0.3520.3280.4630.314
Jev 1.13.0, publicado0.7270.5800.1480.144
Referencia de la clase mayoritaria0.461———

Estos valores proceden de la tabla typed-decisions del informe de Laya. Los puntos de control base de Laya están por debajo de la referencia de clase mayoritaria. El resultado destacado corresponde a la especialización. Jev reproduce mejor la distribución completa del profesor y tiene mejor ECE sin ajustar en esta tabla.

Latencia en una Tesla T4

Preguntas en una llamadaLaya inglésLaya multilingüe
139.5ms32.8ms
584.5ms40.1ms
10158.6ms72.3ms
50771.3ms337.4ms

Son tiempos de GPU local con el modelo ya cargado. Según el repositorio, un enrutador de producción puede tardar unos 7–10 segundos al cambiar de punto de control; los servidores multilingües deberían precargar los modelos que ofrecen.

Evidencia multilingüe

En clasificación de intenciones MASSIVE con 20 opciones, el punto de control multilingüe alcanza 0.366 de precisión macro en 51 idiomas y supera el umbral del proyecto de «tres veces el azar» en 45. El modelo inglés alcanza 0.227 de precisión macro y supera ese umbral en 23.

«Compatible con más de 100 idiomas» describe la cobertura prevista del codificador, no rendimiento verificado en 100 entornos de producción. La evaluación pública abarca 51 idiomas y los resultados varían mucho. El enrutamiento forma parte del producto y no es una optimización opcional.

Temas de aplicación

TemaMejor resultado informado por punto de controlSituación del entrenamiento / advertencia
Correo no deseado0.993Incluido en el entrenamiento
Suplantación de identidad0.993Incluido en el entrenamiento
Protecciones para LLM0.762Reservado para evaluación
Moderación0.530Reservado; F1 macro débil
Relevancia para RAG0.657Incluido en el entrenamiento
Clasificación de soporte, 10 opciones0.522Incluido en el entrenamiento
Enrutamiento de modelos0.659Reservado; punto de control inglés

Una demostración cuidada puede hacer parecer resuelta la moderación, aunque el resultado reservado indica lo contrario. La evaluación de producción debe incluir desequilibrios naturales de clases, casos ambiguos y entradas adversarias, no solo ejemplos claros.

Corrección de calibración

El repositorio informa que el ECE medio pasa de 0.466 a 0.081 en el punto de control inglés y de 0.314 a 0.106 en el multilingüe tras ajustar temperaturas por tipo de pregunta y número de opciones. Son resultados alentadores, pero una calibración ajustada en una distribución puede desviarse en otra.

Evidencia independiente: útil, pero pequeña

Una prueba independiente en M4 Max comparó Laya-MLX multilingüe y Jev 1.13 con 40 tickets de soporte chinos. Jev acertó 31/40; Laya, 23/40. La latencia local de Laya cargado fue de 7.6ms frente a una llamada API de Jev de 588ms. Con un umbral de cascada seleccionado, la prueba igualó la precisión de Jev enviándole el 55% de los casos.

El autor señala los límites: una tarea, una máquina, una muestra pequeña y etiquetas discutibles. Debe servir para formular hipótesis, no grandes titulares.

Lista de evaluación responsable

  1. Fija un conjunto etiquetado antes de ajustar prompts, criterios o umbrales.
  2. Informa del punto de control exacto, versión del paquete, hardware y límites de contexto.
  3. Mide F1 macro y sensibilidad por clase además de la precisión global.
  4. Representa la fiabilidad por intervalos de confianza y examina los errores de alta confianza.
  5. Cambia el orden de las opciones y prueba paráfrasis.
  6. Incluye entradas ambiguas, vacías y fuera de alcance.
  7. Separa la inferencia con el modelo cargado de su carga y de la latencia total del servicio.

Fuente principal de datos: BENCHMARKS.md de Laya y archivos de resultados enlazados. Muestra independiente: laya-jev-lab. Valores verificados con el informe del proyecto el 25 de septiembre de 2026; pueden cambiar.