Mediciones
Los números que tenemos, y los que todavía no.
Esta página existe para poder rebatirla. Cada cifra lleva cómo se calculó y qué no demuestra, y hay una sección entera dedicada a lo que aún no hemos medido. Si algo de aquí no te cuadra, escríbenos: preferimos discutir una metodología a defender un titular.
El conjunto de referencia
Llamadas de verdad, con el ruido de verdad.
- Llamadas reales de atención al cliente, no audio de laboratorio: mono, comprimido, con ruido de fondo y solapes.
- Duración entre 1 y 5 minutos. Una de las veinte está muda y se usa a propósito, para comprobar que un audio sin voz no rompe el proceso ni produce un resultado inventado.
- Procesadas con el motor completo y en las mismas condiciones que una petición de producción.
- El conjunto es pequeño y se dice de frente: veinte llamadas dan señal, no una cifra de catálogo. Crece con cada tanda que anotamos.
Reparto
El conjunto crece cada vez que anotamos una tanda nueva. Cuando cambia, los números de esta página cambian con él y la fecha de arriba también.
De estas llamadas no sale nada, y por eso no verás ningún ejemplo
Son grabaciones reales de atención al cliente, cedidas para medir. En esta página hay solo agregados: cuántas llamadas, en qué idiomas y qué porcentajes salen. Ni una transcripción de ejemplo, ni el nombre de una empresa, ni el sector, ni un fragmento «ilustrativo». Enseñar una frase suelta para lucir la calidad sería exactamente lo que prometemos no hacer con tus audios.
Resultados
Cuatro mediciones, cada una con su letra pequeña arriba.
El orden no es casual: primero lo que se compara contra una referencia humana, que es lo único que permite hablar de acierto; después lo que solo se puede comparar contra otra máquina, que es acuerdo y no acierto.
Detección automática de idioma
19/19
llamadas con el idioma correcto
15/19 con detector de una sola pasada.
Cómo se calcula
El idioma real de cada llamada lo etiquetó una persona escuchándola, así que aquí sí hay una verdad contra la que medir. Se compara con lo que devuelve el motor en modo `language: "auto"`, sin pistas y sin forzar nada. La llamada muda queda fuera del recuento: no tiene idioma que acertar.
Qué NO demuestra
Veinte llamadas en tres idiomas. Es la prueba de que la cascada arregla el fallo concreto que teníamos —castellano confundido con gallego y con catalán—, no una tasa de acierto general sobre noventa y nueve idiomas.
Atribución de hablante
85,7 %
de acuerdo mediano en el tiempo
Cómo se calcula
Se comparan los turnos del motor con los de un sistema comercial independiente sobre las 18 llamadas que tienen dos interlocutores. Se muestrea la conversación cada 10 ms, se busca la correspondencia uno a uno de etiquetas que más favorece al contrario y se mide qué porción del tiempo hablado coincide.
Qué NO demuestra
Es acuerdo entre dos sistemas, NO precisión: ninguno de los dos es la verdad. Donde discrepan puede estar equivocado cualquiera de ellos. Sirve para comparar versiones nuestras entre sí y para detectar un derrumbe; no para afirmar que acertamos el 85,7 % de las veces.
Derrumbe del agrupamiento
0
llamadas de dos voces colapsadas en una
8 de 20 con antes de rehacer el agrupamiento.
Cómo se calcula
Un derrumbe es asignar toda la conversación a un solo hablante, o dejar al segundo por debajo del 15 % del tiempo. Se cuenta sobre las 20 llamadas. Las dos salidas de un solo hablante que quedan son correctas: una llamada tiene efectivamente una sola voz —la referencia independiente coincide— y la otra es la muda.
Qué NO demuestra
Mide que no nos derrumbamos, no que separemos bien. Una llamada puede repartir el tiempo de forma razonable y aun así cortar los turnos en el sitio equivocado; eso lo mide la métrica de acuerdo, no ésta.
Módulos de comprensión
7 de 7
módulos con resultado en las 20 llamadas
Cómo se calcula
Se pidieron los siete módulos sobre las veinte llamadas y se comprobó que cada uno devuelve una estructura válida y no vacía, en los tres idiomas del conjunto.
Qué NO demuestra
Es cobertura, no calidad: dice que el módulo responde y responde bien formado, no que el resumen sea el mejor posible. Juzgar la calidad de un resumen exige criterio humano sobre una muestra grande, y no lo hemos hecho todavía.
Todavía sin medir
Lo que falta, dicho con el mismo tamaño de letra.
Una página de mediciones que solo enseña lo que sale bien no es una medición, es un folleto. Esto es lo que sabemos que no sabemos.
Tasa de error de palabra (WER)
Es la cifra que todo el mundo pide y no la publicamos, porque medirla de verdad exige una transcripción humana palabra a palabra del conjunto entero y todavía no existe. Comparar nuestro texto con el de otro sistema mide en qué se diferencian dos máquinas, no cuál acierta. Cuando esté anotado se publica el número, salga como salga.
Gallego, euskera y portugués
Están en la lista de idiomas con calidad medida porque el motor los trata igual que a los otros tres, pero el conjunto de referencia todavía no incluye llamadas en esas lenguas. Hasta que las incluya, lo que hay para ellas es el mismo tratamiento, no una medición.
Latencia de extremo a extremo
Tenemos los tiempos internos, pero medirlos con la cola vacía y llamarlo latencia sería engañar: el número que importa es bajo carga concurrente real, y esa carga aún no existe. Se publicará con el volumen de la beta detrás.
Comparativa contra otros proveedores
No la vamos a publicar. Una comparativa creíble exige el mismo conjunto, la misma metodología y el mismo cuidado con el sistema del otro que con el propio, y una hecha por nosotros la ganaríamos siempre. Si quieres comparar, la vía honesta es que pases tus llamadas por los dos.
La única medición que te sirve es la tuya.
Nuestro conjunto son veinte llamadas de tres sectores concretos. El tuyo tiene tu vocabulario, tu centralita y tus acentos, y ahí es donde se decide si esto te sirve. Sube una llamada real y compárala con lo que uses hoy: es media hora de trabajo y vale más que cualquier tabla de esta página.