Saltar al contenido
Callsist

Mediciones

Los números que tenemos, y los que todavía no.

Esta página existe para poder rebatirla. Cada cifra lleva cómo se calculó y qué no demuestra, y hay una sección entera dedicada a lo que aún no hemos medido. Si algo de aquí no te cuadra, escríbenos: preferimos discutir una metodología a defender un titular.

Medido el 28 de julio de 202620 llamadas reales69 minutos de audio

El conjunto de referencia

Llamadas de verdad, con el ruido de verdad.

  • Llamadas reales de atención al cliente, no audio de laboratorio: mono, comprimido, con ruido de fondo y solapes.
  • Duración entre 1 y 5 minutos. Una de las veinte está muda y se usa a propósito, para comprobar que un audio sin voz no rompe el proceso ni produce un resultado inventado.
  • Procesadas con el motor completo y en las mismas condiciones que una petición de producción.
  • El conjunto es pequeño y se dice de frente: veinte llamadas dan señal, no una cifra de catálogo. Crece con cada tanda que anotamos.

Reparto

Castellano8 llamadas
Catalán6 llamadas
Inglés5 llamadas
Sin voz (control)1 llamada

El conjunto crece cada vez que anotamos una tanda nueva. Cuando cambia, los números de esta página cambian con él y la fecha de arriba también.

De estas llamadas no sale nada, y por eso no verás ningún ejemplo

Son grabaciones reales de atención al cliente, cedidas para medir. En esta página hay solo agregados: cuántas llamadas, en qué idiomas y qué porcentajes salen. Ni una transcripción de ejemplo, ni el nombre de una empresa, ni el sector, ni un fragmento «ilustrativo». Enseñar una frase suelta para lucir la calidad sería exactamente lo que prometemos no hacer con tus audios.

Resultados

Cuatro mediciones, cada una con su letra pequeña arriba.

El orden no es casual: primero lo que se compara contra una referencia humana, que es lo único que permite hablar de acierto; después lo que solo se puede comparar contra otra máquina, que es acuerdo y no acierto.

Acierto contra referencia humana

Detección automática de idioma

19/19

llamadas con el idioma correcto

15/19 con detector de una sola pasada.

Cómo se calcula

El idioma real de cada llamada lo etiquetó una persona escuchándola, así que aquí sí hay una verdad contra la que medir. Se compara con lo que devuelve el motor en modo `language: "auto"`, sin pistas y sin forzar nada. La llamada muda queda fuera del recuento: no tiene idioma que acertar.

Qué NO demuestra

Veinte llamadas en tres idiomas. Es la prueba de que la cascada arregla el fallo concreto que teníamos —castellano confundido con gallego y con catalán—, no una tasa de acierto general sobre noventa y nueve idiomas.

Castellano8/8
Catalán6/6
Inglés5/5
Acuerdo con un sistema independiente

Atribución de hablante

85,7 %

de acuerdo mediano en el tiempo

Cómo se calcula

Se comparan los turnos del motor con los de un sistema comercial independiente sobre las 18 llamadas que tienen dos interlocutores. Se muestrea la conversación cada 10 ms, se busca la correspondencia uno a uno de etiquetas que más favorece al contrario y se mide qué porción del tiempo hablado coincide.

Qué NO demuestra

Es acuerdo entre dos sistemas, NO precisión: ninguno de los dos es la verdad. Donde discrepan puede estar equivocado cualquiera de ellos. Sirve para comparar versiones nuestras entre sí y para detectar un derrumbe; no para afirmar que acertamos el 85,7 % de las veces.

Mejor llamada95,6 %
Peor llamada66,0 %
Por encima del 80 %15 de 18
Acierto contra referencia humana

Derrumbe del agrupamiento

0

llamadas de dos voces colapsadas en una

8 de 20 con antes de rehacer el agrupamiento.

Cómo se calcula

Un derrumbe es asignar toda la conversación a un solo hablante, o dejar al segundo por debajo del 15 % del tiempo. Se cuenta sobre las 20 llamadas. Las dos salidas de un solo hablante que quedan son correctas: una llamada tiene efectivamente una sola voz —la referencia independiente coincide— y la otra es la muda.

Qué NO demuestra

Mide que no nos derrumbamos, no que separemos bien. Una llamada puede repartir el tiempo de forma razonable y aun así cortar los turnos en el sitio equivocado; eso lo mide la métrica de acuerdo, no ésta.

Cobertura

Módulos de comprensión

7 de 7

módulos con resultado en las 20 llamadas

Cómo se calcula

Se pidieron los siete módulos sobre las veinte llamadas y se comprobó que cada uno devuelve una estructura válida y no vacía, en los tres idiomas del conjunto.

Qué NO demuestra

Es cobertura, no calidad: dice que el módulo responde y responde bien formado, no que el resumen sea el mejor posible. Juzgar la calidad de un resumen exige criterio humano sobre una muestra grande, y no lo hemos hecho todavía.

Todavía sin medir

Lo que falta, dicho con el mismo tamaño de letra.

Una página de mediciones que solo enseña lo que sale bien no es una medición, es un folleto. Esto es lo que sabemos que no sabemos.

Tasa de error de palabra (WER)

Es la cifra que todo el mundo pide y no la publicamos, porque medirla de verdad exige una transcripción humana palabra a palabra del conjunto entero y todavía no existe. Comparar nuestro texto con el de otro sistema mide en qué se diferencian dos máquinas, no cuál acierta. Cuando esté anotado se publica el número, salga como salga.

Gallego, euskera y portugués

Están en la lista de idiomas con calidad medida porque el motor los trata igual que a los otros tres, pero el conjunto de referencia todavía no incluye llamadas en esas lenguas. Hasta que las incluya, lo que hay para ellas es el mismo tratamiento, no una medición.

Latencia de extremo a extremo

Tenemos los tiempos internos, pero medirlos con la cola vacía y llamarlo latencia sería engañar: el número que importa es bajo carga concurrente real, y esa carga aún no existe. Se publicará con el volumen de la beta detrás.

Comparativa contra otros proveedores

No la vamos a publicar. Una comparativa creíble exige el mismo conjunto, la misma metodología y el mismo cuidado con el sistema del otro que con el propio, y una hecha por nosotros la ganaríamos siempre. Si quieres comparar, la vía honesta es que pases tus llamadas por los dos.

La única medición que te sirve es la tuya.

Nuestro conjunto son veinte llamadas de tres sectores concretos. El tuyo tiene tu vocabulario, tu centralita y tus acentos, y ahí es donde se decide si esto te sirve. Sube una llamada real y compárala con lo que uses hoy: es media hora de trabajo y vale más que cualquier tabla de esta página.