Saltar al contenido
Callsist

Catálogo

Los modelos de Callsist

Todos los identificadores llevan el prefijo callsist- y todos se consultan por API en GET /v1/models. Cambiar de modelo es cambiar una cadena de texto en tu petición: la forma de la respuesta no cambia.

ModeloFamiliaPara quéPrecioEstado
callsist-scribe-1TranscripciónTranscripción completa: hablantes, timestamps de palabra, idioma y formato.0,39 €/hDisponible en beta
callsist-scribe-1-ecoTranscripciónTexto y timestamps de segmento. Sin diarización ni marca por palabra.0,24 €/hEn preparación
callsist-llm-1-largeLenguajeModelo de lenguaje de ventana larga para razonar sobre conversaciones enteras.1,50 € / M entrada · 8,00 € / M salidaDisponible en beta
callsist-llm-1-smallLenguajeRápido y económico, para clasificar y extraer a volumen.0,65 € / M entrada · 3,75 € / M salidaDisponible en beta
callsist-embed-1EmbeddingsEmbeddings multilingües con dimensión configurable.0,28 € / M tokensDisponible en beta
callsist-stream-1TranscripciónTranscripción en tiempo real sobre WebSocket.Por definirEn el roadmap

callsist-scribe-1

Disponible en betaTranscripción

El modelo por defecto para convertir una conversación en un objeto de datos. No devuelve un bloque de texto: devuelve intervenciones con hablante atribuido, cada palabra con su marca de tiempo, el idioma detectado con su nivel de confianza, puntuación y números ya formateados. Detrás hay un motor de siete etapas desarrollado por nosotros —detección de actividad de voz, identificación de idioma en espacio restringido, reconocimiento, alineación forzada, diarización acústica, atribución semántica de rol y detección de datos personales— y cada etapa tiene un camino de degradación que produce un resultado peor pero válido. Una llamada nunca se pierde entera porque falle una pieza accesoria.

Capacidades

  • Diarización de hablantes con etiqueta de rol agente / cliente
  • Timestamps por palabra mediante alineación forzada propia
  • Detección automática de idioma con umbral de confianza configurable
  • Puntuación, mayúsculas y formato de números, importes y fechas
  • Vocabulario personalizado por petición
  • Audio mono, estéreo y multicanal
  • Salidas JSON, SRT, VTT y texto plano

Especificaciones

EntradaAudio o vídeo, hasta 2 GB / 10 h
Idiomas99
ModoAsíncrono, con webhook o sondeo
FacturaciónPor segundo de audio, mínimo 5 s

Precio

0,39 €/h

0,0065 €/min · baja a 0,33 €/h desde 1.000 h al mes

callsist-scribe-1-eco

En preparaciónTranscripción

La variante económica para cuando no hace falta saber quién dijo qué: transcripción, segmentos con inicio y fin, detección de idioma, y de ahí salen los subtítulos SRT y VTT. Se salta la alineación forzada y la diarización, que son las dos etapas caras del motor. Pensada para archivos de audio de un solo hablante, notas de voz y volúmenes grandes de indexación donde el coste manda sobre la estructura.

Capacidades

  • Transcripción con puntuación y formato
  • Timestamps por segmento
  • Detección automática de idioma
  • Salidas JSON, SRT, VTT y texto plano

Especificaciones

EntradaAudio o vídeo, hasta 2 GB / 10 h
Idiomas99
No incluyeDiarización · timestamps de palabra
FacturaciónPor segundo de audio, mínimo 5 s

Precio

0,24 €/h

Precio previsto. Se confirma al abrir el modelo durante la beta.

callsist-llm-1-large

Disponible en betaLenguaje

Ventana de 250.000 tokens: entra un día completo de llamadas de un agente sin trocear nada. Es el modelo que usamos internamente en las etapas donde la calidad en catalán, gallego y euskera decide el resultado —atribución de hablante y detección de datos personales— y está disponible por API con la misma forma que ya conoces: chat, JSON estructurado y llamada a herramientas.

Capacidades

  • Chat con streaming por SSE
  • Salida JSON estructurada y llamada a herramientas
  • Compatible con los SDK que ya usas: cambia la URL base y la clave
  • Multilingüe, con cobertura real de las lenguas ibéricas

Especificaciones

Contexto250.000 tokens
EndpointPOST /v1/chat/completions
StreamingSí, SSE
FacturaciónPor token de entrada y de salida

Precio

1,50 € / M entrada · 8,00 € / M salida

callsist-llm-1-small

Disponible en betaLenguaje

El caballo de batalla. Es el modelo con el que corren la mayoría de los módulos de comprensión, lo que significa que su calidad la medimos nosotros todos los días contra nuestro propio conjunto de referencia. Mismo contrato que el grande, un tercio del precio, y 256.000 tokens de contexto que en la práctica lo dejan a la par para casi todo lo que se le pide a una conversación.

Capacidades

  • Chat con streaming por SSE
  • Salida JSON estructurada y llamada a herramientas
  • Clasificación, extracción y etiquetado por lotes
  • Compatible con los SDK que ya usas

Especificaciones

Contexto256.000 tokens
EndpointPOST /v1/chat/completions
StreamingSí, SSE
FacturaciónPor token de entrada y de salida

Precio

0,65 € / M entrada · 3,75 € / M salida

callsist-embed-1

Disponible en betaEmbeddings

Para buscar por significado dentro de las transcripciones: encontrar todas las llamadas donde alguien amenazó con darse de baja aunque nadie dijera la palabra «baja». La dimensión del vector se pide en la petición, así que se ajusta al índice que ya tengas en lugar de obligarte a redimensionarlo.

Capacidades

  • Búsqueda semántica sobre transcripciones
  • Recuperación aumentada (RAG) sobre tu propio histórico
  • Dimensión reducible en la petición
  • Compatible con los SDK que ya usas

Especificaciones

Contexto32.000 tokens
EndpointPOST /v1/embeddings
DimensiónConfigurable por petición
FacturaciónPor token de entrada

Precio

0,28 € / M tokens

callsist-stream-1

En el roadmapTranscripción

Transcripción mientras la llamada ocurre, para asistencia al agente en vivo y para detección de escalado en el momento. Está en el roadmap y todavía no tiene fecha pública: preferimos anunciarlo cuando se pueda probar. Si es lo que bloquea tu integración, dínoslo y entra en la lista de prioridades con nombre y apellidos.

Capacidades

  • Transcripción parcial y final sobre WebSocket
  • Diarización en vivo
  • Pensado para asistencia al agente durante la llamada

Especificaciones

EstadoEn el roadmap
ModoWebSocket bidireccional
DisponibilidadSin fecha pública

Precio

Por definir

Una precisión

Qué es exactamente nuestro.

Callsist Engine es el motor completo que rodea al reconocimiento: preparación del audio, detección de actividad de voz, identificación de idioma en un espacio restringido, troceado por silencios, alineación forzada para los timestamps de palabra, diarización acústica con puerta de calidad, atribución semántica del papel de cada hablante y detección de datos personales en tres capas. Ese motor está desarrollado por nosotros y es donde está la diferencia de calidad en las lenguas que nos importan.

Lo que no vamos a decir, porque no sería cierto, es que hayamos entrenado los pesos de los modelos desde cero. Preferimos que esta frase esté en nuestra propia página a que la escriba otro por nosotros. Cuando publiquemos cifras de calidad serán nuestras, medidas contra un conjunto de referencia anotado a mano, con la metodología publicada al lado — y hasta que existan, no habrá cifras.

Los 99 idiomas del catálogo se transcriben. En las 6 lenguas de la península ibérica es donde medimos y donde nos comprometemos.

Pruébalos con una llamada tuya.

Claves de prueba gratuitas e ilimitadas, sin tarjeta.