Catálogo
Los modelos de Callsist
Todos los identificadores llevan el prefijo callsist- y todos se consultan por API en GET /v1/models. Cambiar de modelo es cambiar una cadena de texto en tu petición: la forma de la respuesta no cambia.
| Modelo | Familia | Para qué | Precio | Estado |
|---|---|---|---|---|
| callsist-scribe-1 | Transcripción | Transcripción completa: hablantes, timestamps de palabra, idioma y formato. | 0,39 €/h | Disponible en beta |
| callsist-scribe-1-eco | Transcripción | Texto y timestamps de segmento. Sin diarización ni marca por palabra. | 0,24 €/h | En preparación |
| callsist-llm-1-large | Lenguaje | Modelo de lenguaje de ventana larga para razonar sobre conversaciones enteras. | 1,50 € / M entrada · 8,00 € / M salida | Disponible en beta |
| callsist-llm-1-small | Lenguaje | Rápido y económico, para clasificar y extraer a volumen. | 0,65 € / M entrada · 3,75 € / M salida | Disponible en beta |
| callsist-embed-1 | Embeddings | Embeddings multilingües con dimensión configurable. | 0,28 € / M tokens | Disponible en beta |
| callsist-stream-1 | Transcripción | Transcripción en tiempo real sobre WebSocket. | Por definir | En el roadmap |
callsist-scribe-1
Disponible en betaTranscripciónEl modelo por defecto para convertir una conversación en un objeto de datos. No devuelve un bloque de texto: devuelve intervenciones con hablante atribuido, cada palabra con su marca de tiempo, el idioma detectado con su nivel de confianza, puntuación y números ya formateados. Detrás hay un motor de siete etapas desarrollado por nosotros —detección de actividad de voz, identificación de idioma en espacio restringido, reconocimiento, alineación forzada, diarización acústica, atribución semántica de rol y detección de datos personales— y cada etapa tiene un camino de degradación que produce un resultado peor pero válido. Una llamada nunca se pierde entera porque falle una pieza accesoria.
Capacidades
- Diarización de hablantes con etiqueta de rol agente / cliente
- Timestamps por palabra mediante alineación forzada propia
- Detección automática de idioma con umbral de confianza configurable
- Puntuación, mayúsculas y formato de números, importes y fechas
- Vocabulario personalizado por petición
- Audio mono, estéreo y multicanal
- Salidas JSON, SRT, VTT y texto plano
Especificaciones
Precio
0,39 €/h
0,0065 €/min · baja a 0,33 €/h desde 1.000 h al mes
callsist-scribe-1-eco
En preparaciónTranscripciónLa variante económica para cuando no hace falta saber quién dijo qué: transcripción, segmentos con inicio y fin, detección de idioma, y de ahí salen los subtítulos SRT y VTT. Se salta la alineación forzada y la diarización, que son las dos etapas caras del motor. Pensada para archivos de audio de un solo hablante, notas de voz y volúmenes grandes de indexación donde el coste manda sobre la estructura.
Capacidades
- Transcripción con puntuación y formato
- Timestamps por segmento
- Detección automática de idioma
- Salidas JSON, SRT, VTT y texto plano
Especificaciones
Precio
0,24 €/h
Precio previsto. Se confirma al abrir el modelo durante la beta.
callsist-llm-1-large
Disponible en betaLenguajeVentana de 250.000 tokens: entra un día completo de llamadas de un agente sin trocear nada. Es el modelo que usamos internamente en las etapas donde la calidad en catalán, gallego y euskera decide el resultado —atribución de hablante y detección de datos personales— y está disponible por API con la misma forma que ya conoces: chat, JSON estructurado y llamada a herramientas.
Capacidades
- Chat con streaming por SSE
- Salida JSON estructurada y llamada a herramientas
- Compatible con los SDK que ya usas: cambia la URL base y la clave
- Multilingüe, con cobertura real de las lenguas ibéricas
Especificaciones
Precio
1,50 € / M entrada · 8,00 € / M salida
callsist-llm-1-small
Disponible en betaLenguajeEl caballo de batalla. Es el modelo con el que corren la mayoría de los módulos de comprensión, lo que significa que su calidad la medimos nosotros todos los días contra nuestro propio conjunto de referencia. Mismo contrato que el grande, un tercio del precio, y 256.000 tokens de contexto que en la práctica lo dejan a la par para casi todo lo que se le pide a una conversación.
Capacidades
- Chat con streaming por SSE
- Salida JSON estructurada y llamada a herramientas
- Clasificación, extracción y etiquetado por lotes
- Compatible con los SDK que ya usas
Especificaciones
Precio
0,65 € / M entrada · 3,75 € / M salida
callsist-embed-1
Disponible en betaEmbeddingsPara buscar por significado dentro de las transcripciones: encontrar todas las llamadas donde alguien amenazó con darse de baja aunque nadie dijera la palabra «baja». La dimensión del vector se pide en la petición, así que se ajusta al índice que ya tengas en lugar de obligarte a redimensionarlo.
Capacidades
- Búsqueda semántica sobre transcripciones
- Recuperación aumentada (RAG) sobre tu propio histórico
- Dimensión reducible en la petición
- Compatible con los SDK que ya usas
Especificaciones
Precio
0,28 € / M tokens
callsist-stream-1
En el roadmapTranscripciónTranscripción mientras la llamada ocurre, para asistencia al agente en vivo y para detección de escalado en el momento. Está en el roadmap y todavía no tiene fecha pública: preferimos anunciarlo cuando se pueda probar. Si es lo que bloquea tu integración, dínoslo y entra en la lista de prioridades con nombre y apellidos.
Capacidades
- Transcripción parcial y final sobre WebSocket
- Diarización en vivo
- Pensado para asistencia al agente durante la llamada
Especificaciones
Precio
Por definir
Una precisión
Qué es exactamente nuestro.
Callsist Engine es el motor completo que rodea al reconocimiento: preparación del audio, detección de actividad de voz, identificación de idioma en un espacio restringido, troceado por silencios, alineación forzada para los timestamps de palabra, diarización acústica con puerta de calidad, atribución semántica del papel de cada hablante y detección de datos personales en tres capas. Ese motor está desarrollado por nosotros y es donde está la diferencia de calidad en las lenguas que nos importan.
Lo que no vamos a decir, porque no sería cierto, es que hayamos entrenado los pesos de los modelos desde cero. Preferimos que esta frase esté en nuestra propia página a que la escriba otro por nosotros. Cuando publiquemos cifras de calidad serán nuestras, medidas contra un conjunto de referencia anotado a mano, con la metodología publicada al lado — y hasta que existan, no habrá cifras.
Los 99 idiomas del catálogo se transcriben. En las 6 lenguas de la península ibérica es donde medimos y donde nos comprometemos.
Pruébalos con una llamada tuya.
Claves de prueba gratuitas e ilimitadas, sin tarjeta.