La empresa británica PolyAI anunció Dialog-RSN-1, un modelo de diálogo diseñado para agentes de voz que procesa directamente el audio de quien llama, en lugar de trabajar sobre una transcripción de texto generada por un sistema de reconocimiento de voz. Según la publicación oficial de PolyAI, el sistema busca reducir la latencia y los errores que suelen aparecer en las llamadas automatizadas de atención al cliente.
La propuesta central es que un mismo modelo se encargue de varias tareas que antes vivían en piezas separadas: detectar cuándo termina de hablar el usuario (el llamado turno de conversación), reconocer lo que dijo, ejecutar funciones o llamadas a sistemas externos, y generar la respuesta. PolyAI lo describe como un modelo audio-nativo, es decir, que percibe la señal de voz completa —tono, pausas, interrupciones— y no solo las palabras convertidas en texto plano.
Por qué importa quitar el intermediario de texto
En la mayoría de los asistentes telefónicos actuales, el audio pasa primero por un módulo de reconocimiento de voz (ASR, por sus siglas en inglés) que lo transforma en texto. Recién entonces un modelo de lenguaje interpreta ese texto y decide qué contestar. Ese paso intermedio introduce demoras y, sobre todo, pierde información: la transcripción borra matices como una duda, un titubeo o el momento exacto en que alguien quiere interrumpir.
Al leer el audio de forma directa, Dialog-RSN-1 pretende conservar esas señales y decidir con mayor precisión cuándo tomar la palabra. PolyAI afirma que en despliegues reales el modelo responde en menos de 300 milisegundos, un umbral que en telefonía marca la diferencia entre una conversación fluida y una que se siente entrecortada.
La voz de salida queda por fuera
Una decisión de diseño llamativa es que el modelo mantiene separada la síntesis de voz (el componente text-to-speech o TTS que convierte la respuesta en sonido). PolyAI sostiene que así la voz del agente sigue siendo controlable: las empresas pueden definir cómo suena su asistente sin que ese aspecto quede atado al comportamiento del modelo de diálogo. Para quien quiera entender esa capa por separado, existen múltiples herramientas de generación de voz sintética que cumplen esa función.
Otra diferencia con los sistemas de voz en tiempo real que se popularizaron en el último año es el modo de operación. En vez de mantener un flujo de audio siempre abierto entre el usuario y el modelo, Dialog-RSN-1 funciona por peticiones, como un modelo de lenguaje tradicional que recibe una entrada y devuelve una respuesta. Ese esquema facilita integrar el modelo con las herramientas de negocio y controlar cuándo se activa.
Un movimiento en el negocio de la atención al cliente
PolyAI se especializa en asistentes de voz para call centers y opera en sectores como restaurantes, seguros, servicios financieros y salud. La compañía levantó una ronda de financiación Serie D por 86 millones de dólares para expandir su tecnología de atención telefónica automatizada, según su propia información corporativa.
El lanzamiento llega en un momento de competencia intensa por los agentes de voz capaces de resolver llamadas sin intervención humana. La apuesta de fusionar percepción de audio, comprensión y acción en un solo modelo apunta a un problema concreto: que las llamadas automatizadas dejen de sonar robóticas y de fallar en los momentos en que el cliente interrumpe o cambia de idea. PolyAI abrió una lista de acceso anticipado para las empresas interesadas en probarlo.
Queda por ver cómo se comporta el modelo fuera de los entornos controlados de sus propios despliegues, donde el ruido de fondo, los acentos y las conversaciones caóticas siguen siendo el verdadero examen de cualquier agente de voz.
