Los asistentes de voz con inteligencia artificial fallan por lentitud mucho antes que por falta de inteligencia. Esa es la premisa de un análisis técnico difundido por MarkTechPost, que compara las principales APIs de inferencia para agentes de voz y en tiempo real tomando como eje una métrica poco glamorosa pero determinante: el tiempo hasta el primer token, conocido como TTFT.

El TTFT (del inglés time to first token) mide cuántos milisegundos pasan desde que el sistema recibe una petición hasta que empieza a generar la primera unidad de respuesta. En un chat de texto, un retraso de medio segundo pasa inadvertido. En una conversación hablada, ese mismo retraso rompe la ilusión de naturalidad: la persona percibe silencios incómodos, interrumpe o cree que la máquina no la entendió.

Una métrica que sirve para empezar, no para terminar

El informe sostiene que el TTFT es el punto de partida correcto y el punto de llegada equivocado para elegir un proveedor. La razón es que un agente de voz no depende de un solo modelo, sino de una cadena de componentes que suman retardo en cada eslabón. La comparativa recorre esa pila completa: el modelo de lenguaje que genera la respuesta, el reconocimiento de voz (speech-to-text) que convierte lo que dice el usuario en texto, la síntesis de voz (text-to-speech) que devuelve la respuesta hablada y los sistemas de voz a voz (speech-to-speech) que integran todo el proceso.

Cada milisegundo cuenta porque los retardos se acumulan. Un modelo de lenguaje veloz pierde su ventaja si la transcripción inicial o la generación de audio final son lentas. Por eso la medición aislada de un solo componente puede engañar a los equipos que eligen su infraestructura mirando una sola cifra.

El análisis distingue con cuidado el origen de cada número: si fue medido de forma independiente, publicado por el proveedor o medido por el propio proveedor sobre su producto. Esa transparencia importa, porque en el sector es habitual que las cifras de rendimiento provengan del fabricante interesado. Los datos se verificaron contra fuentes primarias el 30 de agosto de 2026.

El objetivo: sonar como una conversación humana

La referencia práctica que persigue la industria es una latencia de voz a voz cercana a los 800 milisegundos de mediana, el umbral en que una charla con una máquina empieza a sentirse fluida. Empresas especializadas en infraestructura de voz, como Daily y LiveKit, han publicado guías sobre cómo optimizar cada capa para acercarse a ese número. La plataforma Daily documentó esa mediana de 800 ms como una meta alcanzable con la arquitectura adecuada, mientras que LiveKit ha detallado despliegues optimizados para reducir la demora.

Detrás de estas mediciones hay marcos de trabajo abiertos como Pipecat, que orquesta los distintos componentes de un agente conversacional, y firmas de análisis como Artificial Analysis, que publican metodologías para comparar el desempeño de modelos e infraestructura de forma reproducible.

Qué implica para quienes construyen productos de voz

Para desarrolladores y empresas, la lección es que optimizar un agente de voz es un problema de ingeniería de sistemas, no de elegir el modelo más inteligente. La ubicación geográfica de los servidores, el tamaño del modelo, la forma de transmitir el audio y el manejo de las interrupciones influyen tanto como la calidad de las respuestas.

En Latinoamérica ese factor pesa doble. La distancia física entre los centros de datos —concentrados en Estados Unidos y Europa— y los usuarios de la región agrega latencia de red que se suma a la del procesamiento. A eso se añade el reto del español con sus variantes regionales, donde los sistemas de reconocimiento y síntesis de voz todavía muestran desempeño desigual frente al inglés. Para quien quiera explorar el terreno, existen múltiples herramientas de generación de voz sintética que ilustran cómo ha avanzado la calidad del audio.

La conclusión práctica del informe apunta a un cambio de mentalidad: dejar de preguntar qué API responde más rápido en un test aislado y empezar a medir la experiencia completa que percibe el usuario cuando habla y espera respuesta.