El modelo de síntesis de voz Qwen Audio 3.0 TTS Plus, desarrollado por Alibaba, se colocó en el primer lugar del tablero de clasificación de Artificial Analysis, la firma que evalúa herramientas de inteligencia artificial. El sistema convierte texto en habla (una tecnología conocida como TTS, por sus siglas en inglés) y superó a competidores establecidos en calidad percibida, aunque a costa de una velocidad de generación notablemente inferior.
La clasificación de Artificial Analysis, bautizada como Speech Arena, ordena a los modelos según comparaciones a ciegas en las que oyentes humanos eligen qué muestra suena mejor. Que Alibaba se ubique arriba refuerza el avance sostenido de los laboratorios chinos en generación de audio, un terreno donde hasta hace poco dominaban empresas occidentales.
Qué ofrece el modelo
Qwen Audio 3.0 TTS Plus admite 16 idiomas y permite ajustar la manera de hablar mediante instrucciones en lenguaje natural o etiquetas insertadas en el texto. Por ejemplo, un usuario puede marcar un fragmento con una indicación como [angry] para que la voz adopte un tono enojado, o describir el estilo deseado con una frase. Ese control expresivo es uno de los factores que suele inclinar las preferencias de los evaluadores.
Alibaba publicó una página con muestras de audio para escuchar el rendimiento del modelo en distintos escenarios, y la tecnología está disponible a través de la documentación de Alibaba Cloud Model Studio.
El precio de la calidad: velocidad
El punto débil está en el rendimiento por segundo. Qwen Audio 3.0 TTS Plus genera unos 16 caracteres de texto por segundo, un ritmo muy por debajo del de rivales como Sonic 3.5 y Simba 3.2. Para aplicaciones donde la latencia importa poco —narración de audiolibros, doblaje o producción de contenido pregrabado— la diferencia es tolerable. En cambio, para asistentes de voz conversacionales o interacciones en tiempo real, esa lentitud puede convertirse en un obstáculo real.
La disyuntiva ilustra una tensión frecuente en el sector: los modelos que priorizan naturalidad y expresividad tienden a requerir más cómputo, mientras que los optimizados para respuesta inmediata sacrifican algo de matiz. Cuál conviene depende del uso concreto que le dé cada empresa o desarrollador.
Contexto competitivo
La familia Qwen es la línea de modelos de IA de Alibaba y ha ganado tracción tanto en tareas de lenguaje como, ahora, en audio. Su irrupción en lo más alto de un ranking de voz sintética se suma a una racha de anuncios de proveedores chinos que compiten de frente con los occidentales en varias categorías de la inteligencia artificial generativa.
Para quienes buscan aplicar estas tecnologías, conviene distinguir entre generación de voz y su reverso, el reconocimiento del habla. Existen ya numerosas herramientas de IA para transcribir audio a texto que operan en sentido contrario al de un sistema TTS.
El liderazgo en estos tableros suele ser efímero: cada nueva versión reordena las posiciones en cuestión de semanas. La próxima pregunta para Alibaba será si logra recortar la brecha de velocidad sin perder la calidad que hoy la puso en la cima.
