Instrucciones en lenguaje natural permiten controlar entonación, emoción, velocidad y volumen; también ejecuta comandos complejos
Tokenizador de voz propio mejora la velocidad de generación y eficiencia
Kakao ha mejorado la tecnología de generación de voz de su modelo de inteligencia artificial omnimodal "Kanana-o" desarrollado internamente. La empresa ha avanzado el rendimiento más allá del simple nivel de lectura natural, permitiendo que los usuarios controlen la entonación, la emoción, la velocidad y el volumen mediante instrucciones en lenguaje natural.
Kakao presentó públicamente la tecnología de generación de voz de Kanana-o el 4 de agosto a través de su blog técnico. El nuevo modelo se caracteriza por generar voz reflejando la forma de habla que el usuario desea mediante la introducción de instrucciones en lenguaje natural.
Por ejemplo, el sistema comprende instrucciones como "léelo muy rápido", "léelo con voz grave", "léelo con voz triste", "léelo con acento del dialecto de Gyeongsan", reflejando velocidad, volumen, tono, así como emoción e inflexión. También puede ejecutar instrucciones basadas en roles como "como si fueras un comentarista deportivo", "como un locutor de noticias", "como si leyeras un cuento infantil". Además, procesa comandos complejos que combinan múltiples condiciones simultáneamente, como "baja el tono, léelo rápido con voz triste". Un aspecto destacado es que, aunque se entrenó principalmente con coreano, puede ejecutar las mismas instrucciones de entonación en la generación de voz en inglés.
El rendimiento también ha mejorado. Kanana-o logró una puntuación de 94,50 puntos en el estándar de referencia coreano "InstructTTSEval", que evalúa la capacidad de cumplir instrucciones de entonación, superando a GPT-4o-mini TTS (91,10 puntos).
Kakao también mejoró la velocidad y eficiencia de la generación de voz. La empresa implementó su tokenizador de voz desarrollado internamente llamado "LM-SPT". Esta tecnología comprime y representa la voz con un número reducido de tokens, disminuyendo la cantidad de datos que la IA debe procesar y aumentando la velocidad de generación de voz.
LM-SPT registró un desempeño superior en evaluaciones que compararon la capacidad de comprensión y generación de voz en coreano e inglés entre diversos modelos de lenguaje de voz.
* Este artículo ha sido traducido por IA.
