Google WaveNet replica el habla humana gracias a inteligencia artificial

Hace ya bastante tiempo que los ordenadores son capaces de generar sonido a partir de un texto, pero la realidad es que el resultado hasta ahora siempre ha quedado lejos de replicar la forma de hablar que tenemos los humanos. Sin embargo, Google lleva bastante tiempo apostando por diferentes campos de la inteligencia artificial, que ahora pueden dar algunos frutos bastante interesantes. Uno de ellos es el Google WaveNet, un proyecto que ha conseguido generar sonidos que simulan de manera perturbadoramente creíble el habla humana.

La división de Google DeepMind es la que se encarga de investigar y aplicar los nuevos avances relacionados con la inteligencia artificial. Hace algunos meses ya vimos que las máquinas podían llegar a superar a los humanos en juegos tan estratégicos como el Go. El secreto de aquel éxito fue el aprendizaje a partir de cantidades ingentes de información y con Google WaveNet comparten parten de la fórmula.

Los primeros sistemas para generar habla humana por ordenador se basaban en una biblioteca de sonidos con una serie de normas para la combinación de dichos sonidos. Sin embargo, el nuevo sistema va mucho más allá y ahora divide cada sonido en miles de partes diferentes para generar cada una de ellas de manera independiente y permitiendo así un sonido mucho más realista.

Por lo tanto no se trata tanto de un sistema radicalmente diferente, sino de que ahora se le puede alimentar con miles y miles de datos para que aprenda. No sólo va a tener en cuenta qué letra va seguida de otra sino que es capaz de considerar muchas otras variables que incluyen la entonación o sonidos previos dentro de la misma frase. Se trata de un algoritmo basado en una red neural capaz de derivar decenas de inputs diferentes en un sólo sonido.

Los resultados son bastante espectaculares y permiten sacar algunas conclusiones interesantes. Por ejemplo, si Google WaveNet se entrena con datos de una sola persona, los sonidos resultantes van a ser calcados a los de esa persona puesto que la tecnología no conoce otros sonidos. Sin embargo, si se le dan datos de varias personas diferentes, los rasgos personales se cancelan y se obtiene un habla mucho más clara.

De manera similar, si los datos que el software adquiere son de personas que hablan inglés británico, el sonido que producirá será inglés británico, mientras que si recibe inputs en alemán, el discurso que generará será en auténtico alemán. Incluso es capaz de generar piezas musicales a partir de datos basados en música clásica.

Aunque la tecnología es muy prometedora, todavía tiene algunas dificultades que superar. Por el momento no es capaz de traducir directamente texto a sonido, sino que necesita una traducción a precursores de audio. Además, la capacidad de procesamiento que requiere es tan elevada que no esta tecnología no va a estar disponible para los usuarios generales próximamente.

Marcar el enlace permanente.

Comentarios cerrados.