Hoy, para clonar una voz basta con unos segundos de grabación. Los sistemas de síntesis de voz más recientes escuchan una muestra corta y hablan con esa voz lo que les pidas. Pero ¿qué pasa cuando no hay ninguna grabación?
Piensa en un personaje histórico anterior a los micrófonos, en el protagonista de una novela o en los personajes secundarios de un videojuego. Hay una imagen, un retrato o un diseño, pero ninguna voz. Hasta ahora, la solución era elegir a ojo una voz de catálogo que “pegara”.
También pasa con algunas personas que no pueden hablar y se comunican con un dispositivo que habla por ellas, lo que se llama comunicación aumentativa y alternativa. Quien pierde la voz por una enfermedad a veces llega a grabarla antes y puede recuperarla en versión sintética. Quien no ha hablado nunca no tiene grabaciones, así que usa una voz de catálogo, la misma que muchas otras personas. Una voz generada a partir de su cara podría ser otra opción: sintética, pero plausible y distinta para cada persona.
En un trabajo que hemos presentado en IberSpeech 2026, junto a José A. González López (Universidad de Granada), exploramos esta vía: generar una voz plausible a partir de una sola foto de la cara. El preprint está en arXiv y el código, en GitHub.
¿De verdad se parece la voz a la cara?
Un poco, y conviene no exagerarlo.
Hay una base biológica: las mismas hormonas que durante el desarrollo hacen crecer la mandíbula también engrosan las cuerdas vocales. Por eso la cara da pistas sobre la voz, como la edad aproximada, el sexo o la complexión. Pero muchas otras cosas influyen en cómo suena alguien y no se ven en una foto: la respiración, la forma de la garganta, el acento, los hábitos al hablar.
Así que la relación entre cara y voz existe, pero es débil y no determina una voz concreta. Dos personas muy parecidas pueden sonar muy distinto.
Esto crea un problema conocido en este campo. Si entrenas un sistema para acertar la voz exacta de cada cara, aprende que lo más seguro es no arriesgar: acaba generando una voz media de hombre y una voz media de mujer, las dos igual de genéricas. Es lo que se llama colapso, y era lo primero que queríamos evitar.
Cómo lo hemos hecho
La idea central es no tocar la parte que ya funciona bien.
Partimos de un modelo abierto de síntesis de voz que ya suena muy natural. Ese modelo guarda un resumen de cómo suena cada voz, su “estilo”. Normalmente ese estilo se saca de una grabación. Nosotros lo sacamos de una cara.
Para eso dejamos el modelo de voz tal como estaba y le añadimos una pieza pequeña que traduce lo que ve un reconocedor facial al lenguaje de las voces. Por eso llamamos al método Freeze-Align: congelar la voz y alinear la cara con ella.
La clave está en qué le pedimos a esa pieza al aprender. No le exigimos que acierte la voz exacta de cada cara, porque eso lleva a las voces genéricas. Le pedimos que la cara de cada persona quede más cerca de su propia voz que de las demás, que las voces salgan variadas y que respete pistas básicas como la edad y el sexo aparentes.
Timbre de la cara, entonación del modelo
Una foto no dice nada sobre cómo entona alguien, ni sobre su ritmo o sus pausas. Si todo saliera de la cara, la voz sonaría monótona.
Por eso separamos las dos cosas. La cara aporta el timbre y la entonación la pone el propio modelo de voz. Además, hay un control para decidir cuánto pesa la cara. Con mucho peso, la voz se parece más a lo que sugiere la foto, pero pierde naturalidad. Con poco, suena muy natural pero más genérica. Cada uso puede elegir su punto.
Qué hemos visto
Entrenamos con vídeos de charlas en inglés y probamos el sistema con caras de personas que nunca había visto.
Las voces que genera suenan naturales y variadas: no se quedan en un par de voces genéricas. Y se parecen a la voz real de cada persona más de lo que cabría esperar por azar, aunque el parecido todavía es modesto.
También lo probamos en español. Adaptamos el modelo de voz a nuestro idioma y usamos la misma pieza que traduce las caras, sin volver a entrenarla. Funcionó, lo que sugiere que la relación entre cara y voz que aprende no depende mucho del idioma.
Lo que todavía no sabemos
La cara aporta una parte pequeña de la voz. La mayor parte sigue saliendo de lo que el modelo ya sabe sobre cómo suena la gente. Lo hemos probado con pocas personas y con medidores automáticos de calidad; falta una prueba de escucha con personas, que es la que de verdad dice si una voz convence.
Tampoco lo hemos probado con personas que usan comunicación aumentativa, y como entrenamos con adultos, las voces infantiles quedan fuera por ahora.
Es un trabajo de investigación, no un producto.
Próximos pasos
Vemos tres caminos para que la voz se parezca cada vez más a la persona.
El primero es partir de modelos de voz que conozcan más voces. El nuestro aprendió de un número limitado de hablantes, y solo puede proponer voces parecidas a las que ha oído. Un modelo entrenado con muchas más voces, de más edades, acentos y lenguas, tendría mucho más donde elegir.
El segundo, aprender de muchas más caras. Cuantas más parejas de cara y voz vea el sistema, y más diversas sean, mejor entenderá qué rasgos de la cara dicen algo de la voz y cuáles no.
El tercero, afinar cómo se unen cara y voz. Hoy esa conexión es todavía aproximada. Con métodos de alineación más precisos, la voz que sale de una foto debería acercarse más a la de esa persona.
Ninguno de estos pasos es inmediato, pero juntos nos acercarían a voces más fieles para los casos que contábamos al principio: personajes que nunca tuvieron voz y personas que la necesitan.
Una tecnología que hay que usar con cuidado
Conviene aclarar una cosa: esto no es clonar una voz. El sistema no escucha ninguna grabación, solo ve una cara, así que no puede reproducir la voz real de nadie. Lo que genera es una voz que suena plausible para esa cara, no la de esa persona. Aun así, tiene riesgos. Alguien podría presentar esa voz como si fuera la auténtica de una persona real. Y como aprende de datos reales, puede reforzar estereotipos sobre cómo “debería” sonar alguien según su aspecto.
Creemos que su uso responsable pasa por el consentimiento de las personas, por dejar claro de dónde sale cada voz y por evaluar sus sesgos antes de llevarla a cualquier producto. Los personajes de ficción, los videojuegos, la divulgación histórica o dar una opción más a quien no puede hablar son buenos terrenos para explorarla. Usarla con personas reales sin su permiso, no.
Si te interesa el detalle técnico, tienes el artículo en arXiv y el código en GitHub. Y si estás pensando en voces para personajes, escríbenos.