
¿Cómo sonaría esta cara? Voces sintéticas a partir de una sola foto
Presentamos en IberSpeech 2026 un método que genera una voz plausible a partir de una foto. Te contamos cómo funciona, qué hemos medido y hasta dónde llega.
Investigación
Desde 2017 investigamos en IA aplicada a la voz, la conversación y los agentes multimodales, con empresas, universidades y centros públicos.
Modelos propios de texto a voz, voces de marca, variedades del español y lenguas cooficiales. Empezó con un proyecto NEOTEC del CDTI y continúa en Fonos.
Voces sintéticas para entrenar y evaluar sistemas que detectan audios falsos, con la Cátedra RTVE-UGR.
Voces que representan a más personas, como Free the Voices, el primer banco de voces sintéticas LGBTIQ+, con LLYC.
Personalidad de asistentes y agentes, calidad conversacional y métodos de evaluación con usuarios.
Voz e IA para que la información llegue a más gente, como la cobertura electoral de RTVE en municipios pequeños.
Agentes que hacen tareas por las personas combinando voz, texto e imagen, y les dejan decidir en los momentos importantes. Venimos de las experiencias de voz con pantalla, premiadas en el Alexa Skills Challenge: Multimodal de 2019.
Voces sintéticas para investigar la detección de audios falsos. Artículo científico publicado en 2024.
Voces sintéticas para la información electoral y meteorológica local, en español y en catalán.
Investigación en modelos propios de síntesis de voz en español, el origen de Fonos.
Colaboraciones con la Universidad Rey Juan Carlos, la Universidad de Granada, la Universidad de Castilla-La Mancha y la Universitat de Lleida.
Investigamos y colaboramos con
Divulgación sobre voz, conversación e IA, y la historia de nuestros proyectos.

Presentamos en IberSpeech 2026 un método que genera una voz plausible a partir de una foto. Te contamos cómo funciona, qué hemos medido y hasta dónde llega.

De las intenciones y los flujos de Alexa a los agentes con modelos de lenguaje: qué ha cambiado al construir un chatbot o asistente de voz, y qué sigue igual.

Marcas de agua y detectores de texto generado por IA: cómo funcionan, por qué fallan con textos humanos y por qué en audio e imagen el problema va más avanzado.
Participamos como socio tecnológico en proyectos de I+D+i, cátedras y convocatorias de financiación. Si tienes una línea de investigación en voz, lenguaje o conversación, hablemos.
This page is also available in English.
View in English