
¿Cómo sonaría esta cara? Voces sintéticas a partir de una sola foto
Presentamos en IberSpeech 2026 un método que genera una voz plausible a partir de una foto. Te contamos cómo funciona, qué hemos medido y hasta dónde llega.
Publicado el · actualizado el · Voz sintética
Clonar una voz puede pedir tres segundos de audio o varias horas. Te explicamos la clonación zero-shot, la profesional y la conversión de voz, y cuándo usarlas.


Es la pregunta que más nos hacen cuando alguien quiere una voz sintética propia. La respuesta corta es que depende de lo que entiendas por clonar. Hay sistemas que imitan una voz con tres segundos de audio y otros que necesitan varias horas de grabación en estudio. Los dos dicen que clonan, pero no dan el mismo resultado ni sirven para lo mismo.
Clonar una voz es crear un modelo de síntesis de voz que habla con la voz de una persona concreta a partir de grabaciones suyas. El modelo recibe un texto nuevo, que esa persona nunca ha leído, y genera el audio como si lo dijera ella.
Lo que se copia puede ser solo el timbre, el color de la voz que te permite reconocer a alguien por teléfono, o también su forma de hablar: el ritmo, las pausas, la entonación, el acento. La cantidad de audio que necesitas depende sobre todo de cuánto de esto quieres que se parezca.
Hay dos grandes caminos, que ya describía en 2018 un equipo de Baidu en uno de los primeros trabajos sobre el tema (Arik et al., 2018):
En aquel trabajo, la adaptación daba más naturalidad y parecido, y la codificación era mucho más rápida y barata de desplegar. Los modelos han cambiado mucho desde entonces, pero esa diferencia todavía explica buena parte de lo que puedes esperar de cada opción.
La clonación zero-shot es la del segundo camino: el sistema escucha una muestra corta de una voz que nunca ha visto y la imita al momento, sin entrenamiento.
El truco está en que el modelo ya ha aprendido antes, con miles de horas de otras personas, cómo varían las voces. Google lo mostró en 2018 aprovechando un modelo entrenado para verificar quién habla y usándolo para condicionar la síntesis (Jia et al., 2018). En enero de 2023, Microsoft presentó VALL-E, que imita una voz a partir de una grabación de 3 segundos. Para llegar ahí, lo entrenaron con 60.000 horas de habla en inglés (Wang et al., 2023). Hoy esto está al alcance de cualquiera con modelos abiertos: XTTS-v2 clona con un clip de 6 segundos y habla 17 idiomas, entre ellos el español (Coqui), y F5-TTS, entrenado con 100.000 horas de habla en varios idiomas, publicó su código y sus pesos (Chen et al., 2024). Los servicios comerciales piden algo más: ElevenLabs recomienda entre 1 y 2 minutos de audio para su clonación instantánea (ElevenLabs).
Los segundos de tu voz son pocos porque el trabajo pesado ya lo hicieron otras voces. Eso tiene consecuencias:
La clonación profesional es la del primer camino: se parte de un modelo y se entrena con grabaciones de la persona. Aquí ya hablamos de minutos u horas.
Con muy poco se puede empezar. El modelo abierto YourTTS demostró que es posible ajustar un modelo con menos de un minuto de habla y conseguir un parecido razonable (Casanova et al., 2022). En nuestra experiencia, a partir de 10 minutos de audio limpio ya se obtiene una voz reconocible, y con más de 20 mejora de forma clara. Además del audio hacen falta las transcripciones, revisadas para que cada sonido corresponda con lo que se dice. Si el texto no coincide con el audio, el modelo aprende mal la pronunciación.
Los servicios comerciales van en la misma línea. Para su clonación profesional, ElevenLabs pide como mínimo 30 minutos de audio y recomienda acercarse a 2 o 3 horas para el mejor resultado (ElevenLabs).
Cuando la voz va a ser la imagen de una marca, se graba en estudio con un guion diseñado para cubrir todos los sonidos del idioma y los estilos que se van a usar. Para Victoria, la voz sintética que creamos con PRISA, hicieron falta más de 12 horas de estudio y más de 4.200 frases. Tras la revisión fonética quedaron algo más de 4 horas de audio limpio para entrenar. Como referencia, uno de los conjuntos de datos clásicos para entrenar desde cero una voz de una sola persona, LJ Speech, tiene unas 24 horas de audio (Ito y Johnson, 2017).
Con más audio se gana sobre todo en la forma de hablar. La voz clonada pregunta, enumera y hace pausas como la persona original.
Hay otra técnica que también se llama clonación y funciona distinto: la conversión de voz, o speech-to-speech. Aquí no se parte de un texto. Alguien habla y el sistema transforma su audio para que suene con otra voz, como un filtro.
RVC, una herramienta abierta de conversión de voz con decenas de miles de estrellas en GitHub, recomienda unos 10 minutos de audio limpio de la voz de destino (RVC-Project). El resultado mantiene el timbre de la voz clonada, pero la entonación, el ritmo y las pausas son los de quien habla. Por eso sirve para doblar una interpretación, y no tanto para generar audio a partir de texto sin una persona detrás.
| Método | Audio de la persona | Qué imita | Para qué sirve |
|---|---|---|---|
| Zero-shot | De unos segundos a 2 minutos | El timbre | Prototipos y pruebas rápidas |
| Conversión de voz | Unos 10 minutos | El timbre, sobre la interpretación de otra persona | Doblaje, cambiar la voz de una grabación |
| Clonación profesional | De 10 minutos a varias horas | El timbre y la forma de hablar | Voces de marca, narración, asistentes |
La calidad del audio pesa tanto como la duración. Una hora grabada en una sala con eco, con ruido de fondo o con micrófonos distintos puede dar peor resultado que veinte minutos bien grabados. El modelo también aprende el eco y los golpes de la mesa.
Importa además qué se graba. Si todas las frases son afirmaciones leídas en tono neutro, la voz clonada no sabrá preguntar con naturalidad ni sonar entusiasta. Por eso diseñamos los guiones pensando en el uso final: no es lo mismo leer noticias deportivas que atender en un asistente.
Cuantos menos segundos hacen falta, más fácil es clonar una voz sin que la persona lo sepa. En 2023, Meta decidió no publicar su modelo Voicebox, que imitaba una voz con dos segundos de muestra, por el riesgo de mal uso (Meta AI, 2023). Los proveedores serios piden una prueba de consentimiento: Microsoft, por ejemplo, exige una grabación de la persona leyendo una declaración en la que autoriza el uso de su voz (Microsoft Learn). Y el artículo 50 del Reglamento europeo de IA, aplicable desde el 2 de agosto de 2026, exige marcar el audio sintético como generado por IA y avisar cuando se publica un deepfake (Reglamento (UE) 2024/1689).
Nosotros solo clonamos una voz con el permiso explícito de la persona. Lo contamos también en nuestro artículo sobre texto a voz.
Si estás pensando en una voz propia, empieza por decidir dónde y para qué va a sonar. Con eso se elige el método y se calcula cuánto hay que grabar. Es parte de lo que hacemos en voces sintéticas a medida.
Compartir este artículo:


Presentamos en IberSpeech 2026 un método que genera una voz plausible a partir de una foto. Te contamos cómo funciona, qué hemos medido y hasta dónde llega.


La voz identifica a una persona y la ley la protege. Qué dicen las normas española y europea, qué casos lo muestran y qué debe incluir un acuerdo de cesión.


Timbre, entonación, pausas, pronunciación y acento: qué aprende un modelo de síntesis de voz de las grabaciones, qué imita bien y dónde sigue fallando.
This page is also available in English.
View in English