Publicado el · actualizado el · Voz sintética

¿Cuántos minutos de voz hacen falta para clonar una voz?

Clonar una voz puede pedir tres segundos de audio o varias horas. Te explicamos la clonación zero-shot, la profesional y la conversión de voz, y cuándo usarlas.

3 s o varias horas de audio para clonar una voz

Es la pregunta que más nos hacen cuando alguien quiere una voz sintética propia. La respuesta corta es que depende de lo que entiendas por clonar. Hay sistemas que imitan una voz con tres segundos de audio y otros que necesitan varias horas de grabación en estudio. Los dos dicen que clonan, pero no dan el mismo resultado ni sirven para lo mismo.

¿Qué es clonar una voz?

Clonar una voz es crear un modelo de síntesis de voz que habla con la voz de una persona concreta a partir de grabaciones suyas. El modelo recibe un texto nuevo, que esa persona nunca ha leído, y genera el audio como si lo dijera ella.

Lo que se copia puede ser solo el timbre, el color de la voz que te permite reconocer a alguien por teléfono, o también su forma de hablar: el ritmo, las pausas, la entonación, el acento. La cantidad de audio que necesitas depende sobre todo de cuánto de esto quieres que se parezca.

Hay dos grandes caminos, que ya describía en 2018 un equipo de Baidu en uno de los primeros trabajos sobre el tema (Arik et al., 2018):

  • Adaptar un modelo que ya sabe hablar, entrenándolo un poco más con la voz nueva.
  • Codificar la voz nueva en un resumen numérico (lo que se llama embedding del hablante) y dárselo al modelo como pista, sin entrenar nada.

En aquel trabajo, la adaptación daba más naturalidad y parecido, y la codificación era mucho más rápida y barata de desplegar. Los modelos han cambiado mucho desde entonces, pero esa diferencia todavía explica buena parte de lo que puedes esperar de cada opción.

Clonación con unos segundos de audio (zero-shot)

La clonación zero-shot es la del segundo camino: el sistema escucha una muestra corta de una voz que nunca ha visto y la imita al momento, sin entrenamiento.

El truco está en que el modelo ya ha aprendido antes, con miles de horas de otras personas, cómo varían las voces. Google lo mostró en 2018 aprovechando un modelo entrenado para verificar quién habla y usándolo para condicionar la síntesis (Jia et al., 2018). En enero de 2023, Microsoft presentó VALL-E, que imita una voz a partir de una grabación de 3 segundos. Para llegar ahí, lo entrenaron con 60.000 horas de habla en inglés (Wang et al., 2023). Hoy esto está al alcance de cualquiera con modelos abiertos: XTTS-v2 clona con un clip de 6 segundos y habla 17 idiomas, entre ellos el español (Coqui), y F5-TTS, entrenado con 100.000 horas de habla en varios idiomas, publicó su código y sus pesos (Chen et al., 2024). Los servicios comerciales piden algo más: ElevenLabs recomienda entre 1 y 2 minutos de audio para su clonación instantánea (ElevenLabs).

Los segundos de tu voz son pocos porque el trabajo pesado ya lo hicieron otras voces. Eso tiene consecuencias:

  • Se parece en el timbre, pero no tanto en la forma de hablar. Con tres segundos no hay manera de saber cómo haces una pregunta o dónde pones las pausas.
  • Funciona peor con lo que estaba poco representado en el entrenamiento. Que un modelo hable español no quiere decir que haya oído mucho español de Canarias o de Andalucía. Un acento poco frecuente, o una voz muy grave o muy aguda, se imitan peor si el modelo apenas los ha oído.
  • Sirve para probar una idea o para usos donde basta con que la voz recuerde a alguien. Para una voz de marca que va a sonar miles de horas se queda corta.

Clonación entrenada con tu voz (profesional)

La clonación profesional es la del primer camino: se parte de un modelo y se entrena con grabaciones de la persona. Aquí ya hablamos de minutos u horas.

Con muy poco se puede empezar. El modelo abierto YourTTS demostró que es posible ajustar un modelo con menos de un minuto de habla y conseguir un parecido razonable (Casanova et al., 2022). En nuestra experiencia, a partir de 10 minutos de audio limpio ya se obtiene una voz reconocible, y con más de 20 mejora de forma clara. Además del audio hacen falta las transcripciones, revisadas para que cada sonido corresponda con lo que se dice. Si el texto no coincide con el audio, el modelo aprende mal la pronunciación.

Los servicios comerciales van en la misma línea. Para su clonación profesional, ElevenLabs pide como mínimo 30 minutos de audio y recomienda acercarse a 2 o 3 horas para el mejor resultado (ElevenLabs).

Cuando la voz va a ser la imagen de una marca, se graba en estudio con un guion diseñado para cubrir todos los sonidos del idioma y los estilos que se van a usar. Para Victoria, la voz sintética que creamos con PRISA, hicieron falta más de 12 horas de estudio y más de 4.200 frases. Tras la revisión fonética quedaron algo más de 4 horas de audio limpio para entrenar. Como referencia, uno de los conjuntos de datos clásicos para entrenar desde cero una voz de una sola persona, LJ Speech, tiene unas 24 horas de audio (Ito y Johnson, 2017).

Con más audio se gana sobre todo en la forma de hablar. La voz clonada pregunta, enumera y hace pausas como la persona original.

¿Y si lo que quieres es cambiar una voz por otra?

Hay otra técnica que también se llama clonación y funciona distinto: la conversión de voz, o speech-to-speech. Aquí no se parte de un texto. Alguien habla y el sistema transforma su audio para que suene con otra voz, como un filtro.

RVC, una herramienta abierta de conversión de voz con decenas de miles de estrellas en GitHub, recomienda unos 10 minutos de audio limpio de la voz de destino (RVC-Project). El resultado mantiene el timbre de la voz clonada, pero la entonación, el ritmo y las pausas son los de quien habla. Por eso sirve para doblar una interpretación, y no tanto para generar audio a partir de texto sin una persona detrás.

Comparación rápida

MétodoAudio de la personaQué imitaPara qué sirve
Zero-shotDe unos segundos a 2 minutosEl timbrePrototipos y pruebas rápidas
Conversión de vozUnos 10 minutosEl timbre, sobre la interpretación de otra personaDoblaje, cambiar la voz de una grabación
Clonación profesionalDe 10 minutos a varias horasEl timbre y la forma de hablarVoces de marca, narración, asistentes

Más minutos no es siempre mejor

La calidad del audio pesa tanto como la duración. Una hora grabada en una sala con eco, con ruido de fondo o con micrófonos distintos puede dar peor resultado que veinte minutos bien grabados. El modelo también aprende el eco y los golpes de la mesa.

Importa además qué se graba. Si todas las frases son afirmaciones leídas en tono neutro, la voz clonada no sabrá preguntar con naturalidad ni sonar entusiasta. Por eso diseñamos los guiones pensando en el uso final: no es lo mismo leer noticias deportivas que atender en un asistente.

Antes de empezar: el permiso

Cuantos menos segundos hacen falta, más fácil es clonar una voz sin que la persona lo sepa. En 2023, Meta decidió no publicar su modelo Voicebox, que imitaba una voz con dos segundos de muestra, por el riesgo de mal uso (Meta AI, 2023). Los proveedores serios piden una prueba de consentimiento: Microsoft, por ejemplo, exige una grabación de la persona leyendo una declaración en la que autoriza el uso de su voz (Microsoft Learn). Y el artículo 50 del Reglamento europeo de IA, aplicable desde el 2 de agosto de 2026, exige marcar el audio sintético como generado por IA y avisar cuando se publica un deepfake (Reglamento (UE) 2024/1689).

Nosotros solo clonamos una voz con el permiso explícito de la persona. Lo contamos también en nuestro artículo sobre texto a voz.

Si estás pensando en una voz propia, empieza por decidir dónde y para qué va a sonar. Con eso se elige el método y se calcula cuánto hay que grabar. Es parte de lo que hacemos en voces sintéticas a medida.

Referencias

Escrito por

Carlos Muñoz-Romero

Cofundador de Monoceros Labs

Cofundador de Monoceros Labs. Ingeniero informático y máster en ciencia de datos, dirige la tecnología de voz de Fonos. Antes Chief Innovation Officer de BEEVA (ahora BBVA Technology).

Compartir este artículo:

Artículos relacionados

Portada: ¿Cómo sonaría esta cara? Voces sintéticas a partir de una sola foto. IberSpeech 2026.

¿Cómo sonaría esta cara? Voces sintéticas a partir de una sola foto

Presentamos en IberSpeech 2026 un método que genera una voz plausible a partir de una foto. Te contamos cómo funciona, qué hemos medido y hasta dónde llega.

¿De quién es una voz?

Antes de clonar una voz, pregunta de quién es

La voz identifica a una persona y la ley la protege. Qué dicen las normas española y europea, qué casos lo muestran y qué debe incluir un acuerdo de cesión.

Qué copia una voz sintética

¿Qué copia exactamente una voz sintética?

Timbre, entonación, pausas, pronunciación y acento: qué aprende un modelo de síntesis de voz de las grabaciones, qué imita bien y dónde sigue fallando.