Publicado el · actualizado el · Voz sintética

¿Qué copia exactamente una voz sintética?

Timbre, entonación, pausas, pronunciación y acento: qué aprende un modelo de síntesis de voz de las grabaciones, qué imita bien y dónde sigue fallando.

Qué copia una voz sintética

Cuando decimos que una voz sintética «suena como» alguien, mezclamos varias cosas. Una voz se reconoce por su timbre, pero también por cómo sube al preguntar, por dónde respira, por cómo pronuncia las eses o por lo deprisa que habla. Un modelo de síntesis de voz aprende casi todo eso de las grabaciones con las que se entrena, aunque no todo con la misma fortuna. Repasamos rasgo a rasgo qué copia bien y dónde se le notan las costuras.

El timbre: lo que primero se reconoce

El timbre es la cualidad que hace que distingas a dos personas aunque digan la misma frase con el mismo tono. Depende del cuerpo de cada uno: las cuerdas vocales, la garganta, la boca, la nariz.

Una parte importante es la frecuencia fundamental, o F0: el número de veces por segundo que vibran las cuerdas vocales. En el habla suele moverse entre 80 y 450 hercios, más grave en hombres que en mujeres y niños (Aalto University). Lo que percibimos como una voz más aguda o más grave es, sobre todo, esa frecuencia. Encima de ella, la forma de la boca y la garganta refuerza unas frecuencias y apaga otras, y eso da el color propio de cada voz.

El timbre es lo que mejor copian los modelos actuales. Es estable a lo largo de la grabación y aparece en cada segundo de audio, así que hay mucho de donde aprender. Por eso incluso con muy poca muestra se consigue una voz que recuerda a la original, como contábamos en el artículo sobre cuántos minutos hacen falta para clonar una voz.

La prosodia: cómo se dice

La prosodia es todo lo que va por encima de cada sonido: la entonación, el acento de las palabras, el ritmo, las pausas y la velocidad. El Centro Virtual Cervantes la define como el conjunto de fenómenos que abarcan más de un fonema, y destaca que en español los dos más relevantes son la acentuación y la entonación (Centro Virtual Cervantes). Además, la prosodia transmite emoción, origen y actitud.

Con la prosodia, la misma frase cambia de sentido. «Ya has llegado» puede ser una afirmación, una pregunta o un reproche. En un texto escrito lo marcan la puntuación y el contexto. La voz sintética tiene que deducirlo.

Los modelos aprenden la prosodia de los datos. Si en las grabaciones hay preguntas, exclamaciones y enumeraciones, el modelo aprende sus curvas de entonación. Si casi todo son afirmaciones leídas, las preguntas le saldrán planas. Hay tres situaciones donde más se nota:

  • Las frases largas, donde el modelo no siempre sabe dónde respirar ni cómo agrupar las palabras.
  • El énfasis: cuál es la palabra importante de la frase depende del significado, y eso no siempre se deduce del texto.
  • Las preguntas que no empiezan por una palabra interrogativa, como «¿Vienes mañana?», donde solo la entonación indica que se pregunta algo.

La investigación lleva años intentando controlar la prosodia por separado del timbre. En 2018, dos trabajos de Google mostraron que un modelo podía aprender la prosodia de una grabación de referencia y aplicarla a otro texto y a otra voz (Skerry-Ryan et al., 2018), y que podía descubrir estilos de habla sin que nadie los etiquetara (Wang et al., 2018).

La pronunciación y el acento

Para hablar, el modelo tiene que convertir letras en sonidos. En español es más fácil que en inglés, porque la escritura se parece mucho a la pronunciación, pero hay trampas: palabras extranjeras, nombres propios, siglas y marcas.

Cuando un nombre no se pronuncia como se escribe, el modelo se equivoca con seguridad. En Victoria, la voz que creamos con PRISA para noticias deportivas, el diccionario fonético superó los 3.000 términos, sobre todo nombres de jugadores y estadios, y había que ampliarlo cada mes. Es trabajo manual y sigue siendo necesario.

El acento regional también se aprende de las grabaciones: el seseo, la aspiración de la ese, la entonación canaria o la rioplatense. Una voz clonada de alguien de Sevilla hablará con acento sevillano si los datos lo tienen. El problema aparece cuando el modelo base ha oído sobre todo un español estándar: entonces tiende a llevar la voz hacia ese acento y la mezcla suena rara.

Lo que el texto no dice

Antes de sintetizar hay que decidir cómo se lee lo que está escrito. «1/2» puede ser «un medio» o «uno de febrero». «Km» se lee «kilómetros». «Felipe II» se lee «Felipe segundo», pero «tomo II» es «tomo dos». Y «3-1» en una crónica de fútbol es «tres a uno». En inglés el problema es aún mayor: un mismo número, como 2026, se lee distinto si es un año o una cantidad. Este paso se llama normalización del texto, y los errores aquí cambian el mensaje por completo. Richard Sproat y Navdeep Jaitly, de Google, lo mostraron en 2016: redes neuronales con muy buena precisión global seguían cometiendo errores inaceptables, como leer mal una cifra, y hacía falta combinarlas con reglas (Sproat y Jaitly, 2016). Los modelos actuales lo hacen mejor, pero en cifras, fechas y siglas conviene revisar siempre.

Estilo y emoción

Una misma persona no habla igual cuando lee las noticias que cuando cuenta un cuento o atiende una llamada. Si la voz sintética tiene que pasar de un estilo a otro, necesita ejemplos de cada uno.

Hoy muchos sistemas permiten pedir el estilo con palabras. OpenAI presentó en marzo de 2025 un modelo de síntesis al que se le puede indicar cómo hablar, por ejemplo «como un agente de atención al cliente comprensivo» (OpenAI, 2025). Funciona bien para cambios generales de tono. Para una emoción creíble y sostenida durante varios minutos, o para una ironía que se entienda, todavía cuesta.

Lo que se copia sin querer

El modelo no distingue entre la voz y lo que la rodea. Si las grabaciones tienen eco, ruido de fondo, chasquidos de la boca o golpes de la mesa, los aprende y los reproduce donde menos te lo esperas. Lo mismo pasa con las respiraciones: bien usadas dan naturalidad, pero si están mal recortadas aparecen en medio de una palabra. Por eso revisamos el audio a mano antes de entrenar.

Qué significa si quieres una voz sintética

Si el timbre es lo que más importa, por ejemplo para que una voz de marca se reconozca, lo tienes relativamente fácil. Si lo que importa es cómo habla, cómo pregunta, cómo enfatiza o qué acento tiene, el trabajo está en diseñar bien las grabaciones: frases que cubran los sonidos del idioma, los tipos de pregunta y los estilos que se van a usar. Y en cualquier caso hace falta un diccionario de pronunciación y alguien que escuche el resultado con atención.

Es la parte menos vistosa de crear una voz y la que más se nota al final. Lo hacemos en cada proyecto de voces sintéticas a medida.

Referencias

Escrito por

Carlos Muñoz-Romero

Cofundador de Monoceros Labs

Cofundador de Monoceros Labs. Ingeniero informático y máster en ciencia de datos, dirige la tecnología de voz de Fonos. Antes Chief Innovation Officer de BEEVA (ahora BBVA Technology).

Compartir este artículo:

Artículos relacionados

Portada: ¿Cómo sonaría esta cara? Voces sintéticas a partir de una sola foto. IberSpeech 2026.

¿Cómo sonaría esta cara? Voces sintéticas a partir de una sola foto

Presentamos en IberSpeech 2026 un método que genera una voz plausible a partir de una foto. Te contamos cómo funciona, qué hemos medido y hasta dónde llega.

¿De quién es una voz?

Antes de clonar una voz, pregunta de quién es

La voz identifica a una persona y la ley la protege. Qué dicen las normas española y europea, qué casos lo muestran y qué debe incluir un acuerdo de cesión.

3 s o varias horas de audio para clonar una voz

¿Cuántos minutos de voz hacen falta para clonar una voz?

Clonar una voz puede pedir tres segundos de audio o varias horas. Te explicamos la clonación zero-shot, la profesional y la conversión de voz, y cuándo usarlas.