Publicado el · actualizado el · Voz sintética IA responsable

Antes de clonar una voz, pregunta de quién es

La voz identifica a una persona y la ley la protege. Qué dicen las normas española y europea, qué casos lo muestran y qué debe incluir un acuerdo de cesión.

¿De quién es una voz?

Clonar una voz es cada vez más fácil. Con unos segundos de audio hay modelos abiertos que imitan a alguien de forma reconocible, como contábamos al explicar cuántos minutos hacen falta para clonar una voz. Por eso, cuando alguien nos pide una voz sintética, la primera pregunta no es técnica: ¿de quién es esa voz y qué ha autorizado?

Este artículo no es asesoramiento jurídico. Recoge lo que tenemos en cuenta en cada proyecto y las normas en las que nos apoyamos.

La voz está protegida por ley

En España, la Ley Orgánica 1/1982 de protección del derecho al honor, a la intimidad personal y familiar y a la propia imagen considera una intromisión ilegítima «la utilización del nombre, de la voz o de la imagen de una persona para fines publicitarios, comerciales o de naturaleza análoga» (artículo 7.6). La misma ley establece que no hay intromisión si la persona da su consentimiento expreso, y que ese consentimiento se puede revocar en cualquier momento, indemnizando en su caso los daños (BOE, Ley Orgánica 1/1982).

Además, una grabación de voz de alguien identificable es un dato personal, y el Reglamento General de Protección de Datos se aplica a su tratamiento. Si la voz se procesa técnicamente para identificar o verificar a esa persona, pasa a ser un dato biométrico: el RGPD los define como los datos obtenidos de un tratamiento técnico de las características físicas, fisiológicas o de conducta que permiten identificar de manera única a una persona (RGPD, artículo 4). Entrenar un modelo con la voz de alguien es tratar sus datos personales, y necesita una base legal clara.

Que un audio esté publicado en internet no cambia nada de esto. Una entrevista en YouTube o un pódcast no autorizan a nadie a crear un modelo con esa voz.

Lo que pasa cuando se olvida

En febrero de 2023, narradores de audiolibros descubrieron que el contrato de Findaway Voices, la distribuidora de audiolibros de Spotify, incluía una cláusula que permitía usar sus grabaciones para entrenar modelos de aprendizaje automático. Esos archivos habían llegado a Apple, que acababa de lanzar audiolibros narrados con voces sintéticas. Muchos no sabían que habían firmado esa cláusula. Tras las protestas y la intervención del sindicato SAG-AFTRA, las dos empresas dejaron de usar los archivos para ese fin (AppleInsider, 2023; Writer Beware, 2023).

En enero de 2024, antes de las primarias de New Hampshire, votantes recibieron llamadas automáticas con una voz que imitaba al presidente Joe Biden y les pedía que no fueran a votar (NPR, 2024). El responsable acabó acusado de supresión de voto (Departamento de Justicia de New Hampshire). Pocas semanas después, la Comisión Federal de Comunicaciones de Estados Unidos (FCC) declaró que las voces generadas por IA cuentan como voces artificiales a efectos de la ley que regula las llamadas automáticas, lo que las deja sujetas a las mismas prohibiciones y sanciones (FCC, 2024).

Son dos problemas distintos. En el primero, las voces se usaron con un consentimiento que nadie entendió. En el segundo, sin consentimiento y para engañar. Los dos muestran que la protección tiene que estar clara antes de grabar.

Qué debería incluir un acuerdo de cesión

Cuando trabajamos con una locutora o un locutor para crear una voz, firmamos un documento específico, aparte del contrato de grabación habitual. Estos son los puntos que no deberían faltar:

  • Finalidad: Para qué se va a usar la voz: un asistente, la narración de noticias, una campaña. Cuanto más concreto, mejor.
  • Usos excluidos: Lo que nunca se hará con ella. Por ejemplo, mensajes políticos, publicidad de otras marcas o contenido que la persona no aprobaría.
  • Duración y territorio: Durante cuánto tiempo y dónde se puede usar la voz sintética.
  • El modelo: Quién lo guarda, quién puede acceder a él y qué pasa con él al terminar el acuerdo: si se borra y cómo se acredita.
  • Revocación: Cómo puede la persona retirar su consentimiento y qué consecuencias tiene para ambas partes, en línea con lo que prevé la ley.
  • Remuneración: Si se paga una cantidad fija, por uso o por tiempo, y si la voz sintética puede sustituir trabajos de locución que antes se hacían en directo.
  • Transparencia: Cómo se avisará al público de que la voz es sintética.

Un consentimiento genérico del tipo «cedo mi voz para cualquier uso» es justo lo que salió mal en el caso de los audiolibros.

¿Y si la voz no es de nadie?

Hay voces sintéticas que no imitan a ninguna persona: se crean mezclando rasgos aprendidos de varias voces, y el resultado es una voz nueva. Aun así, se han entrenado con grabaciones de personas reales, y esas personas también tienen que saber para qué se usa su voz y haberlo autorizado. Que el resultado no se parezca a ninguna no elimina esa obligación.

Avisar de que la voz es sintética

El consentimiento de quien presta la voz es una parte. La otra es no engañar a quien escucha. El artículo 50 del Reglamento europeo de IA, aplicable desde el 2 de agosto de 2026, obliga a marcar los audios generados por IA de forma que se puedan detectar y a avisar cuando se publica un contenido manipulado que imita a una persona real (Reglamento (UE) 2024/1689, artículo 50).

Algunos proveedores ya lo exigen por su cuenta. Microsoft, por ejemplo, pide una grabación en la que la persona lee una declaración aceptando que se use su voz antes de entrenar una voz personalizada (Microsoft Learn).

En nuestros proyectos de voces sintéticas a medida el acuerdo con quien presta la voz se firma antes de la primera grabación. Nos cuesta tiempo al principio, y evita problemas que después no tienen arreglo.

Referencias

Escrito por

Carlos Muñoz-Romero

Cofundador de Monoceros Labs

Cofundador de Monoceros Labs. Ingeniero informático y máster en ciencia de datos, dirige la tecnología de voz de Fonos. Antes Chief Innovation Officer de BEEVA (ahora BBVA Technology).

Compartir este artículo:

Artículos relacionados

Portada: ¿Cómo sonaría esta cara? Voces sintéticas a partir de una sola foto. IberSpeech 2026.

¿Cómo sonaría esta cara? Voces sintéticas a partir de una sola foto

Presentamos en IberSpeech 2026 un método que genera una voz plausible a partir de una foto. Te contamos cómo funciona, qué hemos medido y hasta dónde llega.

¿Lo ha escrito una IA?

¿Se puede saber si un texto lo ha escrito una IA?

Marcas de agua y detectores de texto generado por IA: cómo funcionan, por qué fallan con textos humanos y por qué en audio e imagen el problema va más avanzado.

Los prejuicios de los datos

Un asistente repite los prejuicios de sus datos

De dónde vienen los sesgos de los asistentes y agentes de IA, cómo se notan en una conversación o en una voz y qué se puede medir para reducirlos.