Publicado el · actualizado el · IA responsable

Un asistente repite los prejuicios de sus datos

De dónde vienen los sesgos de los asistentes y agentes de IA, cómo se notan en una conversación o en una voz y qué se puede medir para reducirlos.

Los prejuicios de los datos

Un asistente de IA no tiene opiniones propias, pero sí aprende las de sus datos. Si en los textos con los que se entrenó las mujeres aparecen sobre todo en casa y los hombres en la oficina, el modelo lo repetirá. Si las voces de personas con las que se entrenó un reconocedor de habla eran casi todas de un mismo acento, el modelo entenderá peor a personas con otros acentos. Los sesgos no son un fallo raro: son lo esperable si nadie los busca.

De dónde vienen

Hay tres puntos por los que suelen entrar:

  • Los datos. Un modelo aprende de lo que ve, con sus desequilibrios. Lo que está poco representado se aprende peor, y los estereotipos que aparecen mucho se aprenden muy bien.
  • Las decisiones de diseño. Qué voz se pone por defecto, cómo se llama el asistente, cómo responde a un insulto. Nadie lo decide por maldad, pero cada elección transmite algo.
  • La forma de evaluar. Si solo se mide el acierto medio, un sistema puede funcionar muy bien para la mayoría y muy mal para un grupo concreto sin que nadie lo note.

Cómo se notan en una conversación

En lo que dice

En marzo de 2024, la UNESCO publicó un estudio sobre modelos de lenguaje como GPT-3.5, GPT-2 y Llama 2. Encontró que describían a las mujeres en papeles domésticos mucho más a menudo que a los hombres, hasta cuatro veces más en uno de los modelos, y que asociaban los nombres femeninos a «casa», «familia» e «hijos», y los masculinos a «empresa», «directivo» y «salario» (UNESCO, 2024).

Los sesgos más difíciles de ver son los que no aparecen cuando se pregunta directamente. Un estudio publicado en Nature en 2024 mostró que modelos que expresaban opiniones positivas cuando se les preguntaba directamente por las personas afroamericanas asignaban trabajos menos prestigiosos a una persona solo porque escribía en inglés afroamericano (Hofmann et al., 2024). En 2025, parte del mismo equipo encontró sesgos parecidos contra hablantes de dialectos alemanes en todos los modelos que evaluó (Bui et al., 2025). No hay motivo para pensar que el español, con toda su variedad, se libre.

En cómo entiende

Los sesgos también afectan a quién entiende bien un asistente de voz. Como contamos en por qué no me entiende mi asistente de voz, un estudio de Stanford encontró que cinco sistemas comerciales de reconocimiento de voz cometían casi el doble de errores con hablantes afroamericanos que con otros hablantes americanos (Koenecke et al., 2020). Para quien no es entendido, el asistente simplemente no funciona.

En cómo suena

La voz también transmite. En 2019, la UNESCO dedicó un informe a los asistentes de voz, que entonces tenían casi todos voz femenina por defecto. Su título, I’d blush if I could («Me sonrojaría si pudiera»), era la respuesta que daba Siri a un insulto sexista. El informe advertía de que esas voces refuerzan la idea de las mujeres como ayudantes serviciales y normalizan que se les hable con malos modos (UNESCO, 2019).

Pasa algo parecido con los acentos. Si todas las voces sintéticas hablan un español estándar, el mensaje implícito es que ese es el español correcto. Con LLYC creamos Free the Voices, el primer banco de voces sintéticas diversas en español, precisamente para ampliar lo que se oye.

El proyecto buscaba diversidad de género, no solo de acento. La voz es uno de los rasgos que más discriminación provoca hacia las personas LGBTIQ+, y muchas acaban cambiando u ocultando su forma de hablar. Para crear el banco se recogieron voces del colectivo en doce países, y a partir de ellas se generaron voces sintéticas que no copian a ninguna persona concreta. Diseñamos dos identidades nuevas, Libertas y Vega, que junto a Cástor, Fulu y Hatysa forman las cinco primeras voces sintéticas diversas en español.

Qué se puede medir

Un sesgo que no se mide no se corrige. Algunas formas de hacerlo:

  • Separar los resultados por grupos. En lugar del acierto medio del reconocimiento de voz, el acierto por acento, edad o género. En lugar de la satisfacción media, la de cada perfil de usuario.
  • Usar pruebas diseñadas para detectar estereotipos. BBQ, por ejemplo, plantea preguntas donde la respuesta estereotipada y la correcta no coinciden, y mide cuántas veces el modelo elige el estereotipo (Parrish et al., 2022). Casi todas estas pruebas están en inglés, así que para español suele tocar adaptarlas.
  • Probar con pares de frases. La misma petición cambiando solo un nombre, un género o una forma de hablar. Si la respuesta cambia de forma injustificada, hay un problema.
  • Escuchar a quienes usan el asistente. Las quejas de un grupo concreto son a menudo la primera pista.

Qué se puede hacer

Medir es el primer paso. Después, según dónde esté el problema: completar los datos con las voces y los textos que faltan; revisar las instrucciones del asistente y sus respuestas por defecto; elegir con intención la voz, el nombre y la personalidad; y repetir las pruebas cada vez que cambia el modelo, porque cada versión tiene sus propios sesgos.

Nada de esto deja un sistema libre de sesgos, pero reduce los que más daño hacen y te permite saber qué queda. Es parte de lo que revisamos cuando evaluamos asistentes y agentes y cuando diseñamos voces sintéticas a medida.

Referencias

Escrito por

Nieves Ábalos

Cofundadora de Monoceros Labs

Cofundadora de Monoceros Labs. Ingeniera informática, investiga sistemas de diálogo desde 2009 y hoy hace el doctorado en IA en la Universidad de Granada.

Compartir este artículo:

Artículos relacionados

Portada: ¿Cómo sonaría esta cara? Voces sintéticas a partir de una sola foto. IberSpeech 2026.

¿Cómo sonaría esta cara? Voces sintéticas a partir de una sola foto

Presentamos en IberSpeech 2026 un método que genera una voz plausible a partir de una foto. Te contamos cómo funciona, qué hemos medido y hasta dónde llega.

¿Lo ha escrito una IA?

¿Se puede saber si un texto lo ha escrito una IA?

Marcas de agua y detectores de texto generado por IA: cómo funcionan, por qué fallan con textos humanos y por qué en audio e imagen el problema va más avanzado.

¿De quién es una voz?

Antes de clonar una voz, pregunta de quién es

La voz identifica a una persona y la ley la protege. Qué dicen las normas española y europea, qué casos lo muestran y qué debe incluir un acuerdo de cesión.