Publicado el · actualizado el · Reconocimiento de voz

¿Por qué no me entiende mi asistente de voz?

Ruido, acento, palabras raras o un turno cortado: dónde se rompe la cadena entre lo que dices y lo que entiende un asistente de voz, y qué se puede hacer.

Ruido, acento y palabras raras

Le pides algo al asistente del móvil, del coche o de la cocina y te responde con otra cosa, o con un «perdona, no te he entendido». La tentación es pensar que hablamos mal. Casi nunca es eso. Entre lo que dices y lo que el asistente hace hay varios pasos, y el fallo puede estar en cualquiera de ellos.

Qué pasa desde que hablas hasta que te responde

Un asistente de voz hace, en muy poco tiempo, más o menos esto:

  1. Detecta que le estás hablando, por una palabra de activación o porque pulsas un botón.
  2. Decide cuándo has terminado de hablar.
  3. Convierte tu voz en texto. Es el reconocimiento automático del habla.
  4. Interpreta ese texto: qué quieres y con qué datos.
  5. Decide qué hacer y te responde.

Los errores del tercer paso se miden con la tasa de error de palabras (en inglés, word error rate): cuántas palabras sobran, faltan o cambian respecto a lo que realmente se dijo (Jurafsky y Martin, cap. 16). Un error pequeño en una palabra clave puede bastar para que todo lo demás salga mal.

El micrófono y el ruido

El primer problema es físico. No es lo mismo hablar a un móvil pegado a la boca que a un altavoz al otro lado del salón, con la televisión encendida y el lavavajillas en marcha. Con la distancia, la voz llega más débil y mezclada con el eco de la habitación. En el coche se suman el motor, el aire acondicionado y la carretera.

Los sistemas actuales toleran mucho mejor el ruido que los de hace unos años. Whisper, el modelo de OpenAI, se entrenó con 680.000 horas de audio de todo tipo, y ese volumen le dio una robustez que antes no existía (Radford et al., 2022). Pero el ruido sigue siendo la primera causa de fallo que buscamos cuando un asistente no entiende en su entorno real.

Tu acento, tu edad y tu forma de hablar

Un sistema de reconocimiento aprende de las voces con las que se entrena. Si ha oído poco un acento o una forma de hablar, se equivoca más con ella.

Un estudio de la Universidad de Stanford analizó en 2020 los sistemas de Amazon, Apple, Google, IBM y Microsoft con entrevistas a hablantes blancos y afroamericanos de Estados Unidos. La tasa de error media fue de 0,35 para las personas afroamericanas y de 0,19 para las blancas: casi el doble (Koenecke et al., 2020). La causa estaba en los modelos acústicos, entrenados con pocos datos de esas voces.

En español pasa lo mismo con las variedades. Un estudio de 2026 sobre los subtítulos automáticos de YouTube en siete países de Latinoamérica encontró tasas de error que iban del 16 % para mujeres puertorriqueñas al 24 % para hablantes de Argentina (Jimenez y Kern, 2026). Mismo idioma, mismo sistema y una diferencia notable según de dónde seas.

También cuentan la edad y la salud. Las voces de niños y de personas mayores suelen estar menos representadas en los datos. Y un trabajo sobre Whisper encontró que alrededor del 1 % de las transcripciones incluía frases inventadas que nadie había dicho, con más frecuencia en personas con afasia, que hacen pausas largas al hablar (Koenecke et al., 2024).

Palabras que el sistema no conoce

Aunque te oiga perfectamente, un sistema tiene que saber qué palabras existen. Los nombres propios, las marcas, los productos de una empresa o los términos técnicos son terreno difícil. Si pides «el plan Tarifa Plus 30» y el sistema nunca lo ha visto escrito, lo más probable es que escriba algo que suena parecido y sí conoce.

La mayoría de servicios permiten añadir un vocabulario propio o dar contexto para que reconozcan mejor esas palabras. Es de lo primero que configuramos en un asistente para una empresa concreta.

Te ha cortado o se ha quedado esperando

El segundo paso de la lista, decidir cuándo has terminado, falla más de lo que parece. Si haces una pausa para pensar, el asistente puede dar por terminada la frase y responder a medias. Si espera demasiado, la conversación se vuelve lenta. Los números largos, como un teléfono o un DNI, son un caso típico: la gente hace pausas entre grupos de cifras y el sistema corta a la mitad.

Te ha oído bien, pero no te ha entendido

A veces la transcripción es perfecta y el error está en la interpretación. «Pon la alarma a las siete» está claro, pero «despiértame pronto mañana» obliga a deducir qué es pronto. Los asistentes basados en reglas e intenciones fallaban mucho aquí, porque solo reconocían las frases que alguien había previsto. Los modelos de lenguaje actuales entienden muchas más formas de decir lo mismo, aunque también pueden interpretar con seguridad algo que no has dicho.

Qué se puede hacer

Si usas un asistente, habla con naturalidad, sin gritar ni silabear, y acércate al micrófono cuando haya ruido. Si construyes uno, el margen de mejora es mucho mayor:

  • Mide el reconocimiento con grabaciones de tus usuarios reales, en su entorno y separado por grupos: acentos, edades, canal. La media esconde a quien peor lo pasa.
  • Prueba con ruido real, no solo en la oficina.
  • Añade el vocabulario propio: productos, marcas, nombres de sitios.
  • Confirma los datos importantes antes de actuar, como un importe o una fecha.
  • Cuando algo falle, ayuda a la persona a seguir, en lugar de repetir «no te he entendido».
  • Ofrece otra vía cuando la voz no es buena idea, como una pantalla o un teclado.

Hacemos este tipo de pruebas cuando evaluamos asistentes y agentes antes de lanzarlos. Casi siempre aparece algún grupo de usuarios para el que el asistente funciona bastante peor que en las pruebas internas.

Referencias

Escrito por

Carlos Muñoz-Romero

Cofundador de Monoceros Labs

Cofundador de Monoceros Labs. Ingeniero informático y máster en ciencia de datos, dirige la tecnología de voz de Fonos. Antes Chief Innovation Officer de BEEVA (ahora BBVA Technology).

Compartir este artículo: