Publicado el · actualizado el · Agentes de voz Diseño conversacional

¿Cuándo me toca hablar?

Por qué los agentes de voz se pisan o se quedan callados: cómo gestionamos los turnos de palabra las personas y cómo intentan detectarlos las máquinas.

¿Cuándo me toca hablar?

Estás dictando tu número de teléfono a un agente de voz. Dices los tres primeros dígitos, haces una pausa para recordar los siguientes y el agente responde: «Perdona, ese número no es válido». O al revés: terminas de hablar y pasa un segundo, dos, y no sabes si te ha oído. Los dos fallos tienen el mismo origen. Saber cuándo le toca hablar a cada uno es de lo más difícil de una conversación, y las personas lo hacemos tan bien que ni nos damos cuenta.

Cómo lo hacemos las personas

En 1974, los sociólogos Harvey Sacks, Emanuel Schegloff y Gail Jefferson describieron algo que hoy parece obvio: en una conversación, casi siempre habla una sola persona a la vez, y los cambios de turno se producen con muy poco silencio y muy poco solapamiento, sin que nadie lo organice (Sacks, Schegloff y Jefferson, 1974). Décadas después, un estudio con diez lenguas de todo el mundo encontró el mismo patrón en todas ellas (Stivers et al., 2009).

Lo sorprendente es la velocidad. Stephen Levinson y Francisco Torreira calcularon que el silencio típico entre dos turnos está entre 100 y 300 milisegundos, mientras que preparar una frase para decirla lleva al menos 600 (Levinson y Torreira, 2015). Las cuentas no salen, salvo que empecemos a preparar la respuesta mientras el otro todavía habla. Y eso es lo que hacemos: anticipamos cuándo va a terminar la otra persona por lo que dice, por cómo lo dice y por el contexto.

Además, usamos señales para ceder o pedir el turno. Una pregunta directa cede la palabra. Un «ajá» o un «ya» mientras el otro habla indica que seguimos escuchando, sin quitarle el turno. Bajar la entonación al final de una frase anuncia que hemos terminado. Y cuando dos personas empiezan a hablar a la vez, una de las dos se calla enseguida.

Cómo lo intentan las máquinas

La forma más sencilla de decidir que alguien ha terminado de hablar es esperar un silencio. Muchos sistemas detectan cuándo hay voz y cuándo no, y si el silencio dura más de un umbral, dan el turno por terminado. En la API de voz en tiempo real de OpenAI, por ejemplo, ese umbral es de 500 milisegundos por defecto, y la propia documentación advierte que con valores más cortos el modelo responde antes pero puede interrumpir en pausas breves (OpenAI).

El problema es que el silencio no es una buena señal. Hacemos pausas para pensar, para recordar un dato o para buscar la palabra. Y a veces terminamos una frase sin pausa, encadenando con un «¿no?».

Por eso los sistemas actuales combinan el silencio con lo que se está diciendo. Si la frase suena incompleta («quiero cambiar la cita del…»), esperan más. Si parece terminada, responden antes. OpenAI llama a esto detección semántica del turno (OpenAI). LiveKit publicó en 2024 un modelo abierto que decide el fin de turno a partir del texto, y en su versión actual escucha directamente el audio para tener en cuenta también la entonación y el ritmo (LiveKit).

El paso siguiente son los modelos que escuchan mientras hablan, como Moshi, que pueden oír un «ajá» o una interrupción sin detenerse a esperar su turno (Défossez et al., 2024). Lo contamos en las tres formas de montar un agente de voz.

Qué se puede hacer desde el diseño

La tecnología ha mejorado mucho, pero el diseño de la conversación sigue evitando buena parte de los problemas.

Cierra el turno con claridad

Si el agente termina con una pregunta directa, la persona sabe que le toca hablar. Si termina con una afirmación larga, puede quedarse esperando a que continúe. Es uno de los primeros consejos que dábamos en 2018 para las aplicaciones de Alexa (ocho consejos para crear buenas Alexa Skills en español) y sigue siendo válido.

Da más tiempo cuando la respuesta lo necesita

Un número de teléfono, un DNI, una dirección o una fecha se dicen con pausas. En esos momentos el agente debe esperar más antes de dar el turno por terminado, o pedir los datos por partes.

Deja que te interrumpan

Si el agente está explicando algo y la persona empieza a hablar, lo natural es callarse y escuchar. Un agente que sigue hablando por encima resulta muy molesto. Pero hay que distinguir una interrupción de un «ajá» o de un ruido de fondo, o el agente se cortará cada vez que alguien tosa.

No dejes silencios sin explicar

Cuando el agente tiene que consultar algo y va a tardar, conviene decirlo: «Un momento, lo miro». Un silencio de dos segundos en una llamada parece un fallo.

Respuestas cortas

Cuanto más larga es la intervención del agente, más probable es que la persona quiera interrumpir y más difícil es recordar lo que se dijo. Lo explicamos en lo que se lee bien no siempre se oye bien.

Probarlo con personas

Los turnos se prueban mal leyendo guiones. Hay que escuchar conversaciones reales, con personas que dudan, se corrigen, hablan con ruido de fondo o dictan datos. Ahí aparecen los cortes y los silencios incómodos que en las pruebas internas no se ven. Es parte de nuestro trabajo en diseño de conversaciones y agentes.

Referencias

Escrito por

Nieves Ábalos

Cofundadora de Monoceros Labs

Cofundadora de Monoceros Labs. Ingeniera informática, investiga sistemas de diálogo desde 2009 y hoy hace el doctorado en IA en la Universidad de Granada.

Compartir este artículo:

Artículos relacionados

3 formas de montar un agente de voz

Tres formas de montar un agente de voz y ninguna es perfecta

Agentes de voz en cascada, voz a voz o híbridos: cómo funciona cada arquitectura, qué ganas y qué pierdes en latencia, control y voz, y cuándo elegir cada una.

Antes de construir

Qué preguntarte antes de construir un asistente

Antes de elegir tecnología para un chatbot o asistente de voz: qué conversaciones quieres tener, dónde, por qué canal, cómo medirás el éxito y qué prototipar.

6 ajustes para escribir para el oído

Lo que se lee bien no siempre se oye bien

Un texto pensado para leer suele sonar mal en un asistente de voz. Seis ajustes para escribir para el oído: frases, opciones, puntuación, cifras y pausas.