Estás dictando tu número de teléfono a un agente de voz. Dices los tres primeros dígitos, haces una pausa para recordar los siguientes y el agente responde: «Perdona, ese número no es válido». O al revés: terminas de hablar y pasa un segundo, dos, y no sabes si te ha oído. Los dos fallos tienen el mismo origen. Saber cuándo le toca hablar a cada uno es de lo más difícil de una conversación, y las personas lo hacemos tan bien que ni nos damos cuenta.
Cómo lo hacemos las personas
En 1974, los sociólogos Harvey Sacks, Emanuel Schegloff y Gail Jefferson describieron algo que hoy parece obvio: en una conversación, casi siempre habla una sola persona a la vez, y los cambios de turno se producen con muy poco silencio y muy poco solapamiento, sin que nadie lo organice (Sacks, Schegloff y Jefferson, 1974). Décadas después, un estudio con diez lenguas de todo el mundo encontró el mismo patrón en todas ellas (Stivers et al., 2009).
Lo sorprendente es la velocidad. Stephen Levinson y Francisco Torreira calcularon que el silencio típico entre dos turnos está entre 100 y 300 milisegundos, mientras que preparar una frase para decirla lleva al menos 600 (Levinson y Torreira, 2015). Las cuentas no salen, salvo que empecemos a preparar la respuesta mientras el otro todavía habla. Y eso es lo que hacemos: anticipamos cuándo va a terminar la otra persona por lo que dice, por cómo lo dice y por el contexto.
Además, usamos señales para ceder o pedir el turno. Una pregunta directa cede la palabra. Un «ajá» o un «ya» mientras el otro habla indica que seguimos escuchando, sin quitarle el turno. Bajar la entonación al final de una frase anuncia que hemos terminado. Y cuando dos personas empiezan a hablar a la vez, una de las dos se calla enseguida.
Cómo lo intentan las máquinas
La forma más sencilla de decidir que alguien ha terminado de hablar es esperar un silencio. Muchos sistemas detectan cuándo hay voz y cuándo no, y si el silencio dura más de un umbral, dan el turno por terminado. En la API de voz en tiempo real de OpenAI, por ejemplo, ese umbral es de 500 milisegundos por defecto, y la propia documentación advierte que con valores más cortos el modelo responde antes pero puede interrumpir en pausas breves (OpenAI).
El problema es que el silencio no es una buena señal. Hacemos pausas para pensar, para recordar un dato o para buscar la palabra. Y a veces terminamos una frase sin pausa, encadenando con un «¿no?».
Por eso los sistemas actuales combinan el silencio con lo que se está diciendo. Si la frase suena incompleta («quiero cambiar la cita del…»), esperan más. Si parece terminada, responden antes. OpenAI llama a esto detección semántica del turno (OpenAI). LiveKit publicó en 2024 un modelo abierto que decide el fin de turno a partir del texto, y en su versión actual escucha directamente el audio para tener en cuenta también la entonación y el ritmo (LiveKit).
El paso siguiente son los modelos que escuchan mientras hablan, como Moshi, que pueden oír un «ajá» o una interrupción sin detenerse a esperar su turno (Défossez et al., 2024). Lo contamos en las tres formas de montar un agente de voz.
Qué se puede hacer desde el diseño
La tecnología ha mejorado mucho, pero el diseño de la conversación sigue evitando buena parte de los problemas.
Cierra el turno con claridad
Si el agente termina con una pregunta directa, la persona sabe que le toca hablar. Si termina con una afirmación larga, puede quedarse esperando a que continúe. Es uno de los primeros consejos que dábamos en 2018 para las aplicaciones de Alexa (ocho consejos para crear buenas Alexa Skills en español) y sigue siendo válido.
Da más tiempo cuando la respuesta lo necesita
Un número de teléfono, un DNI, una dirección o una fecha se dicen con pausas. En esos momentos el agente debe esperar más antes de dar el turno por terminado, o pedir los datos por partes.
Deja que te interrumpan
Si el agente está explicando algo y la persona empieza a hablar, lo natural es callarse y escuchar. Un agente que sigue hablando por encima resulta muy molesto. Pero hay que distinguir una interrupción de un «ajá» o de un ruido de fondo, o el agente se cortará cada vez que alguien tosa.
No dejes silencios sin explicar
Cuando el agente tiene que consultar algo y va a tardar, conviene decirlo: «Un momento, lo miro». Un silencio de dos segundos en una llamada parece un fallo.
Respuestas cortas
Cuanto más larga es la intervención del agente, más probable es que la persona quiera interrumpir y más difícil es recordar lo que se dijo. Lo explicamos en lo que se lee bien no siempre se oye bien.
Probarlo con personas
Los turnos se prueban mal leyendo guiones. Hay que escuchar conversaciones reales, con personas que dudan, se corrigen, hablan con ruido de fondo o dictan datos. Ahí aparecen los cortes y los silencios incómodos que en las pruebas internas no se ven. Es parte de nuestro trabajo en diseño de conversaciones y agentes.
Referencias
- Sacks, H., Schegloff, E. A. y Jefferson, G. (1974). A simplest systematics for the organization of turn-taking for conversation. Language, 50(4), 696-735.
- Stivers, T., Enfield, N. J., Brown, P. et al. (2009). Universals and cultural variation in turn-taking in conversation. PNAS, 106(26), 10587-10592.
- Levinson, S. C. y Torreira, F. (2015). Timing in turn-taking and its implications for processing models of language. Frontiers in Psychology, 6, 731.
- OpenAI. Voice activity detection (VAD). Documentación de la API Realtime, consultada en septiembre de 2026.
- LiveKit. Solving end-of-turn detection: LiveKit Turn Detector v1.0.
- Défossez, A., Mazaré, L., Orsini, M. et al. (2024). Moshi: a speech-text foundation model for real-time dialogue. arXiv.