Un error muy habitual al crear un asistente de voz es aprovechar los textos que ya existen: las preguntas frecuentes de la web, los mensajes del chatbot, un folleto. Están bien escritos, pero están escritos para leer. Cuando una voz sintética los pronuncia, las frases se hacen eternas, las opciones se olvidan antes de terminar la lista y las cifras suenan raras. El problema está en cómo lo recibe quien escucha.
Por qué leer y escuchar no son lo mismo
Quien lee controla el ritmo. Puede volver atrás, saltarse un párrafo o mirar la lista de opciones mientras decide. Quien escucha no puede hacer nada de eso: el audio llega palabra a palabra, a la velocidad que marca la voz, y lo que no retiene se pierde.
Kathryn Whitenton, de Nielsen Norman Group, lo explicaba al analizar los asistentes de voz: basta con recitar una lista de opciones para obligar a la persona a guardarlas en la memoria de trabajo mientras elige (Whitenton, 2016). En pantalla reconoces la opción que buscas; de oído tienes que recordarla.
También es más lento. Un metaanálisis de Marc Brysbaert con 190 estudios situó la lectura silenciosa en inglés en unas 238 palabras por minuto, y la lectura en voz alta en unas 183 (Brysbaert, 2019). Un texto largo cuesta más tiempo escucharlo que leerlo, y exige más atención.
Amazon lo resume en su guía de diseño para Alexa: los mensajes se escuchan, no se leen, así que hay que escribirlos para una conversación hablada (Amazon).
Seis ajustes para escribir para el oído
1. Una idea por frase
Las frases largas con subordinadas funcionan en papel porque la vista puede volver al principio. De oído, cuando llega el verbo principal ya no recuerdas el sujeto. Parte las frases y deja una idea en cada una. Si una frase no se puede decir de un tirón sin coger aire, es demasiado larga.
2. Pocas opciones cada vez
Esta frase es correcta por escrito:
¿Qué desea: conocer el estado del tráfico, restricciones a la circulación, trámites en jefaturas de tráfico o teléfonos de información?
Dicha en voz alta, obliga a retener cuatro opciones largas sin saber cuál será la última. Es mejor ofrecer menos opciones y más cortas, o preguntar primero de forma abierta («¿En qué te puedo ayudar?») y guiar solo si hace falta. Cuando las opciones son inevitables, di primero qué consigue cada una.
3. La puntuación también es entonación
La voz sintética usa la puntuación para decidir dónde hace pausas y cómo sube o baja la entonación. Compara:
¿Qué desea: conocer el estado del tráfico, restricciones a la circulación o trámites?
¿Qué desea? ¿Conocer el estado del tráfico? ¿Restricciones a la circulación? ¿Trámites?
La segunda versión suena como una persona que va ofreciendo opciones, con una pausa y una entonación de pregunta en cada una. Un punto en lugar de una coma, o una pregunta partida en varias, cambia mucho cómo suena. Merece la pena probar varias versiones con la voz real.
4. Escribe las cifras y siglas como se dicen
«El 1/3 a las 9:30 h en la C/ Mayor» obliga al sistema a adivinar cómo leer cada cosa, y a veces se equivoca. Si el texto es fijo, escríbelo como se dice: «el uno de marzo, a las nueve y media, en la calle Mayor». Si viene de una base de datos, revisa cómo se leen fechas, horas, precios, siglas y nombres propios antes de publicar.
5. Marca pausas y énfasis cuando el texto no llega
Hay cosas que la puntuación no expresa: una pausa algo más larga antes de un dato importante, una palabra que debe sonar con más fuerza, un número que se lee cifra a cifra. Para eso existe SSML, un lenguaje de marcas estándar del W3C que permite indicar pausas, énfasis, velocidad o cómo interpretar un número o una fecha (W3C, 2010). No todas las voces admiten todas las marcas, así que conviene comprobar qué hace cada una.
6. Léelo en voz alta
Es la prueba más barata y la más útil. Lee el texto en voz alta, o mejor, escúchalo con la voz que se va a usar. Si te trabas, si tienes que respirar a mitad de frase o si al final no recuerdas la primera opción, quien lo escuche tampoco podrá.
Cuando el texto lo escribe un modelo de lenguaje
Hoy muchos asistentes de voz generan sus respuestas con un modelo de lenguaje, y estos modelos escriben por defecto para pantalla: párrafos largos, listas con viñetas, negritas, enlaces. Nada de eso se oye. Una lista con viñetas leída en voz alta pierde su estructura, y un enlace se convierte en una retahíla de letras.
Por eso las instrucciones del asistente tienen que pedir expresamente un estilo oral: respuestas cortas, sin formato, con las opciones de una en una y los números escritos como se dicen. Y hay que comprobarlo escuchando conversaciones reales, porque el modelo tiende a volver a sus hábitos de escritura.
Todo esto aplica las máximas que el filósofo Paul Grice formuló para cualquier conversación: da la información que hace falta, ni más ni menos, y dila de forma clara y ordenada (Stanford Encyclopedia of Philosophy). De oído, sus fallos se notan más.
Lista de comprobación
- ¿Cada frase se puede decir sin coger aire a la mitad?
- ¿Hay como mucho dos o tres opciones seguidas?
- ¿La puntuación produce las pausas y preguntas que quieres?
- ¿Cifras, fechas y siglas se leen bien con la voz real?
- ¿Lo has escuchado entero con la voz que se va a usar?
Escribir para el oído es una parte central del diseño de conversaciones. Si te interesa el tema, en 2018 reunimos ocho consejos para crear buenas Alexa Skills en español que siguen siendo válidos.
Referencias