
¿Cuándo me toca hablar?
Por qué los agentes de voz se pisan o se quedan callados: cómo gestionamos los turnos de palabra las personas y cómo intentan detectarlos las máquinas.
Publicado el · actualizado el · Agentes de voz
Agentes de voz en cascada, voz a voz o híbridos: cómo funciona cada arquitectura, qué ganas y qué pierdes en latencia, control y voz, y cuándo elegir cada una.


Un agente de voz escucha, entiende, decide y responde hablando. Hay tres maneras de organizar esas piezas: en cadena con componentes separados, con un único modelo que va de voz a voz, o con una mezcla de las dos. Cada una resuelve un problema y crea otro. La elección depende sobre todo de qué te importa más: la velocidad, el control, la voz o el coste.
Es la arquitectura clásica. El audio pasa por un reconocedor de voz que lo convierte en texto. Un modelo de lenguaje lee ese texto y decide qué responder, consultando las herramientas que haga falta. Y un sintetizador convierte la respuesta en voz.
Tiene ventajas claras:
Y dos inconvenientes serios. El primero es la latencia: cada pieza añade su tiempo, y la suma se nota. En una conversación entre personas, los silencios entre turnos son muy cortos, del orden de décimas de segundo. Un estudio con diez lenguas de todo el mundo encontró ese mismo patrón en todas: evitamos solaparnos y evitamos los silencios largos (Stivers et al., 2009). Una cascada que tarda un segundo y medio en responder rompe ese ritmo.
El segundo es que al pasar a texto se pierde cómo se dijeron las cosas. El tono de enfado, la duda o la ironía no llegan al modelo de lenguaje, y la voz que responde no sabe si tiene que sonar tranquilizadora o alegre.
En mayo de 2024, OpenAI presentó GPT-4o, un modelo que trabaja directamente con audio y que respondía en una media de 320 milisegundos, cerca del ritmo de una conversación humana (OpenAI, 2024). En septiembre, el laboratorio francés Kyutai publicó Moshi, un modelo abierto que puede escuchar y hablar a la vez, con una latencia práctica de unos 200 milisegundos (Défossez et al., 2024). Desde agosto de 2025, OpenAI ofrece su modelo de voz a voz para uso en producción, con llamadas a herramientas y conexión telefónica (OpenAI, 2025).
Google siguió un camino parecido. En agosto de 2024 lanzó Gemini Live, el modo de conversación por voz de la aplicación de Gemini, en el que se puede interrumpir al asistente mientras habla (TechCrunch, 2024). Para desarrolladores ofrece la Live API, con modelos de audio nativo que escuchan y responden con voz sin pasar por texto. Los últimos, Gemini 3.8 Live, presentados en septiembre de 2026, pueden llamar a herramientas sin cortar la conversación, aceptan imágenes como contexto y hablan más de 97 idiomas (Google, 2026).
Lo que ganas:
Lo que pierdes:
La calidad en español, y sobre todo en acentos poco representados, varía mucho de un modelo a otro. Conviene probarlo con tus usuarios antes de decidir.
La arquitectura híbrida más común une parte de la cadena en un solo modelo. En lugar de un reconocedor de voz y un modelo de lenguaje por separado, un único modelo escucha el audio directamente y responde en texto. Ese texto pasa a un sintetizador que va generando la voz a medida que llegan las palabras, en streaming, sin esperar a que termine la frase. Se suele llamar media cascada (half-cascade).
Ultravox es un buen ejemplo. Su modelo, de pesos abiertos, combina un codificador de audio con un modelo de lenguaje: convierte el audio directamente en la representación que usa el modelo de lenguaje, sin transcribirlo, y emite texto en streaming que después se convierte en voz (Ultravox). Sus creadores lo justifican así: al no pasar por una transcripción, no se pierden las señales de cómo habla la persona (Ultravox).
También se puede montar con algunos modelos en tiempo real de los grandes proveedores, configurados para responder en texto en lugar de audio, y añadiendo un sintetizador propio. No todos lo permiten: los modelos de audio nativo de Gemini, por ejemplo, solo responden con voz. LiveKit lo documenta como media cascada para Gemini Live y otros modelos en tiempo real: aprovechas cómo entiende el audio un modelo de voz a voz y mantienes el control total sobre la voz de salida (LiveKit).
Lo que ganas:
Lo que pierdes frente a un modelo de voz a voz completo: la voz de salida no oye a la persona, así que adapta peor el tono a cómo le han hablado, y el sintetizador sigue sumando algo de latencia, aunque el streaming la reduce mucho.
No hace falta construir la cadena desde cero. Hay marcos de desarrollo abiertos que resuelven lo común: recibir y enviar audio en tiempo real, detectar cuándo termina de hablar la persona, gestionar interrupciones y conectar con el teléfono.
Con cualquiera de los dos, cambiar de arquitectura o de proveedor es cuestión de configuración, lo que facilita probar varias opciones con tus usuarios antes de decidir.
| En cascada | De voz a voz | Híbrida | |
|---|---|---|---|
| Piezas | Reconocedor, modelo de lenguaje y sintetizador | Un modelo | Modelo de audio a texto y sintetizador |
| Latencia | La más alta | La más baja | Intermedia |
| Voz propia o de marca | Sí | Normalmente no | Sí |
| Tono y emoción | Se pierden al pasar a texto | Se conservan | Se conservan al escuchar, no al hablar |
| Revisar qué ha pasado | Fácil | Difícil | Fácil: la respuesta es texto |
| Tareas con muchas reglas | Lo más fiable | Menos predecible | Depende del modelo |
Si tu agente representa a una marca con voz propia, trabaja en un sector regulado o sigue procesos con muchas reglas, empieza por una cascada bien optimizada o por una arquitectura híbrida. Si lo más importante es que la conversación fluya, por ejemplo en compañía, práctica de idiomas o atención sencilla, un modelo de voz a voz puede darte una experiencia difícil de igualar.
En todos los casos, mide. La latencia que importa es la que percibe la persona al otro lado del teléfono, con su conexión y su ruido, no la que aparece en la ficha del proveedor.
En Monoceros diseñamos y construimos agentes de voz con cualquiera de estas tres arquitecturas, y elegimos con cada cliente la que encaja con su caso, sus reglas y su presupuesto. Cuando el agente necesita sonar como nadie más, creamos voces sintéticas a medida, clonadas con permiso o diseñadas desde cero, que se pueden usar en una cascada o en una arquitectura híbrida. Y antes de lanzarlo, lo evaluamos con conversaciones reales: latencia, interrupciones, errores de reconocimiento y cumplimiento de las normas del negocio.
Compartir este artículo:
This page is also available in English.
View in English