Publicado el · actualizado el · Agentes de voz

Tres formas de montar un agente de voz y ninguna es perfecta

Agentes de voz en cascada, voz a voz o híbridos: cómo funciona cada arquitectura, qué ganas y qué pierdes en latencia, control y voz, y cuándo elegir cada una.

3 formas de montar un agente de voz

Un agente de voz escucha, entiende, decide y responde hablando. Hay tres maneras de organizar esas piezas: en cadena con componentes separados, con un único modelo que va de voz a voz, o con una mezcla de las dos. Cada una resuelve un problema y crea otro. La elección depende sobre todo de qué te importa más: la velocidad, el control, la voz o el coste.

En cascada: una pieza para cada cosa

Es la arquitectura clásica. El audio pasa por un reconocedor de voz que lo convierte en texto. Un modelo de lenguaje lee ese texto y decide qué responder, consultando las herramientas que haga falta. Y un sintetizador convierte la respuesta en voz.

Tiene ventajas claras:

  • Puedes elegir cada pieza. El reconocedor que mejor entienda a tus usuarios, el modelo de lenguaje que prefieras y la voz que quieras, incluida una voz de marca hecha a medida.
  • Todo pasa por texto, así que puedes leer qué entendió el sistema y qué decidió. Revisar errores y cumplir con auditorías es mucho más fácil.
  • Los modelos de lenguaje de texto son hoy los más fiables siguiendo instrucciones y usando herramientas.

Y dos inconvenientes serios. El primero es la latencia: cada pieza añade su tiempo, y la suma se nota. En una conversación entre personas, los silencios entre turnos son muy cortos, del orden de décimas de segundo. Un estudio con diez lenguas de todo el mundo encontró ese mismo patrón en todas: evitamos solaparnos y evitamos los silencios largos (Stivers et al., 2009). Una cascada que tarda un segundo y medio en responder rompe ese ritmo.

El segundo es que al pasar a texto se pierde cómo se dijeron las cosas. El tono de enfado, la duda o la ironía no llegan al modelo de lenguaje, y la voz que responde no sabe si tiene que sonar tranquilizadora o alegre.

De voz a voz: un solo modelo

En mayo de 2024, OpenAI presentó GPT-4o, un modelo que trabaja directamente con audio y que respondía en una media de 320 milisegundos, cerca del ritmo de una conversación humana (OpenAI, 2024). En septiembre, el laboratorio francés Kyutai publicó Moshi, un modelo abierto que puede escuchar y hablar a la vez, con una latencia práctica de unos 200 milisegundos (Défossez et al., 2024). Desde agosto de 2025, OpenAI ofrece su modelo de voz a voz para uso en producción, con llamadas a herramientas y conexión telefónica (OpenAI, 2025).

Google siguió un camino parecido. En agosto de 2024 lanzó Gemini Live, el modo de conversación por voz de la aplicación de Gemini, en el que se puede interrumpir al asistente mientras habla (TechCrunch, 2024). Para desarrolladores ofrece la Live API, con modelos de audio nativo que escuchan y responden con voz sin pasar por texto. Los últimos, Gemini 3.8 Live, presentados en septiembre de 2026, pueden llamar a herramientas sin cortar la conversación, aceptan imágenes como contexto y hablan más de 97 idiomas (Google, 2026).

Lo que ganas:

  • Rapidez. No hay tres piezas esperándose unas a otras.
  • La forma de hablar entra y sale del modelo. Puede notar que alguien duda y responder con un tono acorde.
  • Las interrupciones se manejan con más naturalidad, sobre todo en los modelos que escuchan mientras hablan.

Lo que pierdes:

  • La voz. Normalmente eliges entre las voces que ofrece el proveedor. Una voz de marca propia o una voz clonada con permiso no suelen estar disponibles.
  • Control y visibilidad. Es más difícil saber por qué dijo lo que dijo, y más difícil corregir una pronunciación concreta.
  • Fiabilidad en tareas complejas. Han mejorado mucho siguiendo instrucciones y usando herramientas, pero en procesos largos con muchas reglas un modelo de texto sigue siendo más predecible.
  • Previsión de costes. El audio se factura de forma distinta al texto, así que hay que calcularlo por minuto de conversación y compararlo con la cascada.

La calidad en español, y sobre todo en acentos poco representados, varía mucho de un modelo a otro. Conviene probarlo con tus usuarios antes de decidir.

Híbrida: menos piezas, la voz que quieras

La arquitectura híbrida más común une parte de la cadena en un solo modelo. En lugar de un reconocedor de voz y un modelo de lenguaje por separado, un único modelo escucha el audio directamente y responde en texto. Ese texto pasa a un sintetizador que va generando la voz a medida que llegan las palabras, en streaming, sin esperar a que termine la frase. Se suele llamar media cascada (half-cascade).

Ultravox es un buen ejemplo. Su modelo, de pesos abiertos, combina un codificador de audio con un modelo de lenguaje: convierte el audio directamente en la representación que usa el modelo de lenguaje, sin transcribirlo, y emite texto en streaming que después se convierte en voz (Ultravox). Sus creadores lo justifican así: al no pasar por una transcripción, no se pierden las señales de cómo habla la persona (Ultravox).

También se puede montar con algunos modelos en tiempo real de los grandes proveedores, configurados para responder en texto en lugar de audio, y añadiendo un sintetizador propio. No todos lo permiten: los modelos de audio nativo de Gemini, por ejemplo, solo responden con voz. LiveKit lo documenta como media cascada para Gemini Live y otros modelos en tiempo real: aprovechas cómo entiende el audio un modelo de voz a voz y mantienes el control total sobre la voz de salida (LiveKit).

Lo que ganas:

  • Una pieza menos que en la cascada, y por tanto menos espera.
  • El modelo recibe el audio original, con el tono y las dudas de la persona, y no solo una transcripción.
  • Eliges la voz, incluida una voz de marca propia.
  • La respuesta existe como texto, así que se puede revisar, filtrar y guardar.

Lo que pierdes frente a un modelo de voz a voz completo: la voz de salida no oye a la persona, así que adapta peor el tono a cómo le han hablado, y el sintetizador sigue sumando algo de latencia, aunque el streaming la reduce mucho.

Con qué se montan

No hace falta construir la cadena desde cero. Hay marcos de desarrollo abiertos que resuelven lo común: recibir y enviar audio en tiempo real, detectar cuándo termina de hablar la persona, gestionar interrupciones y conectar con el teléfono.

  • Pipecat, mantenido por Daily y su comunidad, admite tanto cadenas de componentes como modelos de voz a voz de OpenAI, Gemini, Ultravox y otros proveedores (Pipecat).
  • LiveKit Agents, de código abierto, sirve para cascadas, para modelos de voz a voz como OpenAI Realtime, Gemini Live o Ultravox, y para la media cascada. Incluye soporte para llamadas telefónicas (LiveKit).

Con cualquiera de los dos, cambiar de arquitectura o de proveedor es cuestión de configuración, lo que facilita probar varias opciones con tus usuarios antes de decidir.

Comparación rápida

En cascadaDe voz a vozHíbrida
PiezasReconocedor, modelo de lenguaje y sintetizadorUn modeloModelo de audio a texto y sintetizador
LatenciaLa más altaLa más bajaIntermedia
Voz propia o de marcaSíNormalmente noSí
Tono y emociónSe pierden al pasar a textoSe conservanSe conservan al escuchar, no al hablar
Revisar qué ha pasadoFácilDifícilFácil: la respuesta es texto
Tareas con muchas reglasLo más fiableMenos predecibleDepende del modelo

Cómo elegir

Si tu agente representa a una marca con voz propia, trabaja en un sector regulado o sigue procesos con muchas reglas, empieza por una cascada bien optimizada o por una arquitectura híbrida. Si lo más importante es que la conversación fluya, por ejemplo en compañía, práctica de idiomas o atención sencilla, un modelo de voz a voz puede darte una experiencia difícil de igualar.

En todos los casos, mide. La latencia que importa es la que percibe la persona al otro lado del teléfono, con su conexión y su ruido, no la que aparece en la ficha del proveedor.

Cómo te ayudamos

En Monoceros diseñamos y construimos agentes de voz con cualquiera de estas tres arquitecturas, y elegimos con cada cliente la que encaja con su caso, sus reglas y su presupuesto. Cuando el agente necesita sonar como nadie más, creamos voces sintéticas a medida, clonadas con permiso o diseñadas desde cero, que se pueden usar en una cascada o en una arquitectura híbrida. Y antes de lanzarlo, lo evaluamos con conversaciones reales: latencia, interrupciones, errores de reconocimiento y cumplimiento de las normas del negocio.

Referencias

Escrito por

Carlos Muñoz-Romero

Cofundador de Monoceros Labs

Cofundador de Monoceros Labs. Ingeniero informático y máster en ciencia de datos, dirige la tecnología de voz de Fonos. Antes Chief Innovation Officer de BEEVA (ahora BBVA Technology).

Compartir este artículo:

Artículos relacionados

¿Cuándo me toca hablar?

¿Cuándo me toca hablar?

Por qué los agentes de voz se pisan o se quedan callados: cómo gestionamos los turnos de palabra las personas y cómo intentan detectarlos las máquinas.