
Hacer un chatbot en 2018 y hacerlo hoy
De las intenciones y los flujos de Alexa a los agentes con modelos de lenguaje: qué ha cambiado al construir un chatbot o asistente de voz, y qué sigue igual.
Publicado el · Agentes de IA
Modelos rápidos, modelos de razonamiento y la nueva familia de modelos que solo deciden, como Jev: qué aporta cada uno en un agente de voz, donde la latencia manda, y cómo combinarlos.


Daniel Kahneman popularizó la idea de que pensamos de dos maneras. El sistema 1 es rápido, automático e intuitivo: reconoce una cara, entiende una frase, esquiva un balón. El sistema 2 es lento y deliberado: calcula, compara opciones, revisa (Kahneman, 2011). Usamos el primero casi todo el tiempo y el segundo solo cuando hace falta, porque es caro.
Con los modelos de lenguaje ha pasado algo parecido. Hoy conviven modelos que responden al instante y modelos que se toman su tiempo para razonar antes de contestar. Y en los últimos meses ha aparecido un tercer tipo, que ni siquiera escribe: solo decide. En un agente de voz, elegir bien entre ellos es una de las decisiones que más afectan a la experiencia.
Los modelos de lenguaje clásicos generan la respuesta directamente, palabra a palabra. Son rápidos y, para la mayoría de las tareas conversacionales, suficientes.
En septiembre de 2024, OpenAI presentó o1, un modelo entrenado para generar una larga cadena de razonamiento interno antes de responder (OpenAI, 2024). En enero de 2025, DeepSeek publicó R1, que mostraba que esa capacidad se podía conseguir con aprendizaje por refuerzo y la ponía al alcance de cualquiera con un modelo de pesos abiertos (DeepSeek-AI, 2025). Poco después llegaron los modelos híbridos: Claude 3.7 Sonnet, en febrero de 2025, permitía elegir entre respuesta inmediata o razonamiento extendido, y fijar cuántos tokens podía dedicar a pensar (Anthropic, 2025). Hoy casi todos los proveedores ofrecen algo así.
Los modelos de razonamiento son claramente mejores en matemáticas, programación, planificación y problemas con muchas condiciones. El precio es el tiempo y el coste: cada token de razonamiento hay que generarlo, y se paga.
Un estudio de finales de 2024 analizó cómo se comportan estos modelos con problemas triviales. Su título lo resume bien: Do NOT Think That Much for 2+3=? («No pienses tanto para 2+3»). Encontraron que dedicaban muchos recursos a problemas simples sin mejorar el resultado (Chen et al., 2024). Razonar de más gasta tiempo y dinero, y a veces lleva a darle vueltas a algo que estaba bien a la primera.
En un chat escrito, esperar unos segundos a una respuesta bien pensada puede ser aceptable. En una conversación de voz, no. Como contamos en cuándo me toca hablar, entre dos personas los silencios entre turnos son de décimas de segundo. Un agente que tarda cinco segundos en contestar a «¿a qué hora abrís mañana?» parece averiado, por muy buena que sea la respuesta.
Por eso, en voz, el modelo que habla con la persona tiene que ser rápido. La mayoría de lo que ocurre en una conversación de atención al cliente (saludar, entender qué quiere alguien, pedir un dato, confirmar, responder una pregunta frecuente) no necesita razonamiento largo.
Buena parte de lo que hace un agente no es hablar, sino tomar decisiones pequeñas. ¿Qué quiere esta persona? ¿Está pidiendo hablar con alguien? ¿Ya tenemos todos los datos? ¿Se está enfadando? Para responder a eso, un modelo de lenguaje genera texto que luego hay que interpretar, y a veces contesta algo que no estaba entre las opciones.
En septiembre de 2026, TypeSafe AI presentó Jev, el primero de lo que llama System One models, en un guiño directo a Kahneman (TypeSafe AI, 2026). Jev no genera texto. Recibe la situación (la conversación, los datos del cliente) y una pregunta cerrada, y devuelve una respuesta de un tipo definido de antemano: una opción de una lista, la probabilidad de que algo sea cierto o una puntuación en una escala. Siempre acompañada de una probabilidad calibrada, es decir, que refleja de verdad lo seguro que está.
Su valor está en tres cosas:
No sirven para todo. No escriben respuestas ni explican su razonamiento, trabajan solo con texto y manejan un número limitado de opciones. Son una pieza más, no un sustituto.
No es solo una empresa. Ya hay alternativas abiertas como Laya, con licencia libre, que hace este tipo de decisiones en más de cien idiomas con modelos pequeños que caben en una sola tarjeta gráfica (Laya). Hay incluso comparativas específicas: JevBench enfrenta a más de cien sistemas en acierto, calibración, velocidad y coste, y muchos de los mejores quedan prácticamente empatados (JevBench). Y OpenAI ha anunciado recientemente Decisions API, su propia apuesta por este tipo de decisiones rápidas y estructuradas. Todo apunta a que esta categoría va a estar en el centro de muchos agentes.
La solución más interesante es no elegir: combinar los dos. En 2024, Konstantina Christakopoulou y sus colegas propusieron una arquitectura inspirada directamente en Kahneman, con dos piezas. Un «conversador» rápido, que mantiene la conversación con la persona, y un «razonador» lento, que planifica, usa herramientas y toma las decisiones complejas en segundo plano (Christakopoulou et al., 2024).
En un agente de voz, eso se traduce en algo así: el modelo rápido responde enseguida, pide los datos que faltan y avisa de que está comprobando algo («un momento, lo miro»), mientras un modelo más lento revisa las condiciones de una devolución o calcula una tarifa. Cuando el razonador termina, el conversador comunica el resultado. La persona no oye silencios largos y las decisiones difíciles no se toman a la ligera. Es parecido a la arquitectura híbrida que describimos en tres formas de montar un agente de voz.
Los modelos de decisión encajan como una tercera pieza. Mientras el conversador habla, un modelo como Jev resuelve en un instante las decisiones pequeñas: a qué flujo derivar, si falta algún dato, si la persona quiere hablar con alguien. Cuando está seguro, el agente sigue. Cuando no, la decisión pasa al razonador o a una persona.
Modelos rápidos:
Modelos de decisión, como Jev:
Modelos de razonamiento:
Mide cada tarea por separado. Para cada una, compara con tus conversaciones de prueba cuánto acierta un modelo rápido, uno de razonamiento y, si la tarea es una decisión cerrada, uno de decisión; cuánto tarda cada uno y cuánto cuesta. Los resultados de las comparativas públicas orientan, pero no sustituyen a probar con tus datos, y menos en español. Muchas veces el rápido acierta casi igual, y la diferencia no justifica la espera. Otras, la diferencia en una tarea concreta es grande, y ahí merece la pena pagar el tiempo, mejor si es en segundo plano.
Es un campo que cambia cada pocos meses, y lo que hoy exige un modelo de razonamiento mañana lo hará uno rápido. Por eso preferimos diseñar agentes donde cambiar el modelo de cada pieza sea fácil, y medir antes de decidir. Si quieres explorarlo para tu caso, es el tipo de trabajo que hacemos en investigación aplicada y prototipos.
Compartir este artículo:


De las intenciones y los flujos de Alexa a los agentes con modelos de lenguaje: qué ha cambiado al construir un chatbot o asistente de voz, y qué sigue igual.


Sistemas multiagente: cuándo compensa repartir una tarea entre varios agentes de IA, cuándo complica más de lo que resuelve y qué cambia en una llamada.


Las redacciones automatizan cada vez más y se acercan a los agentes de IA. Por qué revisar todo a mano no escala y por qué hace falta un experto en el bucle.
This page is also available in English.
View in English