Publicado el · Agentes de IA

Modelos que deciden rápido y modelos que piensan despacio

Modelos rápidos, modelos de razonamiento y la nueva familia de modelos que solo deciden, como Jev: qué aporta cada uno en un agente de voz, donde la latencia manda, y cómo combinarlos.

Pensar rápido, pensar despacio

Daniel Kahneman popularizó la idea de que pensamos de dos maneras. El sistema 1 es rápido, automático e intuitivo: reconoce una cara, entiende una frase, esquiva un balón. El sistema 2 es lento y deliberado: calcula, compara opciones, revisa (Kahneman, 2011). Usamos el primero casi todo el tiempo y el segundo solo cuando hace falta, porque es caro.

Con los modelos de lenguaje ha pasado algo parecido. Hoy conviven modelos que responden al instante y modelos que se toman su tiempo para razonar antes de contestar. Y en los últimos meses ha aparecido un tercer tipo, que ni siquiera escribe: solo decide. En un agente de voz, elegir bien entre ellos es una de las decisiones que más afectan a la experiencia.

Dos formas de responder

Los modelos de lenguaje clásicos generan la respuesta directamente, palabra a palabra. Son rápidos y, para la mayoría de las tareas conversacionales, suficientes.

En septiembre de 2024, OpenAI presentó o1, un modelo entrenado para generar una larga cadena de razonamiento interno antes de responder (OpenAI, 2024). En enero de 2025, DeepSeek publicó R1, que mostraba que esa capacidad se podía conseguir con aprendizaje por refuerzo y la ponía al alcance de cualquiera con un modelo de pesos abiertos (DeepSeek-AI, 2025). Poco después llegaron los modelos híbridos: Claude 3.7 Sonnet, en febrero de 2025, permitía elegir entre respuesta inmediata o razonamiento extendido, y fijar cuántos tokens podía dedicar a pensar (Anthropic, 2025). Hoy casi todos los proveedores ofrecen algo así.

Los modelos de razonamiento son claramente mejores en matemáticas, programación, planificación y problemas con muchas condiciones. El precio es el tiempo y el coste: cada token de razonamiento hay que generarlo, y se paga.

Pensar más no siempre es mejor

Un estudio de finales de 2024 analizó cómo se comportan estos modelos con problemas triviales. Su título lo resume bien: Do NOT Think That Much for 2+3=? («No pienses tanto para 2+3»). Encontraron que dedicaban muchos recursos a problemas simples sin mejorar el resultado (Chen et al., 2024). Razonar de más gasta tiempo y dinero, y a veces lleva a darle vueltas a algo que estaba bien a la primera.

En una conversación, el tiempo manda

En un chat escrito, esperar unos segundos a una respuesta bien pensada puede ser aceptable. En una conversación de voz, no. Como contamos en cuándo me toca hablar, entre dos personas los silencios entre turnos son de décimas de segundo. Un agente que tarda cinco segundos en contestar a «¿a qué hora abrís mañana?» parece averiado, por muy buena que sea la respuesta.

Por eso, en voz, el modelo que habla con la persona tiene que ser rápido. La mayoría de lo que ocurre en una conversación de atención al cliente (saludar, entender qué quiere alguien, pedir un dato, confirmar, responder una pregunta frecuente) no necesita razonamiento largo.

Modelos que no escriben: solo deciden

Buena parte de lo que hace un agente no es hablar, sino tomar decisiones pequeñas. ¿Qué quiere esta persona? ¿Está pidiendo hablar con alguien? ¿Ya tenemos todos los datos? ¿Se está enfadando? Para responder a eso, un modelo de lenguaje genera texto que luego hay que interpretar, y a veces contesta algo que no estaba entre las opciones.

En septiembre de 2026, TypeSafe AI presentó Jev, el primero de lo que llama System One models, en un guiño directo a Kahneman (TypeSafe AI, 2026). Jev no genera texto. Recibe la situación (la conversación, los datos del cliente) y una pregunta cerrada, y devuelve una respuesta de un tipo definido de antemano: una opción de una lista, la probabilidad de que algo sea cierto o una puntuación en una escala. Siempre acompañada de una probabilidad calibrada, es decir, que refleja de verdad lo seguro que está.

Su valor está en tres cosas:

  • Rapidez. Según la empresa, responde en décimas de segundo, mucho más rápido que un modelo de lenguaje haciendo la misma tarea. En voz, esa diferencia se nota.
  • Respuestas que el código puede usar tal cual. La respuesta siempre es una de las opciones previstas, así que no hay que interpretar texto ni protegerse de respuestas inventadas. Eso no garantiza que acierte, pero sí que el agente sepa qué hacer con lo que recibe.
  • Saber cuándo no está seguro. Con una probabilidad fiable, el agente puede actuar solo cuando la confianza es alta y, si no, pedir una aclaración, pasar el caso a un modelo de razonamiento o a una persona.

No sirven para todo. No escriben respuestas ni explican su razonamiento, trabajan solo con texto y manejan un número limitado de opciones. Son una pieza más, no un sustituto.

No es solo una empresa. Ya hay alternativas abiertas como Laya, con licencia libre, que hace este tipo de decisiones en más de cien idiomas con modelos pequeños que caben en una sola tarjeta gráfica (Laya). Hay incluso comparativas específicas: JevBench enfrenta a más de cien sistemas en acierto, calibración, velocidad y coste, y muchos de los mejores quedan prácticamente empatados (JevBench). Y OpenAI ha anunciado recientemente Decisions API, su propia apuesta por este tipo de decisiones rápidas y estructuradas. Todo apunta a que esta categoría va a estar en el centro de muchos agentes.

Un agente que piensa rápido y despacio a la vez

La solución más interesante es no elegir: combinar los dos. En 2024, Konstantina Christakopoulou y sus colegas propusieron una arquitectura inspirada directamente en Kahneman, con dos piezas. Un «conversador» rápido, que mantiene la conversación con la persona, y un «razonador» lento, que planifica, usa herramientas y toma las decisiones complejas en segundo plano (Christakopoulou et al., 2024).

En un agente de voz, eso se traduce en algo así: el modelo rápido responde enseguida, pide los datos que faltan y avisa de que está comprobando algo («un momento, lo miro»), mientras un modelo más lento revisa las condiciones de una devolución o calcula una tarifa. Cuando el razonador termina, el conversador comunica el resultado. La persona no oye silencios largos y las decisiones difíciles no se toman a la ligera. Es parecido a la arquitectura híbrida que describimos en tres formas de montar un agente de voz.

Los modelos de decisión encajan como una tercera pieza. Mientras el conversador habla, un modelo como Jev resuelve en un instante las decisiones pequeñas: a qué flujo derivar, si falta algún dato, si la persona quiere hablar con alguien. Cuando está seguro, el agente sigue. Cuando no, la decisión pasa al razonador o a una persona.

Cuándo usar cada uno

Modelos rápidos:

  • Llevar la conversación en tiempo real.
  • Extraer datos de lo que dice la persona: fechas, nombres, números.
  • Responder con información ya preparada.

Modelos de decisión, como Jev:

  • Clasificar qué quiere la persona y a qué flujo o herramienta derivar.
  • Comprobar condiciones concretas: si hay datos suficientes, si pide hablar con alguien, si está molesta.
  • Puntuar cosas en una escala, como la urgencia de una petición.
  • Decidir cuándo una respuesta es lo bastante segura y cuándo hay que escalar.

Modelos de razonamiento:

  • Aplicar normas con muchas condiciones o excepciones.
  • Planificar tareas de varios pasos.
  • Revisar una decisión antes de ejecutarla, sobre todo si tiene consecuencias: un pago, una cancelación.
  • Tareas que no ocurren en directo, como analizar conversaciones o evaluar respuestas.

Cómo decidir en la práctica

Mide cada tarea por separado. Para cada una, compara con tus conversaciones de prueba cuánto acierta un modelo rápido, uno de razonamiento y, si la tarea es una decisión cerrada, uno de decisión; cuánto tarda cada uno y cuánto cuesta. Los resultados de las comparativas públicas orientan, pero no sustituyen a probar con tus datos, y menos en español. Muchas veces el rápido acierta casi igual, y la diferencia no justifica la espera. Otras, la diferencia en una tarea concreta es grande, y ahí merece la pena pagar el tiempo, mejor si es en segundo plano.

Es un campo que cambia cada pocos meses, y lo que hoy exige un modelo de razonamiento mañana lo hará uno rápido. Por eso preferimos diseñar agentes donde cambiar el modelo de cada pieza sea fácil, y medir antes de decidir. Si quieres explorarlo para tu caso, es el tipo de trabajo que hacemos en investigación aplicada y prototipos.

Referencias

Escrito por

Carlos Muñoz-Romero

Cofundador de Monoceros Labs

Cofundador de Monoceros Labs. Ingeniero informático y máster en ciencia de datos, dirige la tecnología de voz de Fonos. Antes Chief Innovation Officer de BEEVA (ahora BBVA Technology).

Compartir este artículo:

Artículos relacionados

2018 y hoy: qué ha cambiado al hacer un chatbot

Hacer un chatbot en 2018 y hacerlo hoy

De las intenciones y los flujos de Alexa a los agentes con modelos de lenguaje: qué ha cambiado al construir un chatbot o asistente de voz, y qué sigue igual.

Varios agentes para una llamada

¿Cuántos agentes hacen falta para atender una llamada?

Sistemas multiagente: cuándo compensa repartir una tarea entre varios agentes de IA, cuándo complica más de lo que resuelve y qué cambia en una llamada.

¿Quién revisa?

En una redacción con agentes, ¿quién revisa?

Las redacciones automatizan cada vez más y se acercan a los agentes de IA. Por qué revisar todo a mano no escala y por qué hace falta un experto en el bucle.