En 2018 pasábamos los días escribiendo frases de ejemplo para que Alexa entendiera a la gente. Hoy, un modelo de lenguaje entiende casi cualquier forma de pedir algo sin que nadie le haya dado ejemplos. Entre una cosa y otra ha cambiado casi todo en la forma de construir un asistente. Lo que no ha cambiado es lo que hace que un asistente funcione para las personas, y ahora se nota más cuando falta.
Cómo se hacía en 2018
Un asistente se construía por piezas. Primero, la comprensión del lenguaje: cada petición se clasificaba en una intención («reservar mesa», «consultar horario») y se extraían los datos importantes, como la fecha o el número de personas. En Alexa, eso se definía con intenciones, frases de ejemplo y huecos para los datos, lo que Amazon llama slots (Amazon). Después, un gestor del diálogo decidía qué hacer según el estado de la conversación. Y por último, se generaba la respuesta, casi siempre a partir de plantillas escritas a mano.
Esa arquitectura venía de décadas de investigación en sistemas de diálogo hablado, bien recogida en el manual de Michael McTear, Zoraida Callejas y David Griol sobre interfaces conversacionales (McTear et al., 2016). Funcionaba, pero tenía límites conocidos. Solo entendía lo que alguien había previsto: si la persona pedía algo con palabras que no estaban en los ejemplos, o algo para lo que no había intención, la respuesta era «perdona, no te he entendido». Cada intención nueva exigía muchas frases de ejemplo, y mantener cientos de ellas era un trabajo enorme. En Monoceros hicimos muchas aplicaciones para Alexa así, y parte de lo que aprendimos está en ocho consejos para crear buenas Alexa Skills en español.
Qué ha cambiado
Con los modelos de lenguaje, esas tres piezas se pueden resolver con una sola. El modelo entiende lo que se le pide aunque se diga de mil formas, mantiene el contexto de la conversación y redacta la respuesta. Un prototipo que conversa de verdad se monta en días.
Las plataformas han seguido el mismo camino. Microsoft retiró por completo su servicio de comprensión del lenguaje LUIS el 31 de marzo de 2026 y recomienda migrar a su nuevo servicio, Conversational Language Understanding (CLU) (Microsoft Learn). Amazon presentó en febrero de 2025 Alexa+, la nueva generación de Alexa basada en modelos de lenguaje generativos (Amazon, 2025). Y herramientas como Rasa han pasado a un enfoque híbrido, en el que el modelo interpreta lo que quiere el usuario y la lógica de negocio sigue siendo determinista (Rasa).
Lo que no ha cambiado
Hay que diseñar la conversación
Que el modelo sepa hablar no significa que sepa qué decir en tu servicio. Hay que decidir qué hace el asistente y qué no, cómo se presenta, cómo pide los datos, cómo responde cuando no puede ayudar y qué personalidad tiene. Antes lo escribíamos respuesta a respuesta. Ahora se escribe en las instrucciones y en los ejemplos, pero el trabajo de pensar la conversación sigue ahí.
Hay que conocer los límites
Un asistente de 2018 fallaba de forma visible: no entendía y lo decía. Uno de hoy puede fallar sin que se note, respondiendo con seguridad algo falso o prometiendo algo que no puede cumplir. Saber qué no hace bien la tecnología, y diseñar para eso, es más importante que antes.
Hay que probarlo
Antes podías recorrer todos los caminos del flujo. Ahora los caminos son infinitos y el modelo no responde dos veces igual. La evaluación ha pasado de ser una fase final a ser una parte continua del trabajo, como contamos en evaluar un agente antes de que lo usen tus clientes.
Hay que saber pasar a una persona
Hay conversaciones que un asistente no debe llevar solo: una queja seria, una situación delicada, un caso que no encaja. Diseñar bien ese traspaso era importante en 2018 y lo sigue siendo.
El contexto de uso manda
El ruido de una cocina, la prisa de alguien que llama desde el coche o la paciente que habla desde la cama de un hospital siguen condicionando lo que funciona. Lo explicamos en qué preguntarte antes de construir un asistente.
Lo que conservaría de 2018
Hay situaciones en las que el riesgo de un error es elevado, porque afecta a las personas o a los clientes, y también al negocio: un pago, una cita médica, un dato legal. Para esas partes sigo prefiriendo flujos y textos cerrados, revisados por personas. El modelo de lenguaje puede entender la petición y llevar la conversación, pero la decisión y el texto que compromete a la empresa deben estar bajo control. Es la idea de los sistemas híbridos, y es también la lección de muchos años construyendo asistentes que la gente usa de verdad.
La tecnología nos ha quitado mucho trabajo repetitivo. El trabajo de diseño, de evaluación y de conocer a quien va a usar el asistente sigue siendo nuestro, y es el que ofrecemos en diseño de conversaciones y agentes.
Referencias