Publicado el · actualizado el · Agentes de IA

Lo que cambia cuando tu app aprende a conversar

Añadir un chat con IA a una app parece fácil. Las formas de construir una app conversacional y los retos que siguen ahí: contexto, errores, pruebas y coste.

Del botón a la conversación

Con los modelos de lenguaje, añadir un chat a una aplicación parece cuestión de una tarde: una llamada a una API, una caja de texto y listo. Y es verdad que se puede tener algo que responde en muy poco tiempo. Lo difícil empieza después, cuando esa conversación tiene que ser fiable, útil y barata de mantener.

En 2024 escribí sobre esto para Samsung Dev Spain (Ábalos, 2024). Este artículo recoge las ideas principales y las pone al día.

Qué cambia para quien usa la app

Una interfaz conversacional permite pedir las cosas con tus palabras en lugar de buscar el botón adecuado. Bien hecha, simplifica la pantalla y hace la aplicación más accesible. Además, la propia conversación da información: quien pide «algo para cenar sin gluten» te está diciendo qué necesita sin que tengas que preguntárselo en un formulario.

La contrapartida es que las expectativas suben. Si la aplicación habla con naturalidad, la gente espera que entienda como una persona, que recuerde lo que se dijo antes y que sepa decir que no cuando algo no se puede hacer. Por eso sigue haciendo falta diseñar la conversación, aunque la genere un modelo.

Cómo se construye

La clásica, con intenciones y flujos

El sistema clasifica cada frase en una intención («consultar saldo», «cambiar contraseña»), extrae los datos importantes y sigue un flujo diseñado de antemano. Es predecible y fácil de auditar, pero solo entiende lo que alguien previó y cuesta mucho mantenerlo cuando crece.

Con un modelo de lenguaje

El modelo interpreta lo que dice la persona y genera la respuesta. Entiende muchas más formas de decir lo mismo y responde con naturalidad, pero puede inventar datos, saltarse pasos o responder a cosas que no debería.

La híbrida

El modelo de lenguaje interpreta y redacta, y la lógica de negocio sigue estando en código o en flujos que se ejecutan siempre igual. Es la dirección que han tomado muchas plataformas. Rasa, por ejemplo, la describe así en su enfoque CALM: el modelo interpreta lo que quiere el usuario y la lógica decide qué pasa después (Rasa). Para la mayoría de las aplicaciones que tocan datos o dinero, es la opción más sensata.

Y ahora, agentes

Desde 2024 se ha sumado una cuarta variante: los agentes, que además de conversar deciden qué herramientas usar para completar una tarea. Estándares como el Model Context Protocol, que Anthropic presentó en noviembre de 2024, facilitan conectar un asistente con los sistemas de la empresa (Anthropic, 2024). Dan más autonomía, y por eso necesitan todavía más límites.

Los retos que siguen ahí

Mantener el contexto

Una conversación útil recuerda lo que se ha dicho: si pides «y la de mañana», el sistema tiene que saber que hablabas de una reserva. Los modelos de lenguaje manejan bien el contexto dentro de una conversación, pero tienen un límite de memoria y cuesta dinero enviarles todo el historial cada vez. Entre sesiones, alguien tiene que decidir qué se guarda, dónde y durante cuánto tiempo.

Respuestas inventadas

Un modelo de lenguaje responde con seguridad incluso cuando no sabe. Para preguntas sobre tus productos o tus normas, la técnica habitual es la generación aumentada por recuperación, o RAG: antes de responder, el sistema busca en tus documentos y le pasa al modelo los fragmentos relevantes (Lewis et al., 2020). Reduce mucho el problema, pero no lo elimina. Hay que comprobar que la respuesta dice lo que dicen los documentos.

Cuando la conversación se desvía

La gente no sigue el guion: cambia de tema, corrige lo que dijo o pide cosas que la aplicación no hace. Los sistemas clásicos respondían con un «no te he entendido». Los modelos de lenguaje permiten recuperar la conversación con más naturalidad, siempre que el diseño prevea qué hacer en cada caso, incluido pasar a una persona.

Probar lo que no se puede enumerar

En una aplicación con botones, puedes probar todos los caminos. En una conversación, los caminos son infinitos y el modelo no responde dos veces igual. Hay que probar con muchas conversaciones realistas y medir, en vez de revisar una por una. Es una disciplina propia, y la contamos en evaluar un agente antes de que lo usen tus clientes.

Coste, latencia y seguridad

Cada respuesta de un modelo grande tiene un coste y tarda un tiempo, que en voz se nota más. A veces un sistema clásico resuelve lo mismo igual de bien, más rápido y más barato. Y hay riesgos nuevos: la inyección de instrucciones, en la que alguien escribe un texto para que el modelo ignore sus reglas, encabeza la lista de riesgos de OWASP para aplicaciones con modelos de lenguaje (OWASP, 2025).

Decir que es una IA

Desde el 2 de agosto de 2026, el Reglamento europeo de IA obliga a que los sistemas que conversan con personas les informen de que están hablando con una IA, salvo que resulte evidente (Reglamento (UE) 2024/1689, artículo 50). Es una buena práctica de diseño desde mucho antes: la gente ajusta cómo habla y cuánto confía según sepa con quién habla.

Por dónde empezar

Empieza por un caso concreto y acotado, donde sepas qué es una buena respuesta. Diseña la conversación antes de elegir el modelo. Decide qué partes tienen que ser deterministas. Y prepara desde el principio un conjunto de conversaciones de prueba con las que medir cada cambio.

Si estás en ese punto, puede ayudarte leer antes qué preguntarte antes de construir un asistente. Y si quieres que lo pensemos contigo, es lo que hacemos en diseño de conversaciones y agentes.

Referencias

Escrito por

Nieves Ábalos

Cofundadora de Monoceros Labs

Cofundadora de Monoceros Labs. Ingeniera informática, investiga sistemas de diálogo desde 2009 y hoy hace el doctorado en IA en la Universidad de Granada.

Compartir este artículo:

Artículos relacionados

2018 y hoy: qué ha cambiado al hacer un chatbot

Hacer un chatbot en 2018 y hacerlo hoy

De las intenciones y los flujos de Alexa a los agentes con modelos de lenguaje: qué ha cambiado al construir un chatbot o asistente de voz, y qué sigue igual.

Varios agentes para una llamada

¿Cuántos agentes hacen falta para atender una llamada?

Sistemas multiagente: cuándo compensa repartir una tarea entre varios agentes de IA, cuándo complica más de lo que resuelve y qué cambia en una llamada.

¿Quién revisa?

En una redacción con agentes, ¿quién revisa?

Las redacciones automatizan cada vez más y se acercan a los agentes de IA. Por qué revisar todo a mano no escala y por qué hace falta un experto en el bucle.