«Nos preocupa lanzar un asistente sin saber si es fiable, si trata bien a los usuarios o si cumple la normativa.»

Servicios

Evaluación de asistentes y agentes

Analizamos asistentes, chatbots y agentes de voz o texto con criterios de calidad conversacional, experiencia de usuario y riesgo. Te devolvemos un diagnóstico claro y un plan de mejora, con especial atención al español.

Evaluación de chatbots, asistentes y agentes de IA

Evaluar un chatbot o un agente de IA es comprobar, con conversaciones reales o simuladas, qué entiende, dónde falla y qué riesgos tiene antes de que lo descubran tus usuarios. Medimos la calidad conversacional, la experiencia de usuario y el cumplimiento del Reglamento europeo de IA, con especial atención al español.

Auditoría de conversaciones

Analizamos conversaciones reales o simuladas para detectar malentendidos, respuestas inventadas, bucles y abandonos.

Pruebas con usuarios

Observamos cómo usan el asistente personas reales y dónde se frustran.

Criterios de calidad a medida

Definimos qué significa que funcione bien en tu caso y cómo medirlo de forma continua.

Evaluadores a medida

Creamos evaluadores automáticos ajustados a tus criterios para revisar cada nueva versión sin empezar de cero.

Propuesta de diseño conversacional

A partir del diagnóstico, proponemos cambios concretos en diálogos, instrucciones y personalidad.

Riesgo y transparencia

Revisamos cómo avisa de que es una IA y si se comporta de acuerdo con el Reglamento europeo de IA (AI Act), qué hace con temas sensibles y cuándo deriva a una persona.

Cómo trabajamos

01

Explorar

Entendemos el reto y revisamos qué puede hacer hoy la tecnología en tu caso, en tu idioma y con tus datos.

02

Prototipar

Construimos lo mínimo necesario para validar la idea con personas reales.

03

Pilotar

Lo probamos en tu organización, medimos y ajustamos.

04

Transferir

Documentamos y formamos a tu equipo para que pueda seguir evolucionándolo.

Qué se entrega

  • Diagnóstico con ejemplos reales
  • Batería de escenarios de prueba
  • Criterios y métricas de calidad
  • Plan de mejora priorizado

Para quién

  • Empresas con asistentes o agentes en producción
  • Equipos a punto de lanzar un agente
  • Sectores regulados o con usuarios vulnerables

Proyectos relacionados

Todos los proyectos
Proyecto

Evaluación y personalidad de los chatbots de un portal inmobiliario

Evaluación de los dos chatbots de ayuda de un portal inmobiliario y taller para definir su personalidad.

Proyecto

Sanitas Mayores: Alexa en residencias

Acompañamos a Sanitas Mayores en la llegada de Alexa a sus residencias: casos de uso, diseño de conversaciones para personas mayores e integración con su inteligencia artificial, SanIA.

Proyecto

Clevergy: revisión del diseño conversacional

Revisamos el asistente de voz de Clevergy, una plataforma para entender el consumo eléctrico de casa, y propusimos mejoras de diseño conversacional.

En el laboratorio

Ideas en las que trabajamos. Si encajan con un reto tuyo, podemos pilotarlas juntos.

Preguntas frecuentes sobre evaluación de chatbots y agentes

¿Evaluáis asistentes que no habéis construido vosotros?

Sí. Quien no lo ha construido ve cosas que el equipo ya no ve.

¿Tenéis una herramienta de evaluación?

Estamos explorando una plataforma de evaluación de conversaciones. Mientras tanto lo ofrecemos como servicio y, si te interesa, podemos pilotarla contigo.

¿Qué necesitáis para evaluar nuestro asistente?

Acceso al asistente, en producción o en pruebas, y si es posible una muestra de conversaciones reales anonimizadas. Con eso definimos contigo qué significa que funcione bien en tu caso y preparamos los escenarios de prueba.

¿Cuánto dura una evaluación?

Depende del número de asistentes y de canales (voz, texto) y de si incluye pruebas con usuarios. En un portal inmobiliario evaluamos dos chatbots y cerramos con un taller de personalidad, un informe de recomendaciones e indicadores de calidad.

¿Os sirve una evaluación automática con otro modelo de IA?

Como apoyo, sí: los evaluadores automáticos permiten revisar cada versión sin empezar de cero. Pero hay que ajustarlos a tus criterios y contrastarlos con revisión humana, porque un modelo que evalúa a otro también se equivoca.

Servicios

¿Tienes un reto de voz o de conversación?

Cuéntanos qué quieres conseguir. Si no somos el equipo adecuado, te lo diremos.