Índice del artículo
Qué es
Una evaluación es una lista de casos de prueba con su resultado esperado, que corres para ver si la IA sigue haciendo bien su trabajo. En lugar de confiar «porque se ve bien», pruebas: le das cada caso y comparas lo que contesta con lo que debía contestar.
No es una nota académica. Es el mismo control de calidad que harías con cualquier empleado nuevo: un puñado de tareas de muestra, corregidas contra lo que esperas.
Explicado fácil
Piensa en la prueba de manejo antes de comprar un coche. No lees el folleto y firmas: lo sacas, lo frenas, lo metes en una curva. Una evaluación es eso, pero para un asistente de IA: lo pones a hacer las tareas que te importan y ves cómo responde.
Ejemplo práctico
Una tienda en línea usa un agente para responder preguntas de clientes sobre sus pedidos. Antes de cambiar de modelo o de encargo, junta un puñado de casos: una pregunta sobre un pedido en camino, otra sobre un reembolso, otra sobre un dato que no existe.
Corre la lista con el agente nuevo y compara: ¿responde lo correcto en cada caso, pide el dato que falta en vez de inventarlo, y remite a una persona cuando no puede? Si algo falla, se ve antes de que lo vea un cliente.
Así no
Cambiar de modelo o de encargo y darlo por bueno porque la primera respuesta «se ve bien».
Así sí
Tener una lista corta de casos con su respuesta esperada y correrla antes de confiar en el cambio.
Una evaluación no elimina el riesgo: te dice qué falla antes de que le falle a un cliente.
Por qué te importa
Porque un cambio pequeño —otro modelo, otro encargo, otra herramienta— puede romper lo que ya funcionaba, y no siempre se nota en la primera prueba. La evaluación es la manera barata de atrapar ese retroceso antes de que toque a un cliente o a un reporte.
Y porque te da criterio: con una lista de casos, la decisión de «¿está listo?» deja de ser impresión y pasa a ser un conteo de cuáles pasaron y cuáles no.
El error típico
Creer que una evaluación te garantiza que la IA no va a fallar. No: evalúa los casos que pusiste, puede fallar en otros que no pensaste, y pasar una prueba no garantiza repetir el resultado. Reduce el riesgo, no lo borra.
El error contrario: no evaluar nada y enterarte de que algo se rompió cuando un cliente lo reporta.
No lo confundas con
Una barandilla. La barandilla es una regla que limita lo que la IA puede hacer mientras trabaja; la evaluación es la prueba que corres antes de usar el sistema y durante su operación. Se complementan: la barandilla frena, la evaluación comprueba.
Un registro de auditoría. Evalúa antes de usar el sistema y durante su operación; los registros también pueden aportar casos para evaluarlo.