Un agente se evalúa como un sistema, no solo como una conversación. La prueba debe cubrir la calidad de la respuesta, la selección y ejecución de herramientas, los permisos, la resistencia a entradas adversas, la derivación humana y el efecto real sobre el proceso empresarial.
APLICABILIDAD
¿Dónde importa esta decisión?
- Agentes de atención
- Asistentes internos
- Automatización de operaciones
Definir escenarios antes de elegir métricas
La evaluación comienza con recorridos reales: una solicitud normal, información incompleta, datos contradictorios, una acción prohibida y una excepción que requiere intervención humana. Cada escenario necesita una respuesta o acción esperada y un criterio explícito para aprobar, rechazar o derivar.
Un promedio general puede ocultar fallos graves. Conviene separar resultados por tipo de solicitud, nivel de riesgo y sistema afectado, y conservar un conjunto de casos estable para detectar regresiones después de cambiar el modelo, las instrucciones o una herramienta.
Evaluar acciones además de respuestas
Cuando el agente usa herramientas, una frase correcta no basta. La prueba debe verificar si eligió la herramienta adecuada, construyó parámetros válidos, respetó permisos, interpretó el resultado y evitó repetir una operación con efectos como enviar, cobrar, eliminar o modificar un registro.
Las acciones de mayor impacto deben usar permisos mínimos, confirmaciones y límites independientes del modelo. El registro de cada paso necesita relacionar la entrada, la decisión, la llamada a la herramienta, su resultado y la eventual intervención humana para que una revisión posterior sea posible.
Pasar a producción por etapas
Una secuencia prudente comienza con datos de prueba, continúa con observación sin ejecutar, avanza a un grupo reducido con acciones reversibles y solamente después amplía usuarios o permisos. Cada etapa debe tener umbrales de calidad, costo, latencia, incidentes y derivaciones definidos antes de comenzar.
La evaluación continúa en producción con muestras revisadas, alertas y análisis de fallos. Un cambio de modelo, fuente, prompt, permiso o API puede alterar el comportamiento, por lo que debe activar pruebas de regresión y una decisión documentada sobre mantener, revertir o ampliar el despliegue.
- Entorno de prueba aislado
- Modo de observación sin efectos
- Acciones reversibles y permisos mínimos
- Monitoreo y regresión después de cada cambio
RECOMENDACIÓN DIGITAL MEDIA IA
Aprobar el agente por capacidad y nivel de riesgo, no con una sola puntuación global; ninguna acción empresarial sensible debería habilitarse sin casos de prueba, trazabilidad, permisos mínimos y una ruta de recuperación comprobada.
- El proceso tiene responsables, resultados esperados y un conjunto representativo de solicitudes y excepciones.
- La organización no puede auditar acciones, limitar permisos ni asumir la atención de las derivaciones humanas.
ENTIDADES ANALIZADAS
FUENTES
Referencias utilizadas.
- EvalsOpenAI Developers
- Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence ProfileNational Institute of Standards and Technology
PREGUNTAS FRECUENTES
Respuestas breves para decidir.
¿Qué acciones puede ejecutar el agente y cuáles requieren aprobación?
Deben definirse herramientas, datos y límites por tarea. Acciones sensibles o de alto impacto pueden requerir aprobación independiente del modelo. El diseño no debe conceder acceso general a sistemas solo por comodidad; cada capacidad se prueba antes de habilitarla.
¿Cómo se comprueba que responde correctamente?
Con escenarios representativos y criterios explícitos para respuestas, herramientas y efectos. Incluye información ausente, contradicciones, solicitudes prohibidas y fallos de integración. Una conversación de demostración no basta; las evaluaciones deben repetirse cuando cambian modelo, fuentes, instrucciones o permisos.
¿Qué ocurre si no encuentra información confiable?
Debe reconocer el límite y pedir contexto o derivar según reglas definidas. No conviene rellenar vacíos con respuestas plausibles. La prueba debe verificar que el sistema se detiene cuando falta evidencia y comunica qué información necesita para continuar.