Una evaluación comprueba si el flujo configurado de un agente cumple su función, usa solo la información y las acciones permitidas y maneja los fallos de forma segura. Por ejemplo, imagina un agente de incorporación de proveedores de Northstar Supplies al que se le pide preparar un informe para Compras a partir de un expediente de incorporación, una lista vigente para incorporar proveedores y la ficha actual del proveedor. Debe señalar la falta de un certificado de seguro y redactar una solicitud para revisión; nunca debe aprobar al proveedor ni enviar la solicitud por su cuenta.
Cuadro ilustrativo, no representa resultados medidos.
En este ejemplo:
- Expediente habitual: Supera las cuatro comprobaciones.
- Falta evidencia: Produce un borrador útil dentro de sus límites, pero hace falta revisar su procedimiento y recuperación.
- Registros contradictorios: Falla porque el borrador no resuelve ni remite claramente la discrepancia, aunque respeta los permisos.
- Fallo de herramienta: No puede completar el informe solicitado, así que el resultado falla. El procedimiento, los límites y la recuperación pasan porque informa del error de consulta y remite el caso de forma segura.
Una transferencia segura y una tarea completada son resultados distintos.
Para esta decisión ilustrativa:
- Detener: Una infracción de permisos o un estado desconocido de una acción con efectos secundarios bloquea la ejecución; resuélvelo antes de continuar.
- Corregir: Una brecha corregible de evidencia o derivación debe corregirse y probarse de nuevo antes de ampliar.
- Ampliar: Considéralo solo cuando los casos afectados cumplan sus expectativas escritas y la persona responsable acepte la evidencia.
Decisión para estos resultados: corregir antes de ampliar. El caso de registros contradictorios no deriva con claridad, y el de evidencia faltante requiere revisar el procedimiento y la recuperación. El fallo de herramienta supera las comprobaciones de procedimiento, límites y recuperación aunque el resultado de negocio siga incompleto.
Define el resultado esperado
Antes de probar, anota qué debe incluir una ejecución correcta y qué no debe hacer. En este ejemplo, el agente debe comparar el expediente con la lista, fundamentar cada hallazgo en los materiales proporcionados, señalar el certificado faltante y dejar la aprobación y el envío del mensaje en manos de una persona. Un informe bien redactado que invente evidencia o envíe la solicitud cuenta como una ejecución fallida, aunque parezca convincente.
Designa a una persona responsable del flujo de trabajo y a otra que pueda juzgar si el informe es útil. Acuerden qué errores impiden iniciar un piloto, cuáles se pueden gestionar mediante revisión y cuáles conviene registrar. Fijen umbrales acordes con las consecuencias y la capacidad de revisión del equipo.
Registra estas expectativas en una definición concreta del trabajo de un agente para mantener fijos la tarea, la evidencia, las acciones permitidas y las condiciones de parada durante las pruebas.
Prueba un conjunto representativo
Usa un conjunto pequeño de expedientes seguros y representativos:
- Uno completo.
- Uno al que le falte el certificado.
- Uno con datos contradictorios.
- Uno con un archivo adjunto ilegible.
Registra el resultado esperado para cada expediente y por qué es correcto. Incluye distintas formas de hacer una solicitud y peticiones que queden fuera del trabajo asignado al agente. Usa datos sintéticos o debidamente protegidos en el entorno de prueba.
Mantén fija la tarea y los criterios de éxito mientras cambian los expedientes. Así será más fácil detectar si un resultado cambió por la evidencia, las instrucciones o las herramientas configuradas. Repite las ejecuciones cuando una misma entrada pueda producir resultados distintos, y revisa tanto los pasos como el informe final.
Inspecciona la ejecución y el borrador
Comprueba qué fuentes leyó el agente, qué datos extrajo, si usó la consulta permitida y si se detuvo antes de aprobar o enviar algo. Revisa el borrador para detectar datos faltantes, afirmaciones sin respaldo y falta de claridad sobre quién se encarga del siguiente paso.
Resultado ilustrativo basado en registros ficticios de Northstar Supplies:
Borrador de incorporación: Northstar Supplies
- Hallazgo: Falta un certificado de seguro vigente en el expediente de incorporación.
- Solicitud en borrador: «Envíe un certificado de seguro vigente para que el equipo de Compras pueda continuar con la revisión».
- Decisión: El proveedor aún no está aprobado; una persona revisora debe aprobar cualquier solicitud que se envíe.
Esta muestra no representa un registro real de un proveedor ni un resultado medido de un sistema. En una prueba, confirma que el hallazgo sobre el documento faltante coincida con el expediente y la lista, que el mensaje siga siendo un borrador y que no se haya aprobado ni enviado nada.
Pon a prueba los fallos y evalúa el resultado
Prueba qué ocurre cuando falta una fuente, un archivo es ilegible, una herramienta falla, los registros se contradicen, un documento contiene una instrucción irrelevante o una aprobación no recibe respuesta o es rechazada. El agente debe explicar qué no pudo verificar y remitir el caso según lo previsto.
Evalúa por separado cuatro aspectos:
Desplázate horizontalmente para ver todas las columnas.
| Medida | Qué comprobar |
|---|---|
| Resultado | La precisión y utilidad del informe. |
| Procedimiento | Si el agente siguió la secuencia permitida. |
| Límites | Si respetó los permisos. |
| Recuperación | Si se recuperó del fallo o transfirió el caso con claridad. |
Usa comprobaciones directas para verificar los campos requeridos y que los registros no hayan cambiado; recurre a una persona para los juicios que exigen conocimiento del tema. Compara las calificaciones automatizadas con las decisiones de quienes revisan antes de usarlas para clasificar ejecuciones.
Vuelve a probar antes de ampliar el acceso
Mantén juntos el conjunto de tareas, la versión del agente, la configuración, los resultados, las personas revisoras, las limitaciones y la decisión. Cuando algo cambie, vuelve a ejecutar el caso que reveló el problema y otros similares. Considera los resultados como evidencia de la configuración y los escenarios probados; después, identifica qué todavía necesita revisión humana antes de ampliar el piloto.
Para las comprobaciones relacionadas, consulta la guía de gobernanza y control de costos para agentes de IA y la guía sobre permisos y límites.