Evaluar agentes
Trayectoria vs outcome, pass^k, golden tasks con verificador de estado, simuladores de usuario y observabilidad del agente.
Evaluar agentes: trayectoria, outcome y por qué pass^k lo cambia todo
Evaluar un agente no es juzgar una respuesta: es juzgar una trayectoria que muta un entorno. No-determinismo compuesto, pass^k, outcome vs camino y costo como SLO.
Satélites · profundizan el pilar, en orden
- 02
Golden tasks y verificadores de estado: el oráculo confiable de un agente
El oráculo de una eval de agente no es el juicio de un modelo: es un verificador con código. Golden tasks, pass^k con cota de Wilson y un gate que se valida solo.
Intermedio–Avanzado 7 min evalsagentesquality-engineering - 03
Simuladores de usuario: evaluar agentes conversacionales sin humanos
Un agente que conversa no tiene una respuesta única que verificar. El patrón tau-bench: usuario simulado, reglas como oráculo y un simulador que también se testea.
Avanzado 7 min evalsagentesquality-engineering - 04
Observabilidad de agentes: el trace como evidencia de lo que no se reproduce
Un fallo de agente no se reproduce cuando lo vas a mirar. El trace es su única evidencia: spans por turno y tool-call, OpenTelemetry para GenAI y presupuesto como SLO.
Intermedio–Avanzado 7 min observabilidadagentesevals