Agentes 05 · Serie de agentes

Evaluar agentes

Trayectoria vs outcome, pass^k, golden tasks con verificador de estado, simuladores de usuario y observabilidad del agente.

4 artículos · ~31 min de lectura ·1 repo de soporte
Pilar · empezá acá Intermedio–Avanzado

Evaluar agentes: trayectoria, outcome y por qué pass^k lo cambia todo

Evaluar un agente no es juzgar una respuesta: es juzgar una trayectoria que muta un entorno. No-determinismo compuesto, pass^k, outcome vs camino y costo como SLO.

Leer el pilar 10 min

Satélites · profundizan el pilar, en orden

  1. 02

    Golden tasks y verificadores de estado: el oráculo confiable de un agente

    El oráculo de una eval de agente no es el juicio de un modelo: es un verificador con código. Golden tasks, pass^k con cota de Wilson y un gate que se valida solo.

    Intermedio–Avanzado 7 min evalsagentesquality-engineering
  2. 03

    Simuladores de usuario: evaluar agentes conversacionales sin humanos

    Un agente que conversa no tiene una respuesta única que verificar. El patrón tau-bench: usuario simulado, reglas como oráculo y un simulador que también se testea.

    Avanzado 7 min evalsagentesquality-engineering
  3. 04

    Observabilidad de agentes: el trace como evidencia de lo que no se reproduce

    Un fallo de agente no se reproduce cuando lo vas a mirar. El trace es su única evidencia: spans por turno y tool-call, OpenTelemetry para GenAI y presupuesto como SLO.

    Intermedio–Avanzado 7 min observabilidadagentesevals

Código que implementa esta colección

esc
↑↓ navegar abrir