IA aplicada y evaluación de calidad
Evaluar sistemas no deterministas: evals, RAG y abstención.
Evaluación continua y gobernada de sistemas de IA: por qué un prompt, una respuesta de oro y un promedio no son una estrategia de calidad
Cómo diseñar evals versionadas, gates en CI, métricas por slice y decisiones de lanzamiento para una aplicación con IA, usando el asistente ficticio Nexo Quality Coach: interno, de solo lectura y sobre datos sintéticos.
Satélites · profundizan el pilar, en orden
- 02
Seguridad de asistentes LLM/RAG: cómo evaluar prompt injection, fuga de datos y abuso de herramientas
Prompt injection directa e indirecta, fuga de información, filtración del system prompt y exceso de agencia: cómo diseñar evals de seguridad para un asistente con IA usando la taxonomía OWASP 2025, con datos sintéticos y sin recetas para eludir salvaguardas.
Intermedio–Avanzado 13 min ai-securityllmprompt-injection - 03
RAG bajo evaluación: recuperación, citas verificables y el derecho a abstenerse
Por qué una cita no vuelve verdadera una respuesta, cómo medir calidad de recuperación y groundedness por separado, y por qué abstenerse puede ser la respuesta correcta. Con el asistente sintético y de solo lectura Nexo Quality Coach.
Intermedio–Avanzado 11 min ragretrievalgroundedness - 04
Cómo se testea algo que no siempre responde igual: evals para aplicaciones con LLM
Un LLM puede dar dos respuestas distintas a la misma pregunta y las dos estar bien. Cómo se construye un harness de evaluación con golden dataset, scorers y LLM-as-judge para ponerle una vara de calidad medible.
Intermedio–Avanzado 7 min evalsllm-evaluationquality-engineering
Código que implementa esta colección
La puerta de entrada: el espectro de autonomía, la evolución 2022–2026 y el glosario que evita discusiones vacías.