GuíaIntermedio

Guía de Frameworks de Evaluación

Domina la evaluación de sistemas de AI — desde métricas para chat, RAG y agents hasta LLM-as-judge, RAGAS, TruLens y pipelines de evaluación en producción. Esta guía te enseña a construir golden datasets, implementar evaluación específica por dominio para chatbots, pipelines RAG y agentes de AI, automatizar la evaluación con LLM judges calibrados, y deployar monitoring continuo con integración CI/CD y detección de regresiones. Para AI Engineers que ya construyen sistemas y necesitan saber si realmente funcionan bien.

64
lecciones
8
módulos
Inglés · Español
disponible en
certificado
Incluido en el Club
acceso
NIEVA

Resultados

Lo que vas a poder hacer

  • Entender por qué la evaluación es el gap más crítico en AI Engineering y adoptar evaluation-driven development
  • Dominar la taxonomía de métricas: reference-based (BLEU, ROUGE, BERTScore), reference-free, semánticas y custom
  • Diseñar golden datasets profesionales con estrategias de annotation, synthetic data y versionado
  • Evaluar chatbots con métricas de response quality, safety checks, evaluación multi-turn y TruLens
  • Evaluar pipelines RAG con RAGAS: faithfulness, answer relevancy, context precision y recall
  • Evaluar agentes de AI con trajectory evaluation, tool call accuracy y métricas de task completion
  • Implementar LLM-as-judge con prompts calibrados, mitigación de sesgo, pairwise comparison y multi-judge consensus
  • Construir pipelines de evaluación en producción con CI/CD gates, monitoring continuo, regression detection y alerting

Antes de empezar

Qué necesitas traer

Es para ti si...

  • AI Engineers que construyen sistemas de chat, RAG o agents y necesitan medir su calidad de forma rigurosa
  • Developers que deployean sistemas de AI a producción sin saber si realmente funcionan bien
  • Ingenieros que necesitan implementar evaluación en el pipeline CI/CD de su empresa
  • Equipos en transición de "evaluación por vibes" a métricas de calidad automatizadas y data-driven
  • Profesionales que quieren entender LLM-as-judge, RAGAS y TruLens para uso en producción

Requisitos y materiales

  • Completar la Guía de Advanced RAG Techniques (#8) o experiencia construyendo pipelines RAG
  • Completar la Guía de LangChain & LangGraph (#9) o experiencia equivalente con el framework
  • Completar la Guía de Building AI Agents (#11) o experiencia construyendo agentes con tool use
  • Python intermedio (funciones, clases, async, Pydantic básico)
  • Experiencia con al menos un sistema de AI en desarrollo o producción
  • Al menos una API key de proveedor LLM (OpenAI recomendado)
  • Python 3.11+ instalado

Contenido

El temario, módulo por módulo

Abre cualquiera para ver sus lecciones.

  • 1. Introducción: El Problema que Nadie Quiere Resolver
  • 2. El Evaluation Gap en AI Engineering
  • 3. Tipos de Evaluación: Offline, Online, Human-in-the-Loop
  • 4. Evaluación vs Testing vs Monitoring
  • 5. El Costo de No Evaluar
  • 6. Evaluation-Driven Development
  • 7. De "Vibes" a Métricas: El Mindset Shift
  • 8. Proyecto: Primer Pipeline de Evaluación End-to-End

  • 1. Introducción: No Todas las Métricas Miden lo Mismo
  • 2. Métricas Reference-Based: BLEU, ROUGE, METEOR
  • 3. Métricas Semánticas: BERTScore, Cosine Similarity, STS
  • 4. Métricas Reference-Free: Evaluar Sin Respuesta Correcta
  • 5. Métricas de Clasificación Aplicadas a AI
  • 6. Métricas de Generación de Texto
  • 7. Diseñar Métricas Custom
  • 8. Proyecto: Comparador de Métricas

  • 1. Introducción: Sin Datos de Evaluación, No Hay Evaluación
  • 2. ¿Qué es un Golden Dataset?
  • 3. Diseño de Test Cases Efectivos
  • 4. Estrategias de Annotation
  • 5. Synthetic Data para Evaluación
  • 6. Versionado y Mantenimiento de Golden Datasets
  • 7. Test Suites como Contrato de Calidad
  • 8. Proyecto: Golden Dataset Profesional

  • 1. Introducción: Evaluar Conversaciones es Difícil
  • 2. Response Quality Metrics
  • 3. Coherencia y Relevancia Contextual
  • 4. Safety, Toxicity y Guardrails
  • 5. Evaluación Multi-Turn
  • 6. Proxies de Satisfacción del Usuario
  • 7. TruLens para Evaluación de Chat
  • 8. Proyecto Evolutivo: Evaluation Suite para Chatbot

  • 1. Introducción: RAG Sin Evaluación es una Caja Negra
  • 2. RAG Failure Modes
  • 3. Faithfulness: ¿La Respuesta se Basa en el Contexto?
  • 4. Answer Relevancy: ¿La Respuesta Responde la Pregunta?
  • 5. Context Precision y Context Recall: Evaluando el Retriever
  • 6. RAGAS Framework Deep Dive
  • 7. Evaluación End-to-End de RAG
  • 8. Proyecto Evolutivo: RAG Evaluation Suite

  • 1. Introducción: Los Agentes Son los Sistemas Más Difíciles de Evaluar
  • 2. Agent Failure Modes
  • 3. Trajectory Evaluation
  • 4. Tool Call Accuracy: Precisión, Recall y Corrección de Argumentos
  • 5. Task Completion y Reasoning Quality
  • 6. Evaluación de Sistemas Multi-Agente
  • 7. Agent Benchmarks y Datasets
  • 8. Proyecto Evolutivo: Agent Evaluation Suite

  • 1. Introducción: Usar un LLM para Evaluar otro LLM
  • 2. Qué es LLM-as-Judge
  • 3. Judge Prompt Engineering
  • 4. Single-Point Grading vs Pairwise Comparison
  • 5. Calibración y Sesgo en LLM Judges
  • 6. Multi-Judge y Consensus
  • 7. Pipelines de Evaluación Automatizada
  • 8. Proyecto Evolutivo: LLM-as-Judge Pipeline

  • 1. Introducción: Evaluación No es un Evento, es un Proceso
  • 2. Evaluation en CI/CD
  • 3. Monitoring Continuo de Calidad
  • 4. Regression Detection y Alerting
  • 5. A/B Testing para Sistemas de AI
  • 6. Observability con LangSmith y TruLens
  • 7. Arquitectura de Evaluación en Producción
  • 8. Proyecto Final: Production AI Evaluation Platform

Dónde encaja

Esta guía es parte de algo más grande

Se estudia dentro de estos programas, con acompañamiento y fechas.

Dudas frecuentes

Lo que suele preguntarse

Empieza cuando quieras

Reseñas

Lo que dicen los estudiantes

Estas reseñas son de estudiantes inscritos que completaron al menos el 50% del curso. Moderamos las reseñas solo por motivos de contenido (spam, lenguaje ofensivo, datos personales), nunca por ser críticas o negativas.

Aún no hay reseñas aprobadas.

¡Sé el primero en compartir tu experiencia!